RAG テキストチャンカー (Embedding 用分割)
長文テキストを Embedding / RAG に投入しやすい単位にチャンク分割。文字数固定 / トークン固定 / 段落単位 / Markdown 見出し単位の 4 戦略、オーバーラップ調整、各チャンクの可視化、JSON / JSONL / Markdown エクスポート対応。
完全無料
登録不要
ブラウザ完結
即ダウンロード
5 言語対応
ダークモード
チャンク数
0
平均サイズ
0
最大
0
📖 つまずきやすいポイント
長文を Embedding に投入しやすい単位へ分割します。処理はブラウザ内で完結し、テキストは送信されません。RAG の検索精度が出ない原因は、ほとんどが埋め込みモデルではなく分割の仕方にあります。答えが 2 つのチャンクにまたがって切れている、見出しと本文が別々のチャンクになって文脈が消えている、といった単純な理由が大半です。
| ケース | 何が起きるか | どうする |
|---|---|---|
| チャンクサイズを勘で決めている | 小さすぎると1 チャンクに答えが収まらず、大きすぎると1 チャンクの中で話題が複数混ざってベクトルがぼやけます。埋め込みは文書全体の平均的な方向を表すため、無関係な話題が混ざるほど、どの質問にも中途半端に似たベクトルになります。 | 起点は 512〜1,024 トークン、オーバーラップ 10〜20% です。そのうえで「想定する質問に対する答えが、平均して何文字あるか」を実際に数えてください。FAQ のように答えが 2〜3 文なら 256 で十分ですし、手順書のように答えが節まるごとなら 1,024 でも足りません。トークン数カウンターで文字数とトークン数の関係を掴んでおくと決めやすくなります。 |
| 文字数で機械的に切っている | 固定長で切ると、文の途中、表の途中、コードブロックの途中で分断されます。とくに手順書やリファレンスでは、表のヘッダー行と中身が別チャンクになった瞬間に、そのチャンク単体では何の表か分からなくなります。検索でヒットしても、LLM に渡した時点で意味が復元できません。 | 構造の切れ目を優先します。Markdown なら見出し (##) を境界にし、それでも長ければ段落、さらに文、という順で下ろしていくのが定石です。加えて、各チャンクの先頭に「文書タイトル > 章 > 節」のパンくずを付け足すと精度が大きく上がります。チャンク単体で読んでも、それが何についての記述かが分かるからです。 |
| 検索がヒットしないので埋め込みモデルを変える | モデルの差より先に効くのは、質問と文書の語彙のずれです。ユーザーは「ログインできない」と聞き、文書には「認証エラー時の対処」と書いてある、という状況では、意味的には近くてもベクトルの距離は思ったほど縮みません。固有名詞や型番のような文字列一致が要る検索は、ベクトル検索が最も苦手とする領域でもあります。 | ハイブリッド検索にしてください。BM25 のようなキーワード検索とベクトル検索を並列に走らせ、結果を統合 (Reciprocal Rank Fusion など) します。型番や人名はキーワード側が確実に拾い、言い換えはベクトル側が拾います。それでも足りなければ、チャンクごとに「このチャンクが答えられる質問」を LLM に 3 つ生成させて一緒に埋め込む手法が効きます。コストは Embedding コスト試算で先に見積もれます。 |
チャンク分割は一度決めて終わりにできる設定ではありません。実際に使われた質問のログを取り、答えられなかったものを見て、その原因が「そもそも該当チャンクが検索で上位に来ていない」のか「上位には来たが情報が途中で切れている」のかを切り分けてください。前者なら検索方式、後者なら分割の粒度の問題です。この 2 つを混同したまま設定をいじると、いつまでも改善しません。
📖 使い方
-
1
テキスト貼付PDF 抽出後、Markdown ドキュメント、ブログ記事など
-
2
戦略選択 + サイズ調整文字数 / トークン / 段落 / 見出し から選択。Embedding モデルの context 上限に合わせる
-
3
JSON / JSONL でエクスポートchunks 配列 + メタデータを Embedding pipeline に渡す
❓ よくある質問
チャンクサイズの目安?
Embedding モデル: 256-512 トークン (OpenAI text-embedding-3-small) / 512-1024 (Voyage / Cohere)。意味の塊を保てる範囲で
オーバーラップは何 % にすべき?
チャンクサイズの 10-20% が定番。境界で文脈が切れることによる検索 miss を防ぐ
Markdown 見出し戦略の利点は?
セマンティックな塊で切れるので、検索精度が固定サイズより高くなる場合が多い (特にドキュメント / コード / FAQ)
🐛 このツールで問題が発生しましたか?
完全無料・登録不要。再現手順だけでも結構です。届いたご報告は運営者に直接届き、修正の参考にします。
✅
ご報告ありがとうございます!
運営者に届きました。改善の参考にさせていただきます。