コンテンツにスキップ

RAG テキストチャンカー (Embedding 用分割)

長文テキストを Embedding / RAG に投入しやすい単位にチャンク分割。文字数固定 / トークン固定 / 段落単位 / Markdown 見出し単位の 4 戦略、オーバーラップ調整、各チャンクの可視化、JSON / JSONL / Markdown エクスポート対応。

完全無料 登録不要 ブラウザ完結 即ダウンロード 5 言語対応 ダークモード
関連: 💰 Embeddings 料金計算 · 🪙 LLM トークン計算
チャンク数
0
平均サイズ
0
最大
0

    

📖 つまずきやすいポイント

長文を Embedding に投入しやすい単位へ分割します。処理はブラウザ内で完結し、テキストは送信されません。RAG の検索精度が出ない原因は、ほとんどが埋め込みモデルではなく分割の仕方にあります。答えが 2 つのチャンクにまたがって切れている、見出しと本文が別々のチャンクになって文脈が消えている、といった単純な理由が大半です。

ケース 何が起きるか どうする
チャンクサイズを勘で決めている 小さすぎると1 チャンクに答えが収まらず、大きすぎると1 チャンクの中で話題が複数混ざってベクトルがぼやけます。埋め込みは文書全体の平均的な方向を表すため、無関係な話題が混ざるほど、どの質問にも中途半端に似たベクトルになります。 起点は 512〜1,024 トークン、オーバーラップ 10〜20% です。そのうえで「想定する質問に対する答えが、平均して何文字あるか」を実際に数えてください。FAQ のように答えが 2〜3 文なら 256 で十分ですし、手順書のように答えが節まるごとなら 1,024 でも足りません。トークン数カウンターで文字数とトークン数の関係を掴んでおくと決めやすくなります。
文字数で機械的に切っている 固定長で切ると、文の途中、表の途中、コードブロックの途中で分断されます。とくに手順書やリファレンスでは、表のヘッダー行と中身が別チャンクになった瞬間に、そのチャンク単体では何の表か分からなくなります。検索でヒットしても、LLM に渡した時点で意味が復元できません。 構造の切れ目を優先します。Markdown なら見出し (##) を境界にし、それでも長ければ段落、さらに文、という順で下ろしていくのが定石です。加えて、各チャンクの先頭に「文書タイトル > 章 > 節」のパンくずを付け足すと精度が大きく上がります。チャンク単体で読んでも、それが何についての記述かが分かるからです。
検索がヒットしないので埋め込みモデルを変える モデルの差より先に効くのは、質問と文書の語彙のずれです。ユーザーは「ログインできない」と聞き、文書には「認証エラー時の対処」と書いてある、という状況では、意味的には近くてもベクトルの距離は思ったほど縮みません。固有名詞や型番のような文字列一致が要る検索は、ベクトル検索が最も苦手とする領域でもあります。 ハイブリッド検索にしてください。BM25 のようなキーワード検索とベクトル検索を並列に走らせ、結果を統合 (Reciprocal Rank Fusion など) します。型番や人名はキーワード側が確実に拾い、言い換えはベクトル側が拾います。それでも足りなければ、チャンクごとに「このチャンクが答えられる質問」を LLM に 3 つ生成させて一緒に埋め込む手法が効きます。コストは Embedding コスト試算で先に見積もれます。

チャンク分割は一度決めて終わりにできる設定ではありません。実際に使われた質問のログを取り、答えられなかったものを見て、その原因が「そもそも該当チャンクが検索で上位に来ていない」のか「上位には来たが情報が途中で切れている」のかを切り分けてください。前者なら検索方式、後者なら分割の粒度の問題です。この 2 つを混同したまま設定をいじると、いつまでも改善しません。

📖 使い方

  1. 1
    テキスト貼付
    PDF 抽出後、Markdown ドキュメント、ブログ記事など
  2. 2
    戦略選択 + サイズ調整
    文字数 / トークン / 段落 / 見出し から選択。Embedding モデルの context 上限に合わせる
  3. 3
    JSON / JSONL でエクスポート
    chunks 配列 + メタデータを Embedding pipeline に渡す

❓ よくある質問

チャンクサイズの目安?
Embedding モデル: 256-512 トークン (OpenAI text-embedding-3-small) / 512-1024 (Voyage / Cohere)。意味の塊を保てる範囲で
オーバーラップは何 % にすべき?
チャンクサイズの 10-20% が定番。境界で文脈が切れることによる検索 miss を防ぐ
Markdown 見出し戦略の利点は?
セマンティックな塊で切れるので、検索精度が固定サイズより高くなる場合が多い (特にドキュメント / コード / FAQ)
🐛 このツールで問題が発生しましたか?

完全無料・登録不要。再現手順だけでも結構です。届いたご報告は運営者に直接届き、修正の参考にします。

※ 不具合再現のため、ブラウザ情報 (UA / 画面サイズ / 言語 / URL) を自動で送信します