Saltar al contenido

Chunker RAG

Dividir texto largo en fragmentos optimizados para ingesta en Embedding / RAG. Soporta 4 estrategias: conteo de caracteres fijo, conteo de tokens fijo, basado en párrafos y basado en encabezados Markdown; incluye ajuste de superposición, visualización de fragmentos y opciones de exportación JSON / JSONL / Markdown.

100% Gratis Sin registro Solo navegador Descarga instantánea 5 idiomas Modo oscuro
Relacionado: 💰 Calculadora Embeddings · 🪙 Tokens LLM
Chunks
0
Promedio
0
Máx
0

    

📖 Dónde se suele tropezar

Divide un documento largo en unidades adecuadas para un modelo de embeddings. Todo ocurre en el navegador y no se envía ningún texto. Cuando la recuperación de un sistema RAG decepciona, la culpa suele ser del troceado y no del modelo de embeddings: la respuesta quedó partida entre dos fragmentos, o un encabezado se separó del texto que introducía y el contexto se fue con él.

Caso Qué ocurre Qué hacer
Elegir el tamaño de fragmento a ojo Demasiado pequeño y la respuesta no cabe en un fragmento; demasiado grande y varios temas comparten fragmento y el vector se difumina. Un embedding representa la dirección media de su texto, así que cuanto más material ajeno mezcles, más se parecerá vagamente a cualquier pregunta y decididamente a ninguna. Empieza en 512–1.024 tokens con un solape del 10–20 % y luego cuenta de verdad cuánto ocupa una respuesta típica en tu corpus. Si las respuestas son dos o tres frases, como en un FAQ, 256 sobra; si una respuesta es una sección entera de un procedimiento, 1.024 se queda corto. Hacerte una idea de la relación caracteres-tokens con el contador de tokens vuelve concreta la decisión.
Cortar sólo por número de caracteres Un corte de longitud fija cae a mitad de una frase, de una tabla o de un bloque de código. En material de procedimientos o de referencia, en cuanto la cabecera de una tabla se separa de sus filas, el fragmento ya no dice de qué trata la tabla. Puede seguir coincidiendo con la consulta, pero cuando llega al modelo el significado es irrecuperable. Respeta primero los límites estructurales. En Markdown, corta por encabezados (##), luego por párrafos si la sección sigue siendo larga, y después por frases. Además, antepón a cada fragmento una migaja: título del documento, capítulo, sección. La precisión sube mucho, porque el fragmento ya dice de qué trata aunque se lea suelto.
Cambiar de modelo de embeddings cuando falla la recuperación Lo que pesa antes que la elección del modelo es la distancia de vocabulario entre la pregunta y el documento. El usuario pregunta por qué no puede iniciar sesión; el documento se titula gestión de errores de autenticación. Están cerca semánticamente, pero los vectores no se acercan tanto como esperarías. Y las consultas que dependen de una cadena exacta —un código de producto, un nombre propio— son justo donde la búsqueda vectorial flojea. Ve a búsqueda híbrida: ejecuta búsqueda por palabras clave tipo BM25 junto a la vectorial y fusiona los rankings, por ejemplo con reciprocal rank fusion. La parte léxica atrapa códigos y nombres con fiabilidad; la vectorial atrapa las paráfrasis. Si aun así no basta, haz que un LLM genere tres preguntas que cada fragmento pueda responder y embébelas junto a él. Calcula antes el coste con la calculadora de coste de embeddings.

El troceado no es un ajuste que se decida una vez y se olvide. Registra las preguntas reales, mira las que fallaron y separa dos causas: el fragmento correcto nunca llegó a los primeros resultados, o sí llegó pero la información estaba cortada. Lo primero es un problema de recuperación; lo segundo, de granularidad. Si los confundes, ningún ajuste te sacará del atasco.

📖 Cómo usar

  1. 1
    Pega texto
    PDF / MD / artículos
  2. 2
    Estrategia + tamaño
    chars/tokens/párrafos/encabezados
  3. 3
    JSON / JSONL
    pipeline embeddings

❓ Preguntas frecuentes

¿Tamaño?
256-512 / 512-1024
¿Solape?
10-20%
¿Por qué encabezados?
Chunks semánticos
🐛 ¿Encontró un problema con esta herramienta?

Gratis, sin registro. Incluso solo los pasos para reproducir ayudan. Los informes van directamente al operador y se usan para corregir.

* Se envía automáticamente la info del navegador (UA / pantalla / idioma / URL) para reproducir