TokenPig
Preparación de documentos para RAG

Prepará documentos más limpios para pipelines de RAG

Convertí archivos de oficina variados en Markdown consistente antes del chunking, los embeddings y la recuperación.

Sin registro para las primeras conversiones · Archivos procesados temporalmente · Aplican los límites de tu plan

Soltá tu documento acáPDF · DOCX · PPTX · XLSX y másAbrir el conversor
Por qué existe esta página

Un sistema de recuperación no puede recuperar la estructura que se perdió o se contaminó durante la ingesta. Los encabezados repetidos, el orden de lectura roto y la extracción inconsistente pueden producir chunks débiles antes de siquiera crear los embeddings.

TokenPig ofrece una capa simple de preprocesamiento: convertí los documentos admitidos en Markdown legible, inspeccioná el resultado y luego pasá el texto limpio a tu propio pipeline de chunking e indexado.

Qué obtenés

Un camino más limpio del archivo al contexto útil

Formato de origen consistente

Normalizá PDFs, archivos de Word, diapositivas y planillas en una representación de texto compartida.

Calidad de ingesta visible

Revisá el Markdown real antes de que entre a un almacén de vectores o un índice de recuperación.

Mejores límites de chunk

Usá títulos y listas como señales en vez de depender solo de conteos de caracteres arbitrarios.

Menos ruido aguas abajo

Quitá contenido repetido que puede crear resultados de recuperación duplicados o engañosos.

Cómo usarlo

Unos pocos pasos, con una revisión antes de confiar en el resultado

  1. 01

    Elegí documentos representativos

    Probá los ejemplos más difíciles de tu corpus, no solo archivos de demostración limpios.

  2. 02

    Convertí a Markdown

    Normalizá la fuente conservando títulos, listas y tablas útiles.

  3. 03

    Agregá metadatos

    Adjuntá origen, fecha, nivel de acceso, tipo de documento e identificadores estables en tu capa de ingesta.

  4. 04

    Chunkeá y evaluá

    Creá los chunks, corré pruebas de recuperación e inspeccioná si aparecen los pasajes correctos ante preguntas reales.

Buen encaje

Útil cuando necesitás

  • Búsqueda interna de políticas y procedimientos
  • Recuperación de conocimiento para soporte al cliente
  • Asistentes de documentación técnica
  • Bibliotecas de investigación y prototipos de inteligencia documental
Limitaciones

Qué revisar con honestidad

  • TokenPig es una herramienta de preprocesamiento, no una base de datos vectorial completa, un servicio de embeddings ni un evaluador de recuperación.
  • La conversión a Markdown no reemplaza el diseño de metadatos, el control de acceso, la deduplicación ni la gestión de versiones.
  • Las tablas, diagramas y escaneos pueden requerir extracción especializada para casos de uso críticos.
  • La calidad de los chunks debe evaluarse contra preguntas reales y respuestas esperadas.
Probalo vos mismo

Usá una muestra conocida antes que tu propio archivo

Descargá la muestra, pasala por TokenPig e inspeccioná el Markdown vos mismo antes de confiarle documentos importantes.

FAQ

Preguntas específicas de este flujo

¿Markdown es obligatorio para RAG?

No. Los sistemas de RAG pueden ingerir muchos formatos, pero Markdown es útil porque es legible, estructurado y fácil de procesar con herramientas estándar.

¿TokenPig crea embeddings?

No. Esta página se enfoca en preparar el contenido de origen antes de tus propios pasos de chunking, embeddings e indexado.

¿Cómo debería chunkear el Markdown?

Empezá por límites semánticos como títulos y secciones, y aplicá límites de tamaño y solapamiento solo donde haga falta. Evaluá la recuperación en vez de asumir un único tamaño de chunk universal.

¿Qué metadatos debería conservar?

Como mínimo, conservá un ID de origen estable, título, versión del documento, fecha, permisos y un enlace de vuelta al archivo original.

¿Puedo procesar un corpus grande?

El flujo público actual está diseñado en torno a los límites de conversión de documentos. El procesamiento por lotes y las capacidades de API deben ajustarse al plan y a las funciones realmente disponibles cuando despliegues el flujo.

Documentos más limpios. Mejor contexto.

Preparar un documento

Empezá con un archivo real, inspeccioná el resultado y conservá la fuente original para verificar.

Probá TokenPig gratis