Formato de origen consistente
Normalizá PDFs, archivos de Word, diapositivas y planillas en una representación de texto compartida.
Convertí archivos de oficina variados en Markdown consistente antes del chunking, los embeddings y la recuperación.
Sin registro para las primeras conversiones · Archivos procesados temporalmente · Aplican los límites de tu plan
Un sistema de recuperación no puede recuperar la estructura que se perdió o se contaminó durante la ingesta. Los encabezados repetidos, el orden de lectura roto y la extracción inconsistente pueden producir chunks débiles antes de siquiera crear los embeddings.
TokenPig ofrece una capa simple de preprocesamiento: convertí los documentos admitidos en Markdown legible, inspeccioná el resultado y luego pasá el texto limpio a tu propio pipeline de chunking e indexado.
Normalizá PDFs, archivos de Word, diapositivas y planillas en una representación de texto compartida.
Revisá el Markdown real antes de que entre a un almacén de vectores o un índice de recuperación.
Usá títulos y listas como señales en vez de depender solo de conteos de caracteres arbitrarios.
Quitá contenido repetido que puede crear resultados de recuperación duplicados o engañosos.
Probá los ejemplos más difíciles de tu corpus, no solo archivos de demostración limpios.
Normalizá la fuente conservando títulos, listas y tablas útiles.
Adjuntá origen, fecha, nivel de acceso, tipo de documento e identificadores estables en tu capa de ingesta.
Creá los chunks, corré pruebas de recuperación e inspeccioná si aparecen los pasajes correctos ante preguntas reales.
Descargá la muestra, pasala por TokenPig e inspeccioná el Markdown vos mismo antes de confiarle documentos importantes.
No. Los sistemas de RAG pueden ingerir muchos formatos, pero Markdown es útil porque es legible, estructurado y fácil de procesar con herramientas estándar.
No. Esta página se enfoca en preparar el contenido de origen antes de tus propios pasos de chunking, embeddings e indexado.
Empezá por límites semánticos como títulos y secciones, y aplicá límites de tamaño y solapamiento solo donde haga falta. Evaluá la recuperación en vez de asumir un único tamaño de chunk universal.
Como mínimo, conservá un ID de origen estable, título, versión del documento, fecha, permisos y un enlace de vuelta al archivo original.
El flujo público actual está diseñado en torno a los límites de conversión de documentos. El procesamiento por lotes y las capacidades de API deben ajustarse al plan y a las funciones realmente disponibles cuando despliegues el flujo.
Empezá con un archivo real, inspeccioná el resultado y conservá la fuente original para verificar.
Probá TokenPig gratis