Formato de origem consistente
Normalize PDFs, arquivos do Word, slides e planilhas em uma representação de texto compartilhada.
Transforme arquivos de escritório variados em Markdown consistente antes do chunking, dos embeddings e da recuperação.
Sem cadastro nas primeiras conversões · Arquivos processados temporariamente · Valem os limites do seu plano
Um sistema de recuperação não consegue recuperar a estrutura perdida ou contaminada durante a ingestão. Cabeçalhos repetidos, ordem de leitura quebrada e extração inconsistente podem produzir chunks fracos antes mesmo de criar os embeddings.
O TokenPig oferece uma camada simples de pré-processamento: converta os documentos suportados em Markdown legível, inspecione o resultado e depois passe o texto limpo ao seu próprio pipeline de chunking e indexação.
Normalize PDFs, arquivos do Word, slides e planilhas em uma representação de texto compartilhada.
Revise o Markdown real antes de ele entrar em um repositório vetorial ou índice de recuperação.
Use títulos e listas como sinais em vez de depender só de contagens arbitrárias de caracteres.
Remova conteúdo repetido que pode gerar resultados de recuperação duplicados ou enganosos.
Teste os exemplos mais difíceis do seu corpus, não só arquivos de demonstração limpos.
Normalize a fonte preservando títulos, listas e tabelas úteis.
Anexe origem, data, nível de acesso, tipo de documento e identificadores estáveis na sua camada de ingestão.
Crie os chunks, rode testes de recuperação e verifique se os trechos certos aparecem para perguntas reais.
Baixe a amostra, passe pelo TokenPig e inspecione o Markdown você mesmo antes de confiar documentos importantes.
Não. Sistemas de RAG podem ingerir muitos formatos, mas o Markdown é útil por ser legível, estruturado e fácil de processar com ferramentas padrão.
Não. Esta página foca em preparar o conteúdo de origem antes das suas próprias etapas de chunking, embeddings e indexação.
Comece por limites semânticos como títulos e seções, e aplique limites de tamanho e sobreposição só onde for preciso. Avalie a recuperação em vez de supor um tamanho de chunk universal.
No mínimo, mantenha um ID de origem estável, título, versão do documento, data, permissões e um link de volta ao arquivo original.
O fluxo público atual foi desenhado em torno dos limites de conversão de documentos. O processamento em lote e os recursos de API devem corresponder ao plano e às funcionalidades realmente disponíveis quando você implantar o fluxo.
Comece com um arquivo real, inspecione o resultado e guarde a fonte original para verificação.
Experimente o TokenPig grátis