TokenPig
Preparação de documentos para RAG

Prepare documentos mais limpos para pipelines de RAG

Transforme arquivos de escritório variados em Markdown consistente antes do chunking, dos embeddings e da recuperação.

Sem cadastro nas primeiras conversões · Arquivos processados temporariamente · Valem os limites do seu plano

Solte seu documento aquiPDF · DOCX · PPTX · XLSX e maisAbrir o conversor
Por que esta página existe

Um sistema de recuperação não consegue recuperar a estrutura perdida ou contaminada durante a ingestão. Cabeçalhos repetidos, ordem de leitura quebrada e extração inconsistente podem produzir chunks fracos antes mesmo de criar os embeddings.

O TokenPig oferece uma camada simples de pré-processamento: converta os documentos suportados em Markdown legível, inspecione o resultado e depois passe o texto limpo ao seu próprio pipeline de chunking e indexação.

O que você recebe

Um caminho mais limpo do arquivo ao contexto útil

Formato de origem consistente

Normalize PDFs, arquivos do Word, slides e planilhas em uma representação de texto compartilhada.

Qualidade de ingestão visível

Revise o Markdown real antes de ele entrar em um repositório vetorial ou índice de recuperação.

Melhores limites de chunk

Use títulos e listas como sinais em vez de depender só de contagens arbitrárias de caracteres.

Menos ruído a jusante

Remova conteúdo repetido que pode gerar resultados de recuperação duplicados ou enganosos.

Como usar

Poucos passos, com uma revisão antes de confiar no resultado

  1. 01

    Selecione documentos representativos

    Teste os exemplos mais difíceis do seu corpus, não só arquivos de demonstração limpos.

  2. 02

    Converta para Markdown

    Normalize a fonte preservando títulos, listas e tabelas úteis.

  3. 03

    Adicione metadados

    Anexe origem, data, nível de acesso, tipo de documento e identificadores estáveis na sua camada de ingestão.

  4. 04

    Faça o chunking e avalie

    Crie os chunks, rode testes de recuperação e verifique se os trechos certos aparecem para perguntas reais.

Bom encaixe

Útil quando você precisa

  • Busca interna de políticas e procedimentos
  • Recuperação de conhecimento para suporte ao cliente
  • Assistentes de documentação técnica
  • Bibliotecas de pesquisa e protótipos de inteligência documental
Limitações

O que revisar com honestidade

  • O TokenPig é uma ferramenta de pré-processamento, não um banco de dados vetorial completo, um serviço de embeddings nem um avaliador de recuperação.
  • A conversão para Markdown não substitui o design de metadados, o controle de acesso, a deduplicação ou a gestão de versões.
  • Tabelas, diagramas e digitalizações podem exigir extração especializada para casos de uso críticos.
  • A qualidade dos chunks deve ser avaliada contra perguntas reais e respostas esperadas.
Teste você mesmo

Use uma amostra conhecida antes do seu próprio arquivo

Baixe a amostra, passe pelo TokenPig e inspecione o Markdown você mesmo antes de confiar documentos importantes.

FAQ

Perguntas específicas deste fluxo

O Markdown é obrigatório para RAG?

Não. Sistemas de RAG podem ingerir muitos formatos, mas o Markdown é útil por ser legível, estruturado e fácil de processar com ferramentas padrão.

O TokenPig cria embeddings?

Não. Esta página foca em preparar o conteúdo de origem antes das suas próprias etapas de chunking, embeddings e indexação.

Como devo fazer o chunking do Markdown?

Comece por limites semânticos como títulos e seções, e aplique limites de tamanho e sobreposição só onde for preciso. Avalie a recuperação em vez de supor um tamanho de chunk universal.

Quais metadados devo manter?

No mínimo, mantenha um ID de origem estável, título, versão do documento, data, permissões e um link de volta ao arquivo original.

Posso processar um corpus grande?

O fluxo público atual foi desenhado em torno dos limites de conversão de documentos. O processamento em lote e os recursos de API devem corresponder ao plano e às funcionalidades realmente disponíveis quando você implantar o fluxo.

Documentos mais limpos. Melhor contexto.

Preparar um documento

Comece com um arquivo real, inspecione o resultado e guarde a fonte original para verificação.

Experimente o TokenPig grátis