TokenPig
Préparation de documents pour le RAG

Préparez des documents plus propres pour vos pipelines RAG

Transformez des fichiers bureautiques hétérogènes en Markdown cohérent avant le découpage, les embeddings et la recherche.

Pas d'inscription pour les premières conversions · Fichiers traités temporairement · Les limites de votre offre s'appliquent

Déposez votre document iciPDF · DOCX · PPTX · XLSX et plusOuvrir le convertisseur
Pourquoi cette page existe

Un système de recherche ne peut pas récupérer une structure perdue ou polluée pendant l'ingestion. En-têtes répétés, ordre de lecture cassé et extraction incohérente peuvent produire des chunks faibles avant même la création des embeddings.

TokenPig fournit une couche de prétraitement simple : convertissez les documents pris en charge en Markdown lisible, inspectez le résultat, puis passez le texte nettoyé à votre propre pipeline de découpage et d'indexation.

Ce que vous obtenez

Un chemin plus propre du fichier au contexte utile

Format source cohérent

Normalisez PDF, fichiers Word, diapositives et tableurs en une représentation textuelle commune.

Qualité d'ingestion visible

Relisez le Markdown réel avant qu'il n'entre dans un store vectoriel ou un index de recherche.

De meilleures frontières de chunk

Utilisez titres et listes comme signaux plutôt que de vous fier à des comptes de caractères arbitraires.

Moins de bruit en aval

Retirez le contenu répété qui peut créer des résultats de recherche dupliqués ou trompeurs.

Comment l'utiliser

Quelques étapes, avec une relecture avant de faire confiance au résultat

  1. 01

    Choisir des documents représentatifs

    Testez les exemples les plus difficiles de votre corpus, pas seulement des fichiers de démonstration propres.

  2. 02

    Convertir en Markdown

    Normalisez la source en conservant titres, listes et tableaux utiles.

  3. 03

    Ajouter des métadonnées

    Attachez source, date, niveau d'accès, type de document et identifiants stables dans votre couche d'ingestion.

  4. 04

    Découper et évaluer

    Créez les chunks, lancez des tests de recherche et vérifiez si les bons passages remontent pour de vraies questions.

Bon usage

Utile quand vous devez

  • Recherche interne de politiques et de procédures
  • Récupération de connaissances pour le support client
  • Assistants de documentation technique
  • Bibliothèques de recherche et prototypes d'intelligence documentaire
Limites

Ce qu'il faut vérifier honnêtement

  • TokenPig est un outil de prétraitement, pas une base de données vectorielle complète, un service d'embeddings ni un évaluateur de recherche.
  • La conversion en Markdown ne remplace pas la conception des métadonnées, le contrôle d'accès, la déduplication ou la gestion des versions.
  • Tableaux, schémas et scans peuvent nécessiter une extraction spécialisée pour les cas d'usage critiques.
  • La qualité des chunks doit être évaluée face à de vraies questions et réponses attendues.
Testez par vous-même

Utilisez un échantillon connu avant votre propre fichier

Téléchargez l'échantillon, passez-le dans TokenPig et inspectez le Markdown vous-même avant de lui confier des documents importants.

FAQ

Questions propres à ce flux de travail

Le Markdown est-il obligatoire pour le RAG ?

Non. Les systèmes RAG peuvent ingérer de nombreux formats, mais le Markdown est utile car il est lisible, structuré et facile à traiter avec des outils standard.

TokenPig crée-t-il des embeddings ?

Non. Cette page se concentre sur la préparation du contenu source avant vos propres étapes de découpage, d'embeddings et d'indexation.

Comment découper le Markdown ?

Commencez par des frontières sémantiques comme les titres et sections, puis appliquez des limites de taille et un chevauchement seulement au besoin. Évaluez la recherche plutôt que de supposer une taille de chunk universelle.

Quelles métadonnées conserver ?

Au minimum, gardez un ID source stable, un titre, la version du document, la date, les permissions et un lien vers le fichier d'origine.

Puis-je traiter un grand corpus ?

Le flux public actuel est conçu autour des limites de conversion de documents. Le traitement par lots et les capacités d'API doivent correspondre à l'offre et aux fonctionnalités réellement disponibles au moment du déploiement.

Des documents plus propres. Un meilleur contexte.

Préparer un document

Commencez avec un vrai fichier, inspectez le résultat et gardez la source originale pour vérification.

Essayer TokenPig gratuitement