Konsistentes Quellformat
Normalisieren Sie PDFs, Word-Dateien, Folien und Tabellen zu einer gemeinsamen Textdarstellung.
Verwandeln Sie gemischte Office-Dateien in konsistentes Markdown vor Chunking, Embeddings und Retrieval.
Keine Anmeldung für die ersten Konvertierungen · Dateien werden vorübergehend verarbeitet · Es gelten die Limits Ihres Plans
Ein Retrieval-System kann keine Struktur wiederherstellen, die während der Ingestion verloren ging oder verunreinigt wurde. Wiederholte Kopfzeilen, eine zerbrochene Lesereihenfolge und inkonsistente Extraktion können schwache Chunks erzeugen, noch bevor Embeddings erstellt werden.
TokenPig bietet eine einfache Vorverarbeitungsschicht: Wandeln Sie unterstützte Dokumente in lesbares Markdown um, prüfen Sie das Ergebnis und geben Sie den bereinigten Text dann an Ihre eigene Chunking- und Indexierungs-Pipeline weiter.
Normalisieren Sie PDFs, Word-Dateien, Folien und Tabellen zu einer gemeinsamen Textdarstellung.
Prüfen Sie das tatsächliche Markdown, bevor es in einen Vektorspeicher oder Retrieval-Index gelangt.
Nutzen Sie Überschriften und Listen als Signale, statt sich nur auf willkürliche Zeichenzahlen zu verlassen.
Entfernen Sie wiederholte Inhalte, die doppelte oder irreführende Retrieval-Ergebnisse erzeugen können.
Testen Sie die schwierigsten Beispiele Ihres Korpus, nicht nur saubere Demo-Dateien.
Normalisieren Sie die Quelle und bewahren Sie dabei Überschriften, Listen und nützliche Tabellen.
Hängen Sie Quelle, Datum, Zugriffsebene, Dokumenttyp und stabile Kennungen in Ihrer Ingestion-Schicht an.
Erstellen Sie Chunks, führen Sie Retrieval-Tests durch und prüfen Sie, ob bei echten Fragen die richtigen Passagen erscheinen.
Laden Sie das Beispiel herunter, lassen Sie es durch TokenPig laufen und prüfen Sie das Markdown selbst, bevor Sie ihm wichtige Dokumente anvertrauen.
Nein. RAG-Systeme können viele Formate aufnehmen, aber Markdown ist nützlich, weil es lesbar, strukturiert und mit Standardwerkzeugen leicht zu verarbeiten ist.
Nein. Diese Seite konzentriert sich auf die Vorbereitung des Quellinhalts vor Ihren eigenen Schritten für Chunking, Embeddings und Indexierung.
Beginnen Sie mit semantischen Grenzen wie Überschriften und Abschnitten und wenden Sie Größenlimits und Überlappung nur dort an, wo nötig. Bewerten Sie das Retrieval, statt eine universelle Chunk-Größe anzunehmen.
Behalten Sie mindestens eine stabile Quell-ID, den Titel, die Dokumentversion, das Datum, Berechtigungen und einen Link zurück zur Originaldatei.
Der aktuelle öffentliche Ablauf ist auf die Konvertierungslimits für Dokumente ausgelegt. Stapelverarbeitung und API-Fähigkeiten sollten dem Plan und den beim Deployment tatsächlich verfügbaren Funktionen entsprechen.
Beginnen Sie mit einer echten Datei, prüfen Sie das Ergebnis und behalten Sie die Originalquelle zur Verifizierung.
TokenPig kostenlos testen