Skip to content

RAG-Chatbots auf eigenen Dokumenten

KI & Automatisierung4 Min. Lesezeit
RAG-Chatbots auf eigenen Dokumenten

Ein allgemeines Sprachmodell weiß nichts über Ihre Preisliste, Ihre Servicehandbücher oder Ihre internen Richtlinien. Retrieval-Augmented Generation löst das, indem zunächst Ihre eigenen Dokumente durchsucht werden und das Modell nur die passenden Passagen als Antwortgrundlage erhält. Gut umgesetzt entstehen Antworten mit Quellenangabe. Schlecht umgesetzt entsteht selbstsicherer Unsinn, nur schneller als zuvor.

Wie die Verarbeitungskette tatsächlich arbeitet

  • Dokumente werden eingelesen und in Abschnitte von etwa 300 bis 800 Tokens geteilt, entlang logischer Grenzen wie Überschriften.
  • Jeder Abschnitt wird von einem Embedding-Modell in einen Vektor umgewandelt und mit seinen Metadaten gespeichert.
  • Die Nutzerfrage wird auf dieselbe Weise eingebettet, und die nächstliegenden Abschnitte werden abgerufen.
  • Ein Reranking-Modell sortiert die Kandidaten nach tatsächlicher Relevanz um, was die Antwortqualität meist stärker verbessert als jede Prompt-Änderung.
  • Das Modell erhält die besten Passagen samt Frage und erzeugt eine Antwort mit Quellenangaben.

Die Reihenfolge ist entscheidend. Die meisten Qualitätsprobleme entstehen in den Schritten eins und zwei, nicht im Modell. Wird eine Tabelle aus einem PDF beim Einlesen zu einer Zahlenwüste zusammengefaltet, rettet kein noch so guter Prompt die Bedeutung.

Die Datenaufbereitung ist das Projekt

Planen Sie hierfür 40 bis 60 Prozent des Budgets. Gescannte Unterlagen benötigen Texterkennung. Tabellen benötigen eine strukturerhaltende Extraktion. Veraltete Fassungen müssen entfernt werden, denn ein Modell erkennt nicht, dass die Preisliste von 2019 überholt ist. Jeder Abschnitt braucht Metadaten: Quelldokument, Version, Datum und Berechtigungsstufe, damit die Antworten danach gefiltert werden können, wer die Frage stellt.

Ein Retrieval-System ist nur so ehrlich wie sein neuestes Dokument und nur so sicher wie das älteste, das Sie zu löschen vergessen haben.

Qualität messen, bevor Kundschaft sie sieht

Bauen Sie einen Testdatensatz aus 80 bis 150 echten Fragen mit freigegebenen Antworten auf, gesammelt aus Supporttickets und Vertriebs-E-Mails. Messen Sie die Trefferquote des Abrufs – ob die richtige Passage überhaupt gefunden wurde – getrennt von der Richtigkeit der Antwort. Diese Trennung zeigt, wo zu investieren ist: Abrufprobleme löst man über Segmentierung und Reranking, Erzeugungsprobleme über Prompting und Modellwahl.

Legen Sie außerdem eine Verweigerungsregel fest. Ein Assistent, der antwortet, dass er dies in der Dokumentation nicht gefunden hat, und auf eine zuständige Person verweist, ist im Geschäftsumfeld deutlich wertvoller als einer, der rät. In unseren Projekten erreicht ein gut abgestimmtes System 85 bis 93 Prozent korrekte Antworten bei einer Verweigerungsquote um 5 Prozent.

Kosten und Aufwand

  • Einrichtung eines Dokumentenassistenten auf 500 bis 5.000 Seiten: 6.000 bis 14.000 €.
  • Einmaliges Einbetten des Bestands: meist unter 50 €, erneutes Einbetten nach größeren Aktualisierungen.
  • Laufende Modellkosten bei 300 Gesprächen im Monat: 40 bis 200 €.
  • Vektordatenbank mit Hosting in der EU: je nach Größe 0 bis 90 € monatlich.
  • Laufende Pflege des Dokumentenbestands: zwei bis vier Stunden im Monat, für die jemand verantwortlich sein muss.
  • Regelmäßige Prüfung der Antwortqualität gegen den Testdatensatz: etwa ein halber Tag je Quartal oder nach jedem Modellwechsel.

Datenschutz und Zugriffssteuerung

Personenbezogene Daten im Bestand benötigen eine Rechtsgrundlage und einen Löschweg. Betreiben Sie den Vektorindex in der EU, schließen Sie einen Auftragsverarbeitungsvertrag mit dem Modellanbieter und deaktivieren Sie das Training mit Ihren Eingaben. Dürfen unterschiedliche Rollen unterschiedliche Dokumente sehen, setzen Sie das beim Abruf über Metadatenfilter durch, niemals über die Anweisung an das Modell, etwas geheim zu halten. Eine Modellanweisung ist keine Zugriffssteuerung.

Wo es sich zuerst auszahlt

Interne Anwendungsfälle liefern am schnellsten Nutzen, weil die Erwartungen realistisch sind und Fehler von Kolleginnen und Kollegen bemerkt werden. Supportteams mit wiederkehrenden Produktfragen, Servicetechniker auf der Suche nach Arbeitsanweisungen und Vertriebsmitarbeitende, die Vertragsbedingungen nachschlagen, sind die drei stärksten Einstiegspunkte. Öffentliche Assistenten für die Kundschaft sind lohnend, aber erst, wenn die interne Fassung ein Quartal lang gemessen wurde. Versehen Sie außerdem jede Antwort mit einem sichtbaren Quellenverweis: Menschen vertrauen einem System deutlich mehr, wenn sie die ursprüngliche Seite öffnen und selbst nachlesen können.

Autor

Tobias Lang

KI-Ingenieur

Teilen
Miriam Kraus

Ihre Ansprechpartnerin

Miriam Kraus

Ich lese jede Anfrage persönlich und melde mich innerhalb eines Werktages.

Schreiben Sie uns direkt

Füllen Sie das Formular aus – wir melden uns bei Ihnen

Woran sind Sie interessiert?