Große Sprachmodelle (LLMs) sind brillant, aber für Fachübersetzungen stoßen sie an eine kritische Grenze: das Token-Fenster.
Ein LLM kann nur eine begrenzte Menge an Informationen (Tokens) gleichzeitig verarbeiten. Zu viele Daten überlasten es.
Jedes an das LLM gesendete Token kostet Rechenleistung und Geld. Große Glossare treiben die Kosten in die Höhe.
Das "Nadel im Heuhaufen"-Problem: Relevante Begriffe gehen in einem überladenen Kontext verloren, was die Präzision verringert.
Der naive Ansatz, einfach alle Begriffe in die Anfrage zu stopfen, ist ineffizient. Intelligente Systeme wählen nur das Nötigste aus.
Problem: Verschwendet Token, teuer und kann die Genauigkeit verringern.
Vorteil: Token-effizient, kostengünstig und hochpräzise.
Jede Methode zur Glossar-Integration hat spezifische Stärken und Schwächen. Dieses Diagramm vergleicht die wichtigsten Ansätze über fünf kritische Dimensionen (höherer Wert = besser).
Für maximale Effizienz wird der RAG-Prozess um einen entscheidenden Schritt erweitert: die kontextuelle Komprimierung. Dabei wird der abgerufene Text weiter verfeinert, sodass das LLM nur die absolut relevantesten Informationen erhält.
sondern eine intelligentere Nutzung des vorhandenen Platzes.