A Glossar

A Glossar

Chunking

Chunking bezeichnet die Aufteilung größerer Dokumente in kleinere, inhaltlich zusammenhängende Einheiten, sogenannte Chunks. Ein Chunk kann beispielsweise aus einem Absatz, einem Unterkapitel, einer Liste oder einer Tabelle bestehen. In RAG-Systemen werden diese Einheiten gespeichert und durchsucht, damit relevante Inhalte gezielt gefunden und dem Sprachmodell zur Verfügung gestellt werden können.

LLM

LLM steht für Large Language Model, auf Deutsch großes Sprachmodell. Dabei handelt es sich um ein KI-Modell, das anhand großer Textmengen trainiert wurde. Ein LLM kann Texte analysieren, zusammenfassen, übersetzen, strukturieren und neue Inhalte erzeugen. Bekannte Anwendungsbereiche sind Chatbots, Dokumentenanalyse, Informationssuche und RAG-Systeme.

Multimodal

Multimodal bezeichnet die Fähigkeit eines KI-Systems, unterschiedliche Arten von Informationen gemeinsam zu verarbeiten. Dazu können beispielsweise Texte, Bilder, Tabellen, Audiodaten oder vollständige Dokumentseiten gehören. Ein multimodales Sprachmodell kann somit nicht nur Text lesen, sondern auch visuelle Strukturen und Inhalte eines Dokuments analysieren.

Prompt

Ein Prompt ist eine Anweisung oder Eingabe, die einem KI-Modell übermittelt wird. Er beschreibt, welche Aufgabe das Modell ausführen und in welcher Form es das Ergebnis ausgeben soll. Ein Prompt kann aus einer kurzen Frage oder aus ausführlichen Vorgaben zu Inhalt, Struktur, Format und Qualitätsanforderungen bestehen.

RAG

RAG steht für Retrieval-Augmented Generation. Dabei wird ein Sprachmodell mit einem Retrieval-System verbunden. Bevor das Modell eine Antwort erzeugt, sucht das System zunächst nach passenden Informationen in einer Wissensbasis. Die gefundenen Inhalte werden dem Sprachmodell als zusätzlicher Kontext bereitgestellt. Dadurch können Antworten stärker auf konkreten Dokumenten und Quellen basieren.

Retrieval

Retrieval bezeichnet die automatische Suche nach relevanten Informationen innerhalb einer Daten- oder Wissensbasis. Bei einer Anfrage ermittelt das System diejenigen Dokumente, Textabschnitte oder Datensätze, die inhaltlich am besten zur Fragestellung passen. Die gefundenen Informationen können anschließend zur Beantwortung der Anfrage verwendet werden.

Token

Ein Token ist eine kleine Verarbeitungseinheit eines Sprachmodells. Dabei kann es sich um ein vollständiges Wort, einen Wortbestandteil, ein Satzzeichen oder ein einzelnes Zeichen handeln. Sprachmodelle verarbeiten Texte nicht direkt als Wörter oder Sätze, sondern als Abfolge von Tokens. Die Anzahl der Tokens beeinflusst unter anderem, wie viel Text ein Modell gleichzeitig verarbeiten kann.