Lange Kontextfenster gelten als ein zentraler Entwicklungspfad für Large Language Models. Je mehr Text ein Modell gleichzeitig verarbeiten kann, desto besser sollte es Zusammenhänge über Dokumente, Gespräche oder ganze Bücher hinweg erfassen. Diese Erwartung ist plausibel – aber sie vermischt zwei verschiedene Probleme:
- Wie viel vergangener Text ist noch zugänglich?
- Welcher Zustand der beschriebenen Welt lässt sich aus diesem Text rekonstruieren?
Ein längeres Kontextfenster verbessert zunächst den Zugriff auf Beobachtungen. Es erzeugt aber nicht automatisch ein explizites Modell der Situation, aus der diese Beobachtungen hervorgegangen sind.
Der Unterschied ist grundlegend. Ein Text ist nicht die Welt selbst. Er ist eine selektive, perspektivische und häufig unvollständige Beschreibung eines zugrunde liegenden Zustands. Mehr Beschreibung kann helfen, diesen Zustand besser zu rekonstruieren. Fehlen jedoch entscheidende Zustandsvariablen vollständig, kann auch ein sehr großes Kontextfenster sie nicht zuverlässig ersetzen.
Text als Beobachtung eines verborgenen Zustands
Ein autoregressives Sprachmodell approximiert eine bedingte Verteilung:
$$
p_\theta(x_{t+1}\mid x_{\le t}).
$$
Es sagt das nächste Token aus den bisher sichtbaren Tokens voraus. Für viele Aufgaben funktioniert das erstaunlich gut. Die Gleichung enthält jedoch nur sprachliche Beobachtungen – keinen expliziten Weltzustand.
Systemtheoretisch lässt sich Text stattdessen als Emission eines verborgenen Zustands auffassen:
$$
y_t = H(s_t,c_t,a_t).
$$
Dabei bezeichnet:
- $s_t$ den Welt- oder Situationszustand,
- $c_t$ den kulturellen, zeitlichen und institutionellen Kontext,
- $a_t$ die Perspektive, Rolle oder Absicht des Sprechers,
- $y_t$ die beobachtete sprachliche Äußerung.
Der sichtbare Text ist somit eine Projektion eines wesentlich reicheren Zustandsraums. Ein LLM muss aus den verfügbaren Äußerungen eine interne Zustandsschätzung erzeugen:
$$
\hat s_t = E_\theta(y_{t-L:t}).
$$
Das Kontextfenster der Länge $L$ liefert hierfür eine endliche Beobachtungshistorie. Das Modell sieht, was geschrieben wurde. Es sieht jedoch nicht unmittelbar, unter welchen Bedingungen es geschrieben wurde, welche Annahmen als bekannt vorausgesetzt wurden oder welche nicht erwähnten Zustände die Aussage erst eindeutig machen.
Ein identischer Satz kann verschiedene Zustände beschreiben
Betrachten wir den Satz:
Peter reicht Anna ein Glas.
Ohne weitere Information bleiben zahlreiche Fragen offen:
- Wer sind Peter und Anna?
- Was befindet sich im Glas?
- Welche soziale Situation liegt vor?
- Welche Handlungen sind in dieser Situation erwartbar?
- Ist die Handlung alltäglich, feierlich, medizinisch oder problematisch?
Auf einem Kindergeburtstag und auf einem Junggesellenabschied kann dieselbe Satzoberfläche auf unterschiedliche Situationszustände verweisen. Auch die wahrscheinliche Fortsetzung ändert sich:
$$
p(x_{t+1}\mid y_t,c_{\text{Kindergeburtstag}})
\neq
p(x_{t+1}\mid y_t,c_{\text{Junggesellenabschied}}).
$$
Ein längeres Kontextfenster hilft nur dann, wenn der relevante Unterschied irgendwo im Text enthalten ist. Fehlt die Information über die Art der Feier vollständig, bleibt die Situation unterbestimmt. Das Modell kann dann nur über gelernte Häufigkeiten oder Plausibilitäten mitteln.
Genau hier liegt der Unterschied zwischen mehr Text und mehr Zustand.
Das Kontextfenster als Rekonstruktionsversuch
Die nichtlineare Zeitreihenanalyse kennt ein strukturell verwandtes Problem. Beobachtet wird häufig nur eine skalare oder niedrigdimensionale Messgröße:
$$
x_t = h(s_t),
$$
während das eigentliche dynamische System im verborgenen Zustand $s_t$ lebt. Durch verzögerte Beobachtungen
$$
X_t =
(x_t,x_{t-\tau},\ldots,x_{t-(m-1)\tau})
$$
wird versucht, einen Zustandsraum zu rekonstruieren.
Der von Floris Takens formulierte Einbettungsgedanke zeigt für eine klar definierte Klasse deterministischer dynamischer Systeme, unter welchen Bedingungen eine hinreichend dimensionierte Verzögerungsdarstellung die Dynamik des ursprünglichen Systems rekonstruieren kann. Die Analogie zum LLM-Kontextfenster liegt nahe:
$$
Y_t =
(y_t,y_{t-1},\ldots,y_{t-L+1}).
$$
Auch hier wird aus einer Beobachtungshistorie eine interne Zustandsrepräsentation konstruiert.
Diese Analogie ist nützlich, darf aber nicht überdehnt werden. Natürliche Sprache erfüllt die Voraussetzungen klassischer Einbettungssätze nicht:
- Das beschriebene System ist offen und wird durch externe Ereignisse beeinflusst.
- Mehrere Personen mit unterschiedlichen Zielen erzeugen den Text.
- Die Beobachtungsfunktion ändert sich mit Stil, Kultur und Textgattung.
- Texte enthalten Zeitsprünge, Zitate, Ironie und Perspektivwechsel.
- Relevante Informationen werden absichtlich ausgelassen oder nur vorausgesetzt.
- Der zugrunde liegende Weltzustand ist nicht stationär.
Ein Kontextfenster ist daher nicht einfach eine höhere Einbettungsdimension eines festen Attraktors. Es ist eher eine endliche Sammlung partieller und heterogener Beobachtungen, aus denen ein Modell lokal einen plausiblen Zustand rekonstruieren muss.
Falsche Nachbarn im semantischen Raum
Bei einer zu niedrigen Rekonstruktionsdimension können im rekonstruierten Zustandsraum Punkte nahe erscheinen, die im tatsächlichen Zustandsraum weit auseinanderliegen. In der nichtlinearen Zeitreihenanalyse spricht man von false nearest neighbors.
Für Sprache lässt sich das so schreiben:
$$
\hat s_i = E(y_i),
$$
und für zwei Beobachtungen:
$$
|\hat s_1-\hat s_2|\ll 1,
\qquad
|s_1-s_2|\gg 1.
$$
Der Encoder hält zwei Situationen für ähnlich, obwohl ihre tatsächlichen Zustände stark voneinander abweichen.
Das kann bei sprachlich nahezu identischen Aussagen auftreten, deren Bedeutung sich durch nicht sichtbare Kontextvariablen verändert:
- eine Aussage aus dem Jahr 1850 und dieselbe Aussage aus dem Jahr 2026,
- eine medizinische Fallbeschreibung und ein literarisches Zitat,
- eine ironische Äußerung und eine wörtlich gemeinte Behauptung,
- eine moderne Übersetzung und der antike Originaltext,
- dieselbe Handlung in unterschiedlichen sozialen Situationen.
Die zusätzlichen Variablen Zeit, Kultur, Quelle, Textgattung oder Sprecherrolle sind dann keine dekorativen Metadaten. Sie sind fehlende Koordinaten des Zustandsraums. Werden sie nicht berücksichtigt, projiziert das Modell verschiedene Situationen auf eine gemeinsame, unscharfe Repräsentation.
Warum mehr Kontext allein nicht genügt
Längere Kontextfenster sind zweifellos nützlich. Sie ermöglichen den Zugriff auf weiter zurückliegende Definitionen, Ereignisse, Namen und Argumente. Sie lösen aber mehrere grundsätzlich verschiedene Probleme nicht automatisch.
1. Fehlende Variablen
Eine Information kann im gesamten Dokument nicht vorkommen, weil sie den ursprünglichen Lesern als selbstverständlich galt. Historische Texte erklären ihre Kultur nicht für spätere Jahrhunderte. Fachtexte definieren nicht jede institutionelle Voraussetzung. Gespräche setzen gemeinsame Erlebnisse voraus.
Was nicht beobachtet wurde, kann durch ein größeres Fenster nicht einfach wiederhergestellt werden.
2. Mehrdeutige Beobachtungen
Mehrere Weltzustände können dieselbe sprachliche Äußerung erzeugen:
$$
H(s_1)=H(s_2)=y.
$$
Die Rückabbildung ist dann nicht eindeutig. Das Modell benötigt zusätzliche Kontextvariablen oder muss eine Verteilung über mögliche Zustände führen:
$$
p(s\mid y).
$$
3. Vergrabene statt integrierte Information
Eine relevante Information kann zwar im Fenster vorhanden sein, aber zwischen sehr vielen irrelevanten Tokens liegen. Die Studie Lost in the Middle zeigte, dass die Leistung von Sprachmodellen stark davon abhängen kann, an welcher Position relevante Informationen in einem langen Kontext stehen. Der Benchmark RULER erweiterte solche Tests über einfache „Needle in a Haystack“-Aufgaben hinaus und fand bei vielen untersuchten Modellen deutliche Leistungseinbrüche mit wachsender Kontextlänge und Aufgabenkomplexität.
Ein technisch akzeptiertes Kontextfenster ist daher nicht identisch mit einem effektiv genutzten Kontext.
4. Seltene Übergänge
Texte bewegen sich häufig lange innerhalb eines stabilen lokalen Kontexts: derselben Szene, Domäne, Institution oder historischen Perspektive. Übergänge zwischen solchen Kontexten sind seltener und damit schlechter durch Trainingsdaten abgedeckt.
Ein Roman kann plötzlich Ort, Zeit und Perspektive wechseln. Ein wissenschaftlicher Text kann von einer empirischen Beschreibung zu einem hypothetischen Gegenfaktum übergehen. Ein juristischer Text kann eine fremde Position zitieren, bevor er sie verwirft.
Das Problem liegt dann nicht in der Länge des Fensters, sondern in der korrekten Erkennung eines Regimewechsels.
5. Nichtstationarität
Bedeutungen, Normen und Wissensstände ändern sich über die Zeit. Ohne explizite zeitliche Konditionierung lernt ein Modell eine Mischung:
$$
\bar p(x\mid y)
\int p_\tau(x\mid y)\,w_{\mathrm{data}}(\tau)\,d\tau.
$$
Da moderne Texte die digital verfügbaren Trainingskorpora dominieren, werden ältere Bedeutungsräume leicht durch heutige Kategorien geglättet. Auch ein sehr langes historisches Dokument behebt dieses Problem nur teilweise, wenn der kulturelle und epistemische Kontext nicht modelliert wird.
Rekonstruieren LLMs bereits implizite Weltzustände?
Ja – zumindest in kontrollierten Teilproblemen.
Die Arbeit Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task untersuchte ein GPT-Modell, das Zugfolgen im Spiel Othello vorhersagte. In seinen internen Aktivierungen ließ sich der aktuelle Brettzustand rekonstruieren; Interventionen an dieser Repräsentation beeinflussten anschließend die Vorhersagen des Modells. Das ist ein starkes Indiz dafür, dass Sequenzmodelle latente Weltzustände aus Beobachtungsfolgen bilden können.
Der entscheidende Zusatz lautet jedoch: Othello besitzt einen klar definierten, geschlossenen und vollständig überprüfbaren Zustandsraum. Die Regeln sind stabil, die Aktionen diskret und der korrekte Brettzustand ist bekannt.
Natürliche Sprache beschreibt dagegen offene Welten. Der relevante Zustand umfasst nicht nur physische Objekte, sondern auch:
- Wissen und Nichtwissen verschiedener Akteure,
- Ziele und Absichten,
- soziale Rollen,
- kulturelle Normen,
- historische Bedeutungen,
- Unsicherheit und widersprüchliche Quellen,
- mögliche, aber nicht realisierte Entwicklungen.
Die implizite Zustandsrekonstruktion eines Standard-LLM ist deshalb weder garantiert vollständig noch stabil oder interpretierbar.
Explizite Situationsmodelle verbessern Kohärenz
Dass explizite Zustandsrepräsentationen helfen können, zeigt die Arbeit Language Modeling with Latent Situations. Die Autoren trainierten Sprachmodelle zusätzlich darauf, relevante Eigenschaften und Relationen von Entitäten als Situationszustand zu repräsentieren. Bereits eine begrenzte Menge solcher Zustandsannotation verbesserte in den untersuchten Aufgaben die Kohärenz der Generierung.
Die Grundidee lässt sich als Faktorisierung schreiben:
$$p(x_{t+1}\mid y_{\le t})\int
p(x_{t+1}\mid y_{t-L:t},s_t)\,
p(s_t\mid y_{\le t})
\,ds_t.
$$
Das Modell verwendet nicht nur die lokale Tokenfolge, sondern inferiert zusätzlich den wahrscheinlichen Zustand, auf den sich die Folge bezieht.
Damit wird das Kontextproblem nicht vollständig gelöst. Es wird aber sauberer formuliert: Das Modell benötigt sowohl Beobachtungen als auch eine Zustandsrekonstruktion.
Was ein Weltmodell zusätzlich leisten müsste
Ein Weltmodell ist mehr als eine komprimierte Zusammenfassung des bisherigen Textes. Es benötigt mindestens vier Komponenten.
1. Einen persistenten Zustand
$$
s_{t+1}=F(s_t,o_{t+1}).
$$
Neue Beobachtungen aktualisieren einen fortgeschriebenen Zustand, statt die gesamte Situation bei jedem Token ausschließlich aus dem sichtbaren Text neu zu rekonstruieren.
2. Eine Emissions- oder Beobachtungsfunktion
$$
y_t\sim H(s_t,c_t,a_t).
$$
Sie beschreibt, wie unterschiedliche Sprecher, Kulturen und Textgattungen denselben Zustand sprachlich realisieren.
3. Unsicherheit über alternative Zustände
Bei mehrdeutigen Beobachtungen sollte das Modell nicht vorschnell einen einzigen Zustand festlegen:
$$
p(s_t\mid y_{1:t}).
$$
Spätere Informationen können frühere Zustandsschätzungen revidieren. In der Zustandsraummodellierung entspricht das dem Unterschied zwischen Filtering und Smoothing.
4. Ein Übergangsmodell
Ein Weltmodell muss nicht nur wissen, was gerade der Fall ist, sondern auch, welche Zustandsübergänge möglich oder wahrscheinlich sind:
$$
p(s_{t+1}\mid s_t,a_t).
$$
Erst damit lassen sich Handlungen, Gegenfakten und langfristige Konsequenzen systematisch modellieren.
Eine mögliche Zwei-Kanal-Architektur
Eine konsequente Architektur würde nicht versuchen, sämtliche Information als Tokenfolge in dasselbe Fenster zu pressen. Sie könnte zwei unterschiedliche Eingangskanäle verwenden:
$$
p(x_{t+1}\mid y_{t-L:t},z_t).
$$
Der erste Kanal enthält den kurzen lokalen Text:
$$
y_{t-L:t}.
$$
Der zweite Kanal enthält einen persistenten Kontext- und Situationszustand:
$$
z_t=
(
\text{Entitäten},
\text{Relationen},
\text{Zeit},
\text{Kultur},
\text{Quelle},
\text{Rollen},
\text{Ziele},
\text{Unsicherheit}
).
$$
Dieser zweite Kanal könnte aus mehreren Komponenten konstruiert werden:
- einem Ereignis- und Entitätsspeicher,
- einem temporalen Wissensgraphen,
- einem Kontextencoder,
- einer Quellen- und Provenienzschicht,
- einem dynamischen Zustandsraummodell,
- externem Retrieval für überprüfbare Belege.
Der Kontextzustand könnte zusätzlich bestimmen, welche Teile des Modells aktiv sind. Mixture-of-Experts, kontextabhängige Adapter, FiLM-artige Featuremodulation oder Hypernetworks bieten dafür bereits technische Bausteine.
Auch State-Space-Architekturen wie Mamba zeigen, dass Sequenzmodelle einen selektiv fortgeschriebenen rekurrenten Zustand mit linearer Skalierung über die Sequenzlänge verbinden können. Ein solcher Zustand ist jedoch noch nicht automatisch ein semantisch interpretierbares Weltmodell. Dafür müssten Weltzustand, Diskurszustand, Kontext und sprachliche Oberfläche gezielter getrennt werden.
Warum RAG allein ebenfalls kein Weltmodell ist
Retrieval-Augmented Generation kann relevante frühere Dokumente oder Passagen zurückholen. Damit löst RAG ein wichtiges Zugriffsproblem. Es beantwortet jedoch nicht automatisch:
- welche Aussagen noch gültig sind,
- welche Quellen sich widersprechen,
- welcher Akteur was wusste,
- welche Ereignisse den Zustand verändert haben,
- welche Bedeutung eine Aussage in ihrer Zeit und Kultur hatte.
Retrieval liefert zusätzliche Beobachtungen. Ein Weltmodell muss diese Beobachtungen in einen konsistenten, zeitabhängigen und unsicheren Zustand integrieren.
Beide Ansätze sind deshalb komplementär:
$$
\text{Retrieval}
+
\text{Zustandsrekonstruktion}
+
\text{Zustandsdynamik}.
$$
Der systemtheoretische Perspektivwechsel
Die Debatte über Kontextfenster wird häufig als Speicher- und Skalierungsproblem behandelt: Wie viele Tokens passen in das Fenster, wie effizient arbeitet Attention und wie weit kann ein Modell Informationen zurückverfolgen?
Das ist notwendig, aber nicht hinreichend.
Die wichtigere Frage lautet:
Welche Zustandsvariablen sind erforderlich, damit die beobachteten Texte überhaupt eindeutig und dynamisch konsistent interpretiert werden können?
Ein Kontextfenster stellt eine Beobachtungshistorie bereit. Ein Weltmodell formuliert eine Hypothese darüber, welcher Zustand diese Beobachtungen erzeugt hat, wie er sich verändert und welche Beobachtungen unter alternativen Bedingungen entstehen würden.
Das ist derselbe Perspektivwechsel, der auch für agentische KI erforderlich ist. In dem RCS-Beitrag „Agentische KI benötigt Systemsichtweise“ wurde argumentiert, dass Agenten nicht nur einzelne Aufgaben abarbeiten, sondern in dynamische Systeme mit Rückkopplungen, Abhängigkeiten und veränderlichen Zuständen eingebettet sind. Ein explizites Weltmodell wäre die interne Entsprechung dieser Systemsicht.
Fazit
Längere Kontextfenster sind wertvoll. Sie verbessern Gedächtniszugriff, Dokumentverarbeitung und die Rekonstruktion weit auseinanderliegender Zusammenhänge. Sie sollten jedoch nicht mit einem Weltmodell gleichgesetzt werden.
Ein Kontextfenster enthält beobachtete Tokens. Ein Weltmodell benötigt darüber hinaus:
- einen rekonstruierten und persistenten Zustand,
- explizite Kontextvariablen,
- Übergangsdynamiken,
- Unsicherheit über alternative Zustände,
- eine Trennung zwischen Welt, Perspektive und sprachlicher Emission.
Die nächste Entwicklungsstufe leistungsfähiger KI-Systeme könnte deshalb nicht allein in immer größeren Tokenfenstern liegen. Sie könnte in einer hybriden Architektur bestehen, die kurze lokale Textsequenzen mit einem fortgeschriebenen, kontextualisierten Zustandsmodell verbindet.
Dann würde ein Modell nicht mehr nur fragen:
Welche Wörter standen zuvor?
Sondern:
Was ist vermutlich der Fall, in welchem Kontext gilt es – und wie kann sich dieser Zustand als Nächstes verändern?
Literatur und Forschungsanknüpfungen
- Floris Takens: Detecting strange attractors in turbulence, 1981.
- Nelson F. Liu et al.: Lost in the Middle: How Language Models Use Long Contexts, 2023.
- Cheng-Ping Hsieh et al.: RULER: What’s the Real Context Size of Your Long-Context Language Models?, 2024.
- Kenneth Li et al.: Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task, 2022/2023.
- Belinda Z. Li, Maxwell Nye, Jacob Andreas: Language Modeling with Latent Situations, Findings of ACL 2023.
- Albert Gu, Tri Dao: Mamba: Linear-Time Sequence Modeling with Selective State Spaces, 2023.