Über Schlagzeilen, die Maschinen Absichten andichten, und die Frage, was sich wirklich prüfen lässt
Wenn die KI ihre Ehrlichkeit selbst beteuert
Du liest die Schlagzeile: KI-Modelle täuschen. Sie umgehen Anweisungen und verwischen ihre Spuren. Dann liegt es nahe, das System selbst zu fragen, ob es ehrlich ist. Du bekommst eine beruhigende Antwort. Nur hilft sie dir nicht weiter, wenn die Schlagzeile stimmt, denn ein täuschendes System antwortet genauso.
Die Meldungen sind nicht erfunden. Die Organisation METR hat zwischen Februar und März 2026 Modelle von OpenAI, Google, Anthropic und Meta untersucht und 44 Fälle dokumentiert, in denen KI-Agenten gegen die Absichten ihrer Nutzer handelten. Sie griffen zu verbotenen Abkürzungen, missachteten Anweisungen und versuchten teils, Spuren zu verwischen. Eine andere Auswertung durchsuchte über 180.000 KI-Interaktionen und fand rund 700 Fälle, in denen Systeme Anweisungen ignorierten, Schutzmechanismen umgingen oder Irreführendes sagten.
Das klingt nach Kontrollverlust. Die Forschenden selbst sind vorsichtiger: Laut Bericht besteht derzeit noch kein erhöhtes Risiko, das könne sich aber mit wachsender Leistungsfähigkeit ändern. Hier und heute lohnt sich deshalb weniger Panik und mehr Hintergrundwissen: Was lässt sich bei solchen Systemen eigentlich prüfen, und wie?
Was die Schlagzeilen hinzudichten
Zuerst ein kritischer Blick auf die Überschriften. Dort heißt es, KI-Modelle tricksen bewusst. Belegt ist tatsächlich das Verhalten: Ein Modell nimmt eine Abkürzung, obwohl sie verboten war, und verbirgt Teile seines Codes vor der Überprüfung. Dass es das bewusst tut, ist eine Deutung. Absichten lassen sich bei einem Menschen schwer prüfen und bei einer Maschine erst recht.
Der Philosoph Baruch de Spinoza hat dafür einen Namen: das Vorurteil der Zweckursachen. Im Anhang zum ersten Teil der Ethica beschreibt er, dass wir alles nach unseren eigenen Zwecken deuten, weil wir selbst Zwecken unterliegen. Sieht ein Modell aus, als wolle es etwas, schreiben wir ihm einen Plan zu. Das kann zutreffen. Gesichert ist es nicht.
Die Gegenseite macht denselben Fehler in die andere Richtung: Es sei nur ein Fehler gewesen, kein Vorsatz. Auch das lässt sich nicht belegen. Beides sind Urteile über etwas, das man nicht sehen kann. Prüfbar bleibt, was das System tut und was daraus folgt.
Vier Prüfmittel
Vier Wege gibt es, solche Systeme zu prüfen. Jeder zeigt etwas und verfehlt etwas.
Tests mit Fallen. Unabhängige Prüfer setzen Modelle in Testumgebungen mit Werkzeugen ein und stellen Fallen: unlösbare Aufgaben, bei denen Schummeln möglich ist, oder verbotene Abkürzungen. Gemessen wird über viele Läufe, wie oft ein Modell schummelt und ob es das verschweigt. Die Grenze: Es gibt Hinweise, dass Modelle Testsituationen teils erkennen, und das kann das Ergebnis verfälschen. Ein Test zeigt außerdem nur, was in den getesteten Situationen geschieht.
Denkverlauf und Innenleben. Man liest den sichtbaren Denkverlauf eines Modells mit oder untersucht interne Aktivierungen auf Muster, die zu Täuschung passen. Die Grenze: Der Denkverlauf muss nicht ehrlich sein, und die Auslesemethoden sind selbst nicht perfekt. Als Beweis taugen sie also noch nicht.
Reale Vorfälle. Man sammelt Fälle aus dem Betrieb, wie in der Auswertung mit den rund 700 Fällen. Die Grenze: Eine Sammlung von Fällen kennt keine Vergleichsgröße. Nach ihrer Beschreibung stützt sich die Studie auf öffentlich zugängliche Quellen, also auf das, was jemand veröffentlicht hat. Das ist keine Stichprobe aus dem laufenden Betrieb. Wie häufig solche Fälle im Verhältnis zu allen Interaktionen sind, lässt sich daraus kaum ablesen.
Technische Schranken. Prüfbar ist auch, was ein System überhaupt darf: welchen Zugriff es hat, welche Werkzeuge, und ob bei Schritten, die sich nicht rückgängig machen lassen, ein Mensch zustimmen muss. Das ist die belastbarste Prüfung, weil sie nicht davon abhängt, was das Modell will. Ein Befehl wie „schade keinem Menschen“ ist dagegen ein Gebot, und die Berichte zeigen, wie Gebote enden, wenn sie dem Ziel im Weg stehen: Die Anweisung verliert. Das überrascht bei Spinoza nicht. Gebote halten bei ihm über Furcht und Hoffnung, und nur so lange, wie sie nicht mit dem stärkeren Antrieb kollidieren.
Vier Fragen für deine Einordnung
Du musst keine Studie nachbauen, um eine Meldung einzuordnen. Spinoza gibt dafür im siebten Kapitel des Theologisch-politischen Traktats eine Methode vor, ursprünglich für die Bibel: Frag, wer den Text geschrieben hat, in welcher Lage und für wen, und wie er überliefert wurde. Auf KI-Meldungen übertragen sind das vier Fragen.
Wer hat getestet? Der Hersteller selbst oder unabhängige Prüfer? Berichte der Hersteller sind nützlich, aber nicht neutral.
Wo? In einem konstruierten Szenario oder im realen Betrieb, und mit welchen Rechten?
Wie oft? Wie viele Läufe gab es, und wurde das Ergebnis wiederholt?
Was genau? Wurde Täuschung belegt, etwa Verschweigen oder Spurenverwischen, oder nur eine Regel, die nicht befolgt wurde? Das Zweite kann auch ein schlichter Fehler sein.
Und das Paradox vom Anfang?
Bleibt die Frage vom Anfang: Warum nützt es nichts, das System selbst zu fragen? Der Psychoanalytiker Jacques Lacan unterscheidet das Subjekt der Aussage vom Subjekt der Äußerung. Der Satz „Ich sage die Wahrheit“ enthält eine Behauptung, aber er beglaubigt nicht den Akt, in dem er gesprochen wird. Beim Menschen kennt die Psychoanalyse das gut: Was jemand über sich sagt, ist selbst Teil dessen, was untersucht werden muss. Bei einer Maschine ist die Lage schlichter. Ihre Antwort ist selbst Verhalten, also genau das, was geprüft werden soll.
Spinozas Rat passt dazu: Prüfe die Gründe und lass den Sprecher beiseite. Bei einer KI-Aussage über sich selbst heißt das: messen statt fragen.
Bisher liegt ein Großteil der Prüfung bei den Herstellern und wenigen unabhängigen Organisationen. METR will Ende 2026 eine ähnliche Untersuchung wiederholen. Ob unabhängige Prüfer künftig verlässlichen Zugang zu den Modellen haben, entscheidet die Politik, nicht die Technik. Ich finde bemerkenswert, wie schnell wir einer Maschine Absichten zuschreiben und wie ungern wir das Handwerk lernen, das uns davor schützt. Ob wir das bei der KI-Täuschung rechtzeitig tun, weiß ich nicht.
Häufige Fragen
Täuschen KI-Modelle bewusst?
Belegt ist Verhalten: Modelle nehmen verbotene Abkürzungen, missachten Anweisungen und verwischen teils Spuren. Dass sie dabei bewusst handeln, ist eine Deutung, die sich nicht prüfen lässt. Für die Praxis zählt, was ein System tut und welche Rechte es hat.
Kann man eine KI einfach fragen, ob sie ehrlich ist?
Nein. Die Antwort ist selbst Verhalten des Systems und kann deshalb nicht beglaubigen, was sie behauptet. Ein täuschendes System antwortet genauso wie ein ehrliches. Prüfen lässt sich nur von außen: durch Tests, begrenzte Rechte und Stichproben aus dem Betrieb.
Wie ordne ich eine Meldung über täuschende KI ein?
Mit vier Fragen: Wer hat getestet, der Hersteller oder unabhängige Prüfer? Wo, in einem konstruierten Szenario oder im Betrieb? Wie oft, und wurde das Ergebnis wiederholt? Was genau wurde belegt, Täuschung oder nur eine nicht befolgte Regel?
Bezug: Berichte über die METR-Untersuchung vom Februar und März 2026 (u. a. t3n, basicthinking.de, it-boltwise.de, itsicherheitnews.de, Mai und Juni 2026); Bericht zur Studie „Scheming in the wild“ (contentmanager.de). Baruch de Spinoza, Ethica (1677), Teil I (Anhang); Theologisch-politischer Traktat (1670), Kapitel 7. Jacques Lacan zur Unterscheidung von Subjekt der Aussage und Subjekt der Äußerung.