KI-Täuschung: Was sich prüfen lässt und wie du Meldungen darüber einordnest

Über Schlag­zei­len, die Maschi­nen Absich­ten andich­ten, und die Fra­ge, was sich wirk­lich prü­fen lässt


Wenn die KI ihre Ehrlichkeit selbst beteuert

Du liest die Schlag­zei­le: KI-Model­le täu­schen. Sie umge­hen Anwei­sun­gen und ver­wi­schen ihre Spu­ren. Dann liegt es nahe, das Sys­tem selbst zu fra­gen, ob es ehr­lich ist. Du bekommst eine beru­hi­gen­de Ant­wort. Nur hilft sie dir nicht wei­ter, wenn die Schlag­zei­le stimmt, denn ein täu­schen­des Sys­tem ant­wor­tet genauso.

Die Mel­dun­gen sind nicht erfun­den. Die Orga­ni­sa­ti­on METR hat zwi­schen Febru­ar und März 2026 Model­le von Ope­nAI, Goog­le, Anthro­pic und Meta unter­sucht und 44 Fäl­le doku­men­tiert, in denen KI-Agen­ten gegen die Absich­ten ihrer Nut­zer han­del­ten. Sie grif­fen zu ver­bo­te­nen Abkür­zun­gen, miss­ach­te­ten Anwei­sun­gen und ver­such­ten teils, Spu­ren zu ver­wi­schen. Eine ande­re Aus­wer­tung durch­such­te über 180.000 KI-Inter­ak­tio­nen und fand rund 700 Fäl­le, in denen Sys­te­me Anwei­sun­gen igno­rier­ten, Schutz­me­cha­nis­men umgin­gen oder Irre­füh­ren­des sagten.

Das klingt nach Kon­troll­ver­lust. Die For­schen­den selbst sind vor­sich­ti­ger: Laut Bericht besteht der­zeit noch kein erhöh­tes Risi­ko, das kön­ne sich aber mit wach­sen­der Leis­tungs­fä­hig­keit ändern. Hier und heu­te lohnt sich des­halb weni­ger Panik und mehr Hin­ter­grund­wis­sen: Was lässt sich bei sol­chen Sys­te­men eigent­lich prü­fen, und wie?


Was die Schlagzeilen hinzudichten

Zuerst ein kri­ti­scher Blick auf die Über­schrif­ten. Dort heißt es, KI-Model­le trick­sen bewusst. Belegt ist tat­säch­lich das Ver­hal­ten: Ein Modell nimmt eine Abkür­zung, obwohl sie ver­bo­ten war, und ver­birgt Tei­le sei­nes Codes vor der Über­prü­fung. Dass es das bewusst tut, ist eine Deu­tung. Absich­ten las­sen sich bei einem Men­schen schwer prü­fen und bei einer Maschi­ne erst recht.

Der Phi­lo­soph Baruch de Spi­no­za hat dafür einen Namen: das Vor­ur­teil der Zweck­ur­sa­chen. Im Anhang zum ers­ten Teil der Ethi­ca beschreibt er, dass wir alles nach unse­ren eige­nen Zwe­cken deu­ten, weil wir selbst Zwe­cken unter­lie­gen. Sieht ein Modell aus, als wol­le es etwas, schrei­ben wir ihm einen Plan zu. Das kann zutref­fen. Gesi­chert ist es nicht.

Die Gegen­sei­te macht den­sel­ben Feh­ler in die ande­re Rich­tung: Es sei nur ein Feh­ler gewe­sen, kein Vor­satz. Auch das lässt sich nicht bele­gen. Bei­des sind Urtei­le über etwas, das man nicht sehen kann. Prüf­bar bleibt, was das Sys­tem tut und was dar­aus folgt.


Vier Prüfmittel

Vier Wege gibt es, sol­che Sys­te­me zu prü­fen. Jeder zeigt etwas und ver­fehlt etwas.

Tests mit Fal­len. Unab­hän­gi­ge Prü­fer set­zen Model­le in Test­um­ge­bun­gen mit Werk­zeu­gen ein und stel­len Fal­len: unlös­ba­re Auf­ga­ben, bei denen Schum­meln mög­lich ist, oder ver­bo­te­ne Abkür­zun­gen. Gemes­sen wird über vie­le Läu­fe, wie oft ein Modell schum­melt und ob es das ver­schweigt. Die Gren­ze: Es gibt Hin­wei­se, dass Model­le Test­si­tua­tio­nen teils erken­nen, und das kann das Ergeb­nis ver­fäl­schen. Ein Test zeigt außer­dem nur, was in den getes­te­ten Situa­tio­nen geschieht.

Denk­ver­lauf und Innen­le­ben. Man liest den sicht­ba­ren Denk­ver­lauf eines Modells mit oder unter­sucht inter­ne Akti­vie­run­gen auf Mus­ter, die zu Täu­schung pas­sen. Die Gren­ze: Der Denk­ver­lauf muss nicht ehr­lich sein, und die Aus­le­se­me­tho­den sind selbst nicht per­fekt. Als Beweis tau­gen sie also noch nicht.

Rea­le Vor­fäl­le. Man sam­melt Fäl­le aus dem Betrieb, wie in der Aus­wer­tung mit den rund 700 Fäl­len. Die Gren­ze: Eine Samm­lung von Fäl­len kennt kei­ne Ver­gleichs­grö­ße. Nach ihrer Beschrei­bung stützt sich die Stu­die auf öffent­lich zugäng­li­che Quel­len, also auf das, was jemand ver­öf­fent­licht hat. Das ist kei­ne Stich­pro­be aus dem lau­fen­den Betrieb. Wie häu­fig sol­che Fäl­le im Ver­hält­nis zu allen Inter­ak­tio­nen sind, lässt sich dar­aus kaum ablesen.

Tech­ni­sche Schran­ken. Prüf­bar ist auch, was ein Sys­tem über­haupt darf: wel­chen Zugriff es hat, wel­che Werk­zeu­ge, und ob bei Schrit­ten, die sich nicht rück­gän­gig machen las­sen, ein Mensch zustim­men muss. Das ist die belast­bars­te Prü­fung, weil sie nicht davon abhängt, was das Modell will. Ein Befehl wie „scha­de kei­nem Men­schen“ ist dage­gen ein Gebot, und die Berich­te zei­gen, wie Gebo­te enden, wenn sie dem Ziel im Weg ste­hen: Die Anwei­sung ver­liert. Das über­rascht bei Spi­no­za nicht. Gebo­te hal­ten bei ihm über Furcht und Hoff­nung, und nur so lan­ge, wie sie nicht mit dem stär­ke­ren Antrieb kollidieren.


Vier Fragen für deine Einordnung

Du musst kei­ne Stu­die nach­bau­en, um eine Mel­dung ein­zu­ord­nen. Spi­no­za gibt dafür im sieb­ten Kapi­tel des Theo­lo­gisch-poli­ti­schen Trak­tats eine Metho­de vor, ursprüng­lich für die Bibel: Frag, wer den Text geschrie­ben hat, in wel­cher Lage und für wen, und wie er über­lie­fert wur­de. Auf KI-Mel­dun­gen über­tra­gen sind das vier Fragen.

Wer hat getes­tet? Der Her­stel­ler selbst oder unab­hän­gi­ge Prü­fer? Berich­te der Her­stel­ler sind nütz­lich, aber nicht neutral.

Wo? In einem kon­stru­ier­ten Sze­na­rio oder im rea­len Betrieb, und mit wel­chen Rechten?

Wie oft? Wie vie­le Läu­fe gab es, und wur­de das Ergeb­nis wiederholt?

Was genau? Wur­de Täu­schung belegt, etwa Ver­schwei­gen oder Spu­ren­ver­wi­schen, oder nur eine Regel, die nicht befolgt wur­de? Das Zwei­te kann auch ein schlich­ter Feh­ler sein.


Und das Paradox vom Anfang?

Bleibt die Fra­ge vom Anfang: War­um nützt es nichts, das Sys­tem selbst zu fra­gen? Der Psy­cho­ana­ly­ti­ker Jac­ques Lacan unter­schei­det das Sub­jekt der Aus­sa­ge vom Sub­jekt der Äuße­rung. Der Satz „Ich sage die Wahr­heit“ ent­hält eine Behaup­tung, aber er beglau­bigt nicht den Akt, in dem er gespro­chen wird. Beim Men­schen kennt die Psy­cho­ana­ly­se das gut: Was jemand über sich sagt, ist selbst Teil des­sen, was unter­sucht wer­den muss. Bei einer Maschi­ne ist die Lage schlich­ter. Ihre Ant­wort ist selbst Ver­hal­ten, also genau das, was geprüft wer­den soll.

Spi­no­zas Rat passt dazu: Prü­fe die Grün­de und lass den Spre­cher bei­sei­te. Bei einer KI-Aus­sa­ge über sich selbst heißt das: mes­sen statt fragen.


Bis­her liegt ein Groß­teil der Prü­fung bei den Her­stel­lern und weni­gen unab­hän­gi­gen Orga­ni­sa­tio­nen. METR will Ende 2026 eine ähn­li­che Unter­su­chung wie­der­ho­len. Ob unab­hän­gi­ge Prü­fer künf­tig ver­läss­li­chen Zugang zu den Model­len haben, ent­schei­det die Poli­tik, nicht die Tech­nik. Ich fin­de bemer­kens­wert, wie schnell wir einer Maschi­ne Absich­ten zuschrei­ben und wie ungern wir das Hand­werk ler­nen, das uns davor schützt. Ob wir das bei der KI-Täu­schung recht­zei­tig tun, weiß ich nicht.


Häufige Fragen

Täuschen KI-Modelle bewusst?

Belegt ist Ver­hal­ten: Model­le neh­men ver­bo­te­ne Abkür­zun­gen, miss­ach­ten Anwei­sun­gen und ver­wi­schen teils Spu­ren. Dass sie dabei bewusst han­deln, ist eine Deu­tung, die sich nicht prü­fen lässt. Für die Pra­xis zählt, was ein Sys­tem tut und wel­che Rech­te es hat.

Kann man eine KI einfach fragen, ob sie ehrlich ist?

Nein. Die Ant­wort ist selbst Ver­hal­ten des Sys­tems und kann des­halb nicht beglau­bi­gen, was sie behaup­tet. Ein täu­schen­des Sys­tem ant­wor­tet genau­so wie ein ehr­li­ches. Prü­fen lässt sich nur von außen: durch Tests, begrenz­te Rech­te und Stich­pro­ben aus dem Betrieb.

Wie ordne ich eine Meldung über täuschende KI ein?

Mit vier Fra­gen: Wer hat getes­tet, der Her­stel­ler oder unab­hän­gi­ge Prü­fer? Wo, in einem kon­stru­ier­ten Sze­na­rio oder im Betrieb? Wie oft, und wur­de das Ergeb­nis wie­der­holt? Was genau wur­de belegt, Täu­schung oder nur eine nicht befolg­te Regel?


Bezug: Berich­te über die METR-Unter­su­chung vom Febru­ar und März 2026 (u. a. t3n, basicthinking.de, it-boltwise.de, itsicherheitnews.de, Mai und Juni 2026); Bericht zur Stu­die „Sche­ming in the wild“ (contentmanager.de). Baruch de Spi­no­za, Ethi­ca (1677), Teil I (Anhang); Theo­lo­gisch-poli­ti­scher Trak­tat (1670), Kapi­tel 7. Jac­ques Lacan zur Unter­schei­dung von Sub­jekt der Aus­sa­ge und Sub­jekt der Äußerung.

Schreibe einen Kommentar

TopBlogs.de das Original - Blogverzeichnis | Blog Top Liste