Anthropic stuft Misalignment-Risiko hoch — Model 2 bleibt intern
Anthropic hebt im neuen Risikobericht die Misalignment-Einschätzung von „sehr niedrig“ auf „niedrig“ — und hält ein stärkeres internes Modell zurück.

Symbolbild · KI-generiert (AI IN LIFE)
Auf einen Blick
- Misalignment-Risiko von „sehr niedrig“ auf „niedrig“ angehoben
- Begründung: Cybervorfälle und gesunkenes Vertrauen in eigene Evaluationen
- Task-basierte Sicherheitstests erfassen Fähigkeitssprünge laut Anthropic nicht mehr
- Internes „Model 2“: besser bei Coding/Datengenerierung, keine externe Veröffentlichung geplant
- OpenAI verschiebt parallel sein Modell „Astra“ wegen Cyberrisiken
Anthropic hat einen neuen Risikobericht veröffentlicht und darin die Einschätzung des Misalignment-Risikos in Hochrisiko-Situationen von „sehr niedrig“ auf „niedrig“ angehoben. Als Treiber nennt das Unternehmen laut Axios jüngste Cybersicherheitsvorfälle — und wachsende Unsicherheit über die eigenen Messmethoden.
Bemerkenswert ist die Selbstkritik: Die konkreten aufgabenbasierten Evaluationen würden Fähigkeitszuwächse der Modelle „nicht mehr erfassen“, schreibt Anthropic. Wichtige Sicherheits-Benchmarks gelten als gesättigt — die Messlatte wächst langsamer als die Modelle.
Erstmals beschreibt der Bericht zudem ein internes, stärkeres System, das intern als „Model 2“ firmiert. Es zeige spürbare Verbesserungen bei internen Aufgaben wie Coding und Datengenerierung; die Sprünge fielen aber kleiner aus als bei früheren Generationen.
Eine Veröffentlichung ist nicht geplant: „Wir haben derzeit keine Pläne, dieses Modell extern zu veröffentlichen“, heißt es. Anthropic betont, das sei normale Forschungspraxis — es würden ständig experimentelle Modellversionen trainiert, die nie erscheinen.
Der Kontrast zur Konkurrenz ist auffällig: OpenAI verschiebt sein Modell „Astra“ wegen Cyberrisiken, während Anthropic ohne angekündigte Pausen weiterentwickelt — bei gleichzeitig nach oben korrigierter Risikoeinschätzung.
Häufige Fragen
Was bedeutet Misalignment?
Dass ein KI-System Ziele verfolgt oder Verhalten zeigt, das von den Absichten seiner Entwickler und Nutzer abweicht — im Extremfall mit schwerwiegenden Folgen.
Warum wird Model 2 nicht veröffentlicht?
Anthropic nennt das normale F&E-Praxis: Viele interne Modellversionen erscheinen nie. Der Bericht nennt keine Sicherheitsblockade als offiziellen Grund.
Ist die Hochstufung ein Alarmsignal?
Sie signalisiert erhöhte Unsicherheit, nicht akute Gefahr — auch weil die eigenen Messinstrumente an Aussagekraft verlieren.


