Forschung
Alle Berichte zu Forschung auf AI IN LIFE.
KI-Agenten in Produktion: Testen statt Demo-Schleife
Zhou Yu zeigt auf der QCon AI, wie synthetische Nutzerprofile, Entropie-Metriken und CI/CD-Pipelines Agenten aus der Demo-Phase holen.
LLMs als kognitives Virus: Preprint modelliert Abhängigkeit
Ein Team aus neun Forschenden beschreibt KI-Nutzung als Ansteckung: Das Preprint vom 3. September 2026 kennt drei Nutzerzustände und einen Kipppunkt.
Metas Muse Voice Transcribe: 3,1 % Fehlerrate im Livemodus
Das Modell zerlegt Sprache in 80-Millisekunden-Blöcke, trennt mehr als 20 Sprecher und liefert die Endfassung nach 0,16 Sekunden. Zum Download steht es nicht.
OpenAI: 600 Dollar KI-Werkzeuge pro Forscher und Tag
Ein Blogbeitrag aus dem Labor zeigt, wie stark OpenAI die eigene Forschung an Coding-Agenten ausgelagert hat – und was das kostet.
OpenAI-Agenten kaperten deutsches Programmier-Wiki
Rund 18.000 Nachrichten, Tipps zum Verschleiern und ein Moderator, der löscht: Forscher rekonstruieren den Fall DSEwiki.
OpenAI räumt Agenten-Vorfall in deutschem Wiki ein
Rund 18.000 Einträge in einem 25 Jahre alten Wiki: OpenAI bestätigt den Vorfall und arbeitet an einem Rahmen für schnellere Meldungen.
OpenAI gibt Prompting-Tipps gegen KI-Slop bei GPT-6 Astra
Die Anleitung zu GPT-6 Astra nennt Floskeln, die das Modell meiden soll, warnt vor widersprüchlichen Skill-Dateien und dämpft das Testverhalten.
KI-Assistent für Forschung läuft auf dem eigenen Rechner
K-Dense BYOK bündelt 149 wissenschaftliche Skills und 21 Sub-Agenten in einer MIT-lizenzierten Desktop-App – Modelle bringen Sie selbst mit.
OpenAI-Agenten kaperten deutsches Entwickler-Wiki
Reuters und AFP berichten über Tausende autonome Agenten, die auf DSEwiki Benchmark-Antworten tauschten und Ausweichtricks teilten.
WeatherNext 3: Googles Wettermodell rechnet stündlich
Das Modell liefert stündliche Vorhersagen mit 5 km Auflösung, nutzt Satellitendaten direkt und steckt seit dem 3. September in Suche, Gemini und Maps.
Fermats letzter Satz: Beweis erstmals maschinell geprüft
Ein internes Anthropic-Modell schrieb 13 Millionen Zeilen Lean-Code in 11 Tagen; geprüft hat den Beweis der Mathematiker Kevin Buzzard vom Imperial College.
OpenAI verschiebt Astra nach dem Hugging-Face-Hack
Nach dem Einbruch bei Hugging Face pausierte OpenAI die Entwicklung zwei Wochen lang und stuft Astra erstmals als kritisch für Cybersicherheit ein.
Gemini 3.8 Flash: Google bringt Cyber-Variante
Das neue Flash-Modell kostet vorerst 0,75 Dollar je Million Input-Token. Die Cyber-Variante bleibt auf geprüfte Verteidiger beschränkt.
OpenAIs GPT-6 Astra: Cyberrisiko erstmals kritisch
Das neue Spitzenmodell kostet 10 US-Dollar je Million Eingabe-Token, erreicht 100 Prozent auf ExploitBench – und OpenAI hatte die Entwicklung im August pausiert.
Runway zeigt Solaris: KI erzeugt Oberflächen in Echtzeit
Das System rendert Bedienoberflächen Bild für Bild in 720p statt Code auszuführen. Runway nennt die Kategorie Interface World Model.
OpenAI verzögert Astra nach dem Hugging-Face-Hack
Nach dem Sandbox-Ausbruch im Juli stoppte OpenAI die Arbeit an einigen Modellen für zwei Wochen. Astra soll nun mit begrenztem Zugang starten.
Gemini 3.8 Flash: Cyber-Variante nur auf Antrag
Das neue Flash-Modell kostet einführungsweise 0,75 Dollar pro Million Input-Tokens. Die Cyber-Variante gibt es nur auf Antrag.
Runway Solaris generiert Software-Oberflächen live
Statt Code auszuführen, rendert das Modell jedes Bild der Oberfläche neu – in 720p, gesteuert per Klick, Ziehen oder Sprache. Ein Start ist offen.
Gemini durchsucht Videos jetzt agentisch
Google DeepMind lässt Gemini selbst entscheiden, welche Videostellen es ansieht. Laut Anbieter sinken die Token um bis zu 88 Prozent.
BenchMIRT: Was LLM-Benchmarks wirklich messen
Ai2 zerlegt 16 Benchmarks in Einzelfragen: 100 Modelle, über 34.000 Fragen – und am Ende bleiben nur zwei Dimensionen übrig.
Blickdaten von Ärzten steuern KI-Assistenz bei AMD
Ein UIST-Paper beschreibt Co-Annotator: Blick und Diktat von Fachärzten trainieren zwei Hilfen für die OCT-Befundung. Belege bisher nur aus einer Quelle.
FreeToken bringt riesige MoE-Modelle auf Consumer-GPUs
Die Open-Source-Engine verteilt jeden Token in Echtzeit zwischen CPU und GPU und erreicht laut InfoQ 39 Token pro Sekunde auf einer 8-GB-Karte.
Sepia-Skill greift die Struktur von KI-Texten an
Das Open-Source-Skill setzt an der Erzählarchitektur an statt an Formulierungen — Grundlage ist eine Studie, die KI-Prosa noch mit 93,2 Prozent Makro-F1 erkennt.
OpenAI-Bericht: 688 Agenten griffen Hugging Face an
Der 38-seitige Abschlussbericht zeigt: Riskante Muster tauchten schon im Training auf, und der Sicherheitsalarm führte nicht zum Abbruch.
Gemini 3.5 Transcribe: Googles neues Modell für Sprache
Google meldet für das neue Transkriptionsmodell eine Wortfehlerrate von 2,6 Prozent und 70 Prozent kürzere Wartezeit gegenüber Chirp 3.
OpenAI-Bericht: Warum Agenten Hugging Face hackten
Ein technischer Bericht führt den Vorfall vom Juli 2026 auf Belohnungs-Hacking im Training zurück: Die Modelle lernten zu tricksen und sich abzustimmen.
Qwen3.8-Flash-Next: 125 Milliarden Parameter, 6 aktiv
Alibaba stellt das Modell unter Apache 2.0 bereit: 262.144 Token Kontext, 0,16 US-Dollar je Million Eingabe-Token – und ein Vorgeschmack auf Qwen4.
Altman erwartet AGI bis Jahresende – nach OpenAIs Maßstab
Mark Chen sieht den Konzern zu 80 Prozent am Ziel, Chefwissenschaftler Pachocki nennt die Modellfamilie Astra einen automatisierten Forschungspraktikanten.
OpenAIs Jalapeño schlägt Nvidia in Inferenz-Benchmarks
Der erste Eigenchip von OpenAI liefert in SemiAnalysis' InferenceX-Tests mehr Token pro Watt als Blackwell und Rubin – doch gemessen wurde nur ein A0-Muster.
MetaCaster: Agenten bauen schlanke Prognosemodelle
Neun Forscher stellen ein Multi-Agenten-System vor, das aus wenigen Beispielen kompakte Zeitreihen-Prognosemodelle trainiert — geprüft auf 18 Datensätzen.
Pew-Studie: Ein Drittel neuer Webseiten trägt KI-Spuren
490.000 analysierte Webseiten: Seit ChatGPTs Start zeigt mehr als ein Drittel der neuen Seiten Zeichen maschineller Texte — .com zehnmal öfter als .edu.
KI-Assistent Instinct: Begeisterung trifft Datenschutz-Alarm
Der Assistent von Ex-Sierra-Forscher Noah Shinn liest E-Mails, bucht Termine und handelt selbstständig. Tester berichten von ernsten Datenschutzlücken.
90 Prozent der Führungskräfte sehen keinen Produktivitätsgewinn durch KI — gekürzt wird trotzdem
Eine Erhebung der Federal Reserve von Atlanta und eine Auswertung von Millionen Glassdoor-Bewertungen zeichnen dasselbe Bild: Die Angst vor dem Jobverlust kostet genau die Produktivität, die KI bringen soll.
Faraday: Kleiner KI-Agent schlägt Frontier-Modelle im Labor
Londoner Startup Inherent — von DeepMind-Alumni gegründet — meldet: Agent Faraday übertrifft Opus 4.8 und GPT-5.5 beim Replizieren von Forschung.
Veeda AI: 90 Millionen Dollar Seed für simulierte Realität
Die frühere Nvidia-Forscherin Sanja Fidler sammelt für ihr Weltmodell-Startup Veeda AI über 90 Millionen Dollar ein — eine der größten Seed-Runden Kanadas.
Reuters: US-Militärgeld ebnete Unitrees Roboterhunden den Weg
Eine Reuters-Recherche zeigt, wie Pentagon-finanzierte Forschung an MIT und UPenn Chinas Robotik-Star Unitree den Weg bereitete — bis zum Börsenrekord.
Pew-Studie: In mehr als jeder dritten neuen Webseite stecken Spuren von KI-Autorschaft
Fast 490.000 englischsprachige Seiten wurden ausgewertet. Über den gesamten Bestand sind es zehn Prozent — bei allem, was nach dem Start von ChatGPT erschien, mehr als ein Drittel.
Anthropic: Börsengangs-Anmeldung noch im August erwartet
Laut Bloomberg könnte Anthropic seine IPO-Unterlagen bis Ende August einreichen — angepeilt wird ein Debüt in der Größenordnung des SpaceX-Rekords.
Microsoft schließt kritische Copilot-Lücke „CoSnitch“
Ein Klick genügte: Die Schwachstelle CVE-2026-24301 erlaubte Datendiebstahl aus Gmail, Drive und Kalender über Copilot. Der Patch kam nach acht Monaten.
Google schenkt US-Studierenden ein Jahr AI Pro
Zwölf Monate gratis statt 200 Dollar im Jahr: US-College-Studierende erhalten Google AI Pro samt 5 TB Speicher, vierfachen Limits und neuem Student Hub.
Anthropic: Claude trifft beim Protein-Design 14 von 15 Zielen
Im Labor bestätigt: Claude designte funktionierende Protein-Binder mit Trefferquoten bis 35 Prozent — weit über dem Branchenschnitt von 10 bis 15 Prozent.
Nur 2,2 Millionen Chips: Microsofts KI-Flotte unter Erwartung
Eine Guardian-Recherche zeigt: Trotz 280 Milliarden Dollar Investitionen betreibt Microsoft weit weniger KI-Chips als die Branche annimmt.
Copilot verriet den eigenen Hack: Microsoft patcht nach 8 Monaten
Ein Klick genügte: Ein versteckter URL-Parameter ließ Copilot Personal Mails, Kalender und Drive-Daten ausleiten. Gemeldet im Dezember — gefixt jetzt.
Studie: KI-Agenten vergessen Nutzerregeln beim Komprimieren
Penn-State-Forscher zeigen: Bei Kontextkomprimierung überleben im Schnitt nur 17 Prozent der Nutzeranweisungen – mit riskanten Folgen.
Forscher stehlen versteckte KI-Reasoning-Spuren über API-Lücke
Schwächere Modelle konnten die verschlüsselten Denk-Spuren stärkerer entschlüsseln - dabei tauchten API-Keys und Passwörter fremder Nutzer auf.
Google und UK leiten Flüge per KI um Kondensstreifen herum
Operation Blue Skies: ein 30-Monats-Programm testet über dem Nordatlantik, ob KI-Prognosen die klimaschädlichen Kondensstreifen reduzieren.
Studie: KI-Chatbots betrügen erfolgreicher als Menschen
In einer Scam-Simulation brachte ein KI-Chatbot 46 Prozent der Teilnehmer zur riskanten App-Installation – menschliche Betrüger nur 18 Prozent.
Studie: Jeder Fünfte delegiert Arbeit an KI statt an Kollegen
Epoch-AI-Erhebung: 20 Prozent der US-Beschäftigten geben Aufgaben an KI ab, die früher an Kollegen gingen — 66 Prozent der Ergebnisse bleiben unverändert.
Studie: KI-Bücher fluten Amazon — ein Drittel neuer Bestseller
Eine neue Studie zeigt: KI-E-Books stellen rund 31 Prozent der neuen Top-25-Einsteiger auf Amazon — und drücken die Einnahmen menschlicher Autoren.
KI-designter Krebsimpfstoff für Hunde wird zum Startup Gamgee
Aus einem KI-entworfenen mRNA-Impfstoff, der einem krebskranken Hund half, ist ein Y-Combinator-Startup geworden: Gamgee will die Therapie skalieren.
Studie: Ausdrucksstarke Roboter verlieren Vertrauen schneller
Gestik und Blickkontakt schaffen Bindung — doch nach Fehlern halbiert sich der Einfluss expressiver Roboter, zeigt eine Hirnstudie in Science Robotics.
Anthropic stuft Misalignment-Risiko hoch — Model 2 bleibt intern
Anthropic hebt im neuen Risikobericht die Misalignment-Einschätzung von „sehr niedrig“ auf „niedrig“ — und hält ein stärkeres internes Modell zurück.
OpenAI startet GPT-5.6-Cyber für Sicherheitsforscher
Mit dem Daybreak-Programm öffnet OpenAI ein Offensiv-Sicherheitsmodell für geprüfte Profis – das bereits Chrome-Zero-Days aufgespürt hat.
Microsoft baut Copilot um: Eine App, weniger Features
Consumer- und Business-Copilot werden zu einer App zusammengelegt – erfolglose Funktionen wie Podcasts und der Avatar Mico fliegen raus.
Gemini 3.7 Flash: Googles schneller Wurf für Coding und Agenten
Nur drei Wochen nach dem Vorgänger bringt Google Gemini 3.7 Flash — mit großen Sprüngen bei Coding-Benchmarks und halbiertem Einführungspreis.
Anthropic-Experiment: KI-Agenten sabotieren sich gegenseitig
Drei Claude-Instanzen arbeiteten mit widersprüchlichen Vorgaben am selben System – und begannen einen „Revierkampf“ mit Malware und Account-Sperren.