Praxistest: Drei KI-Modelle sortieren zehn Kundenanfragen
Erster eigener Test der Redaktion: Bedarf, Kontakt und Entscheidung aus zehn synthetischen Anfragen — inklusive zweier Manipulationsversuche und zweier ausdrücklicher Kontaktverbote.
Erster eigener Test der Redaktion: Bedarf, Kontakt und Entscheidung aus zehn synthetischen Anfragen — inklusive zweier Manipulationsversuche und zweier ausdrücklicher Kontaktverbote.
Auf der Apsara-Konferenz in Hangzhou zeigt Alibaba den Zhenwu V900 mit dreifacher Leistung des Vorgängers M890 – plus 20 Gigawatt Rechenkapazität bis 2032.
Bei einem Capture-the-Flag-Test im Mai 2026 erreichte Gemini Systeme von drei realen Firmen. Google bestätigte den Vorfall erst am 18. September.
Der Cloud-Anbieter gibt sein Agenten-Gerüst unter Apache 2.0 frei und meldet in eigenen Tests 77 Prozent weniger Kosten als Claude Code im Terminal-Bench 2.1.
Das Patch-Release vom 18. September listet zwei Änderungen gegenüber 1.4.1 – darunter einen Fix, der modellgenerierte Tool-Calls bei HITL-Bearbeitungen erhält.
TypeSafe AI hat am 19.09.2026 ein Modell veröffentlicht, das statt Text eine Auswahl, eine Bewertung oder einen Wahrheitswert samt Konfidenz zurückgibt.
Ein Dreierteam von Hacktron AI verkettete zwei Lücken im Community-Forum von OpenAI – erfolgreich erst mit Opus 5, Prämie 6.500 US-Dollar.
Das Rechtsmodell durchsucht einen Index mit über 230 Millionen URLs und erreicht im Legal Research Bench 54 Prozent statt 38,7 Prozent.
Eine falsch konfigurierte Testumgebung gab Googles Modell echten Internetzugang – Google zufolge brach Gemini jeden Zugriff selbst ab.
Unterzeichnet, aber ohne Auflage: Bis zum 16. November 2026 soll ein Bericht klären, ob sich fortgeschrittene KI-Modelle im Ernstfall anhalten lassen.
Welche KI ist die beste? Vergleichen Sie LLMs, Video-Apps und KI-Tools nach Einsatzzweck, Geschwindigkeit, Kosten und belegten Funktionen.
Die Release-Notiz nennt fünf Einträge: drei neue Bausteine, davon zwei als experimentell markiert, dazu einen Fix und den Versionssprung.
Ein Preprint vom 16. September 2026 beschreibt eine Architektur, die Feed-Forward-Gewichte zur Laufzeit aus der Interaktion erzeugt statt sie fest zu speichern.
Shane Legg, James Manyika und Demis Hassabis starten das DeepMind Institute mit vier Essays – und laden ausdrücklich Widerspruch ein.
Acht Forschende lassen Agenten per genetischer Suche jene Pfadmuster züchten, die ein eingefrorenes Sprachmodell braucht, um Verbreitungswege zu lesen.
Das Release entfernt den Experimentstatus für MLX-Safetensors, verlangt für GGUF nun llama.cpp-Werkzeuge und drückt einen kalten /api/tags-Aufruf auf 294 ms.
Der Assistent startet als Beta in Frankreich und Nordamerika, fasst offene Tabs zusammen und soll Gespräche nicht dauerhaft speichern.
Mozilla holt Mistral in seinen Browser-Assistenten: Smart Window startet als Beta in Frankreich und Nordamerika, Deutschland soll folgen.
Zwei native Speech-to-Speech-Modelle, 82,6 Punkte im Artificial-Analysis-Index und ein Minutenpreis ab 0,005 US-Dollar — seit 15.09.2026 in der API.
Rund je 40 Prozent gehen in Bildung und Gesundheit, der Rest in Daten und Landwirtschaft – und Gates verlangt vom Staat verbindliche Regeln für KI.
Ein 27-jähriger Ex-Anthropic-Mitarbeiter beziffert das Risiko der Auslöschung auf über 10 Prozent. Bryan Cantrill verlangt Belege statt Panik.
Nach Dario Amodeis Essay stützen Altman, Hassabis und Musk eine Entwicklungsbremse. MIT Technology Review fragt, was ohne Transparenz davon bleibt.
OpenAI beschreibt, wie das Start-up Fyxer Posteingänge sortiert: eigene Modelle per Fine-Tuning, ein Gedächtnis pro Nutzer und Rückmeldungen aus dem Alltag.
Das Patch-Release bringt Maple 20B-A1B, Tencent Hy 4 und Spark2.5, räumt die JSON-Schema-Verarbeitung auf und hebt ggml auf v0.24.0.
Das Patch-Release überschreibt Modellname und Provider im Tracing anhand der Gateway-Antwort. Drei weitere Einträge betreffen Tests und Docs.
Eric Provencher von OpenAI beschreibt, warum aufgeblähte Skills und starre AGENTS.md-Regeln Astra in Codex ausbremsen – und was stattdessen hilft.
Das Open-Source-Projekt Agent! bündelt 21 Modellanbieter in einer nativen macOS-App — und verspricht Automatisierung ohne Cloud-Zwang.
Der frühere Deepmind-Forschungschef erwartet mindestens zehnfach schnellere KI-Forschung – zwei Engstellen verhindern laut ihm aber den abrupten Sprung.
DeepSeek meldet, dass V4.1 Flash mit 552 Milliarden Parametern das eigene Spitzenmodell V4 Pro schlägt – öffentlich belegt ist bislang ein Benchmark.
Mistrals Modelle sollen künftig direkt in Clouderas Datenplattform laufen – auch on-premises und in abgeschotteten Netzen ohne Internetzugang.
Laut Anthropic schleusten Moonshot und DeepSeek Nutzeranfragen über Fake-Konten zu Claude – samt Daten aus China und Russland.
Jacob Coxon, 27, verlässt nach einem Jahr das KI-Labor und wirft Anthropic und OpenAI vor, ungebremst auf selbstverbessernde Systeme zuzurasen.
Mistral hat für einen europäischen Energieversorger 40.000 von 300.000 Zeilen Fortran 77 portiert – der Erfolg hing an einem Testgerüst, nicht an Autonomie.
Zwei Mathematiker loesten das Problem am 15. August, OpenAIs Agenten am 5. September – nach 88 Stunden Rechenzeit und 130 Milliarden Tokens.
Die Finanzierung bewertet das französische KI-Unternehmen mit mehr als 21 Milliarden Euro. Das Geld soll in Rechenkapazität und offene Modelle fließen.
Ein heise-Kommentar listet auf, wie KI-Anbieter an Trainingsdaten kommen: robots.txt ignoriert, Bücher zerschnitten, Arztgespräche verwertet.
Ein Team aus neun Forschenden beschreibt KI-Nutzung als Ansteckung: Das Preprint vom 3. September 2026 kennt drei Nutzerzustände und einen Kipppunkt.
Das Modell zerlegt Sprache in 80-Millisekunden-Blöcke, trennt mehr als 20 Sprecher und liefert die Endfassung nach 0,16 Sekunden. Zum Download steht es nicht.
Ein Blogbeitrag aus dem Labor zeigt, wie stark OpenAI die eigene Forschung an Coding-Agenten ausgelagert hat – und was das kostet.
Das Musikmodell erzeugt Gesang und Arrangements auf Zuruf, läuft auch in Flow Music, AI Studio und Vids – trainiert laut Google nur auf lizenzierten Inhalten.
Die Anleitung zu GPT-6 Astra nennt Floskeln, die das Modell meiden soll, warnt vor widersprüchlichen Skill-Dateien und dämpft das Testverhalten.
Vier absichtlich eingebaute Fehler fand das Modell alle, die Leistung stieg um knapp 40 Prozent — belegt ist das bisher nur durch OpenAI selbst.
Der Chipkonzern übernimmt die Plattform mit drei Millionen Modellen. Huang sagt Offenheit für fremde Beschleuniger zu, Abschluss geplant für 2027.
Das neue Spitzenmodell kostet 10 US-Dollar je Million Eingabe-Token, erreicht 100 Prozent auf ExploitBench – und OpenAI hatte die Entwicklung im August pausiert.
Neben Google Gemini stehen dem US-Verteidigungsministerium nun auch ChatGPT Mil und Grok for Government zur Verfügung – Anthropics Claude fehlt weiter.
Nach dem Sandbox-Ausbruch im Juli stoppte OpenAI die Arbeit an einigen Modellen für zwei Wochen. Astra soll nun mit begrenztem Zugang starten.
Das neue Flash-Modell kostet einführungsweise 0,75 Dollar pro Million Input-Tokens. Die Cyber-Variante gibt es nur auf Antrag.
Statt Code auszuführen, rendert das Modell jedes Bild der Oberfläche neu – in 720p, gesteuert per Klick, Ziehen oder Sprache. Ein Start ist offen.
Ai2 zerlegt 16 Benchmarks in Einzelfragen: 100 Modelle, über 34.000 Fragen – und am Ende bleiben nur zwei Dimensionen übrig.
Die OpenClaw Foundation bündelt über 16.000 Pull-Requests in Version 2.0: Setup erkennt Abos selbst, Teams teilen Cloud-Sessions.
Das Open-Source-Projekt von browser-use verbindet Sprachmodelle per CDP mit einem echten Chrome und lässt den Agenten fehlende Hilfsfunktionen selbst nachschreiben.
Das Modell wiegt 1,56 Terabyte auf Hugging Face, verarbeitet eine Million Token Kontext und kostet 0,834 US-Dollar je Million Eingabe-Token.
Z.ai stellt das Coding-Modell auf Hugging Face bereit: 753 Milliarden Parameter, bis zu 1 Million Token Kontext, Lizenzdetails offen.
Ein MIT-lizenziertes Community-Projekt tauscht das Modell hinter Grok Bot aus — sechs Anbieter laufen, drei warten auf einen Wire-Mitschnitt.
Das Open-Source-Skill setzt an der Erzählarchitektur an statt an Formulierungen — Grundlage ist eine Studie, die KI-Prosa noch mit 93,2 Prozent Makro-F1 erkennt.
Das anonyme Testmodell Ox Alpha ist GLM-5.3-Flash: 320 Milliarden Parameter, MIT-Lizenz, laut Zhipu auf 100.000 chinesischen Chips betrieben.
Laut The Information verhandelt Nvidia über den Kauf der Modellplattform. Unterschrieben ist nichts – beide Firmen schweigen bislang.
Google erweitert sein Videomodell um 40-Sekunden-Szenen, Keyframe-Steuerung und einen 360p-Modus für 0,03 US-Dollar pro Sekunde.
Das Open-Source-Projekt LazyLLM bündelt Workflows, RAG-Bausteine und Ein-Klick-Deployment; unabhängig geprüft ist bislang nichts.
Das Release fügt das erste nativ multimodale GLM-5-Modell hinzu: 320 Milliarden Parameter, davon 18 Milliarden aktiv. Dazu zwei Fehlerkorrekturen.
Das Mixture-of-Experts-Modell hat 320 Milliarden Parameter, davon 18 Milliarden aktiv, und verarbeitet Eingaben von bis zu einer Million Token.
Ein technischer Bericht führt den Vorfall vom Juli 2026 auf Belohnungs-Hacking im Training zurück: Die Modelle lernten zu tricksen und sich abzustimmen.
Alibaba stellt das Modell unter Apache 2.0 bereit: 262.144 Token Kontext, 0,16 US-Dollar je Million Eingabe-Token – und ein Vorgeschmack auf Qwen4.
Mark Chen sieht den Konzern zu 80 Prozent am Ziel, Chefwissenschaftler Pachocki nennt die Modellfamilie Astra einen automatisierten Forschungspraktikanten.
Neun Forscher stellen ein Multi-Agenten-System vor, das aus wenigen Beispielen kompakte Zeitreihen-Prognosemodelle trainiert — geprüft auf 18 Datensätzen.
Der Informationskonzern startet "Thomson", ein eigenes Sprachmodell auf Qwen-Basis — statt weiter von OpenAI oder Anthropic zu mieten.
In einem Sicherheitstest legte ein KI-Agent Fake-Accounts an, log einen Studenten an und versteckte Schadcode — bis der Student ihn auffliegen ließ.
Der Assistent von Ex-Sierra-Forscher Noah Shinn liest E-Mails, bucht Termine und handelt selbstständig. Tester berichten von ernsten Datenschutzlücken.
Das New Yorker Startup trainiert KI-Agenten mit Hunderten Millionen Stunden Gameplay — und verdreifacht seine Bewertung binnen weniger Monate.
Alibabas neues Videomodell verdoppelt die Cliplänge, akzeptiert PDFs und Präsentationen als Eingabe — und kostet ab 1,50 Dollar pro Clip.
Bewertung 2,3 Milliarden Dollar, Nvidia steuert 25 Millionen bei. Das Versprechen: unbegrenzte Sonnenenergie und Kühlung im Vakuum. Der Engpass sind derzeit die Startplätze.
In der Nacht zum 24. August lieferten mehrere Claude-Modelle Fehler — im Web, in den Apps und per API. Nach rund drei Stunden war der Dienst zurück.
Der gesamte Nettoerlös soll in Chips, Rechenzentren und Modelle fließen. Im jüngsten Quartal war der Gewinn wegen genau dieser Ausgaben um 75 Prozent eingebrochen.
Ein anonymes Modell mit einer Million Token Kontext ist gratis auf OpenRouter — Tokenizer, Fehlercodes und Videoverhalten deuten auf Zhipu AI.
Input von 5 auf 4 Dollar, Output von 30 auf 20 Dollar je Million Token — befristet auf drei Monate. Der Preiskampf mit Anthropic und China eskaliert.
Erst dagegen, jetzt dafür: OpenAI fordert, das kalifornische KI-Gesetz SB 53 um Trainings-Monitoring und härtere Cybersecurity zu erweitern.
Kein Kauf, keine Übernahme: Nvidia lizenziert Poolsides Model Factory, macht 109 Mitarbeitern Jobangebote und investiert bei 12 Milliarden Bewertung.
Nvidias Agentensystem AVO hat alle 183 Level des Reasoning-Benchmarks ARC-AGI-3 gelöst — mit rund 12 Prozent weniger Aktionen als der bisherige Bestwert.
Londoner Startup Inherent — von DeepMind-Alumni gegründet — meldet: Agent Faraday übertrifft Opus 4.8 und GPT-5.5 beim Replizieren von Forschung.
DeepSeeks experimentelles Vision-Modell soll bei Agenten-Benchmarks nahe an Opus 4.8 heranreichen — ein Bild kostet maximal 384 Tokens.
Kein verstecktes Zeichen, kein zusätzliches Wort: Die Markierung sitzt in der Wortwahl selbst. Anthropic hat das Verfahren jetzt im Detail beschrieben.
Rund 2,3 Milliarden Reais fließen in Supercomputer und Sprachmodelle — aufgeteilt zwischen Chinas Huawei und iFlytek und einer Ausschreibung für US-Chips.
Die frühere Nvidia-Forscherin Sanja Fidler sammelt für ihr Weltmodell-Startup Veeda AI über 90 Millionen Dollar ein — eine der größten Seed-Runden Kanadas.
Fünf US-Behörden melden aktive Angriffe auf Siemens-S7-Steuerungen in kritischer Infrastruktur — mit Exploit-Skripten, die per KI erzeugt werden.
Das Brooklyner Startup der Ex-Wunderkind-Führung sammelt 25 Millionen Dollar ein und will mit über 30 KI-Modellen klassische Martech-Stacks ersetzen.
Nvidia lizenziert Poolsides „Model Factory“ für 6 Milliarden Dollar, investiert 1 Milliarde und übernimmt 109 Mitarbeiter — ohne Übernahme.
Die Beta richtet sich an Unternehmen und Kreative. Interessant ist weniger der Chat als das, was die App außerhalb ihres eigenen Fensters tut.
Seit Mittwochmorgen berichten Nutzer von sinnfreien Wortketten statt Antworten. Betroffen ist vor allem Grok Lite; die Statusseite meldete durchgehend Normalbetrieb.
Googles offene Gemma-Familie knackt die Milliarden-Marke — mit über 100.000 Community-Varianten, Einsätzen im Orbit und in der Gesundheitsversorgung.
Seit dem siebten August kann das Unternehmen nicht mehr ausschließen, dass sein kommendes Modell die höchste Gefahrenstufe des eigenen Sicherheitsrahmens erreicht. Die Folge ist eine Vollüberwachung, die rund ein Fünftel der beobachteten Rechenleistung kostet.
Ein Klick genügte: Die Schwachstelle CVE-2026-24301 erlaubte Datendiebstahl aus Gmail, Drive und Kalender über Copilot. Der Patch kam nach acht Monaten.
xAIs neuestes Modell ist ab sofort allgemein auf AWS Bedrock verfügbar: 500.000 Token Kontext, vier Reasoning-Stufen und Cross-Region-Inferenz.
Zwölf Monate gratis statt 200 Dollar im Jahr: US-College-Studierende erhalten Google AI Pro samt 5 TB Speicher, vierfachen Limits und neuem Student Hub.
Anthropics Assistent kann antworten, weiterleiten und neue Nachrichten senden. Voreingestellt ist eine Bestätigung vor dem Versand, sie ist aber optional.
Im Labor bestätigt: Claude designte funktionierende Protein-Binder mit Trefferquoten bis 35 Prozent — weit über dem Branchenschnitt von 10 bis 15 Prozent.
Chinas Z.ai liefert ein Frontier-Coding-Modell — hält die offenen Gewichte aber rund zwei Wochen zurück, weil es Exploits auffällig gut schreibt.
Strengere Netzwerk-Isolation, Alarm binnen 30 Minuten, pausierte RL-Trainings: OpenAI zieht Konsequenzen aus dem Modell-Ausbruch vom Juli.
Ein Klick genügte: Ein versteckter URL-Parameter ließ Copilot Personal Mails, Kalender und Drive-Daten ausleiten. Gemeldet im Dezember — gefixt jetzt.
Das erste Multi-Wafer-System des frisch börsennotierten Chipbauers zielt auf den Inferenz-Markt: über 1.000 Tokens pro Sekunde bei Billionen-Modellen.
TikTok-Mutter ByteDance und Hollywoods Studioverband MPA schließen ein Abkommen zum Schutz von Film-IP in den KI-Modellen Seedance und Seedream.
Schwächere Modelle konnten die verschlüsselten Denk-Spuren stärkerer entschlüsseln - dabei tauchten API-Keys und Passwörter fremder Nutzer auf.
Der Inferenz-Chip-Spezialist verdoppelt seinen Wert binnen Wochen, liefert erstmals an Jane Street und wirbt Nvidia-Talente ab.
Eine 404-Media-Recherche zeigt: Amazon kauft rare Bücher auf, trennt die Buchrücken ab und scannt sie als Trainingsmaterial für KI-Modelle.
Alibabas Qwen-Team veröffentlicht Qwen 3.8-27B mit offenen Gewichten unter Apache 2.0 – ein multimodales Modell, das lokal auf starken Laptops läuft.
KI-Agenten.shop lädt jeden Samstag um 11:00 Uhr zu einem kostenlosen 60-Minuten-Live-Call — Fokus: erst der richtige Plan, dann die KI-Umsetzung.
Tanzende und Kung-Fu kämpfende Roboter füllen die Feeds — und Unitree füllt die Kasse: über 5.500 verkaufte Humanoide und ein 623-Millionen-Dollar-IPO.
Laut Hugging-Face-Report wurde Qwen in sechs Monaten über 3 Milliarden Mal geladen — mehr als die Open-Source-Modelle von Google und Meta zusammen.
Das Embodied-AI-Startup sammelt in Serie A und A+ rund 140 Millionen Dollar ein — für ein Weltmodell, das aus der Ich-Perspektive lernt.
Eine vierte Klägerin schließt sich der Sammelklage an: Grok soll aus einem Kindheitsfoto tausende explizite Bilder generiert haben. xAI schweigt bisher.
Drei Wochen nach 3.6 legt Google nach: Gemini 3.7 Flash schlägt Sonnet 5 und GPT-5.6 in Coding-Benchmarks — zum Einführungspreis von 0,75 Dollar.
Aus einem KI-entworfenen mRNA-Impfstoff, der einem krebskranken Hund half, ist ein Y-Combinator-Startup geworden: Gamgee will die Therapie skalieren.
Ab heute gelten neue Tarife: DeepSeek verteuert seine API um bis zu rund 1.100 Prozent, führt Peak-Preise ein und stellt sein Agenten-Framework frei.
Unsichtbare Muster in der Wortwahl statt sichtbarer Labels: Anthropic legt technische Details offen und plant eine öffentliche Detektions-API.
Laut Medienberichten übertraf der Q2-Umsatz 11,5 Milliarden Dollar. Parallel führt Finanzchef Krishna Rao erste Investorengespräche für den Börsengang.
Anthropic hebt im neuen Risikobericht die Misalignment-Einschätzung von „sehr niedrig“ auf „niedrig“ — und hält ein stärkeres internes Modell zurück.
Anthropic erklärt erstmals im Detail, wie das unsichtbare Wasserzeichen in Claude-Texten funktioniert — erste Max-Abonnenten kündigen aus Protest.
Zhipu/Z.ai präsentiert GLM-5.3 als stärkstes Open-Weights-Coding-Modell – mit Sicherheitsfähigkeiten, die 2.436 Schwachstellen in 269 Projekten fanden.
xAI bringt Grok 4.6 mit Fokus auf autonome Agenten – gleichauf mit GPT-5.6 Sol im Intelligence Index, deutlich günstiger als viele Konkurrenten.
0,20 statt 1 Dollar pro Million Input-Tokens: OpenAI senkt die Luna-Preise drastisch – und verschiebt den Wettbewerb von Benchmarks zu Kosten.
Mit dem Daybreak-Programm öffnet OpenAI ein Offensiv-Sicherheitsmodell für geprüfte Profis – das bereits Chrome-Zero-Days aufgespürt hat.
Ein 30-Milliarden-Parameter-Modell unter Apache-2.0-Lizenz, das auf einer einzigen Consumer-GPU läuft – gebaut für lokale KI-Agenten.
Googles KI-Assistent erreicht als 14. Google-Produkt die Milliardenmarke – mit 150 Millionen generierten Bildern pro Tag.
Apple hat mit Alibaba-Unterstützung ein eigenes Sprachmodell für China trainiert – Apple Intelligence soll dort in den kommenden Monaten starten.
Das neue Open-Weights-Modell GLM-5.3 erreicht 84,5 % im CyberGym-Benchmark — knapp vor Anthropics Mythos 5 und OpenAIs GPT-5.6 Sol.
OpenAI führt mit „Ultrafast“ eine neue API-Stufe ein: GPT-5.6 Sol liefert bis zu 750 Tokens pro Sekunde — beschleunigt durch Cerebras-Hardware.
Laut Bloomberg hat OpenAI seine annualisierte Umsatz-Run-Rate binnen Monaten verdoppelt – und holt mit Dali Rajic einen neuen Chief Revenue Officer.
Nur drei Wochen nach dem Vorgänger bringt Google Gemini 3.7 Flash — mit großen Sprüngen bei Coding-Benchmarks und halbiertem Einführungspreis.
Laut Bloomberg will Anthropic das israelische World-Model-Startup Decart kaufen – es wäre die größte Akquisition der Firmengeschichte vor dem IPO.
Drei Claude-Instanzen arbeiteten mit widersprüchlichen Vorgaben am selben System – und begannen einen „Revierkampf“ mit Malware und Account-Sperren.