LIVE
+++ Nvidia-Agent AVO löst alle 183 Level von ARC-AGI-3 — 100 Prozent +++ DeepSeek startet Vision-Modell V4-Flash-Vision-Exp zum Kampfpreis +++ Anthropic holt Googles TPU-Architekten Amir Salek für eigene Chips +++ Broadcom sucht über 60 Milliarden Dollar Fremdkapital für Anthropic-Chips +++ Kehrtwende: OpenAI will Kaliforniens KI-Gesetz SB 53 verschärfen +++ Londoner Startup Inherent: Agent Faraday schlägt Frontier-Modelle bei Forschungs-Replikation ++++++ Nvidia-Agent AVO löst alle 183 Level von ARC-AGI-3 — 100 Prozent +++ DeepSeek startet Vision-Modell V4-Flash-Vision-Exp zum Kampfpreis +++ Anthropic holt Googles TPU-Architekten Amir Salek für eigene Chips +++ Broadcom sucht über 60 Milliarden Dollar Fremdkapital für Anthropic-Chips +++ Kehrtwende: OpenAI will Kaliforniens KI-Gesetz SB 53 verschärfen +++ Londoner Startup Inherent: Agent Faraday schlägt Frontier-Modelle bei Forschungs-Replikation +++
Alle News ›
AI IN LIFE AI IN LIFENEWS
DAILY
FORSCHUNG

Faraday: Kleiner KI-Agent schlägt Frontier-Modelle im Labor

Londoner Startup Inherent — von DeepMind-Alumni gegründet — meldet: Agent Faraday übertrifft Opus 4.8 und GPT-5.5 beim Replizieren von Forschung.

Faraday: Kleiner KI-Agent schlägt Frontier-Modelle im Labor

Symbolbild · KI-generiert (AI IN LIFE)

Auf einen Blick

  • Inherent-Meldung vom 22. August 2026: Faraday übertrifft Opus 4.8 und GPT-5.5 beim Replizieren von Forschung — ohne veröffentlichte Scores
  • Basis: Qwen 3.6 mit 27 Milliarden Parametern plus GPT-5.5 Codex für Coding
  • Training primär per Reinforcement Learning, Fokus auf „Research Taste“
  • Gründung durch DeepMind-Alumni; 50 Millionen Dollar Seed, Stealth-Exit Mai 2026
  • Team: rund 12 Mitarbeiter, geplant 20–25 bis Jahresende

Was wird behauptet? Das Londoner Startup Inherent meldet, sein KI-Agent Faraday habe beim Replizieren veröffentlichter Forschungsarbeiten sowohl Anthropics Claude Opus 4.8 als auch OpenAIs GPT-5.5 übertroffen — berichtet von TechCrunch am 22. August 2026. Konkrete Benchmark-Werte hat das Unternehmen allerdings nicht veröffentlicht — die Behauptung ist derzeit nicht unabhängig überprüfbar.

Wer steckt dahinter? Inherent wurde von den Google-DeepMind-Alumni Edward Hughes (Chief Scientist), Louis Kirsch, Kaloyan Aleksiev und Tantum Collins gegründet, sitzt in King's Cross und trat im Mai 2026 mit einer Seed-Runde über 50 Millionen US-Dollar aus dem Stealth-Modus. Das Team zählt rund 12 Köpfe und soll bis Jahresende auf 20 bis 25 wachsen.

Was macht Faraday technisch besonders? Der Agent basiert auf Qwen 3.6 mit 27 Milliarden Parametern — winzig gegenüber den Frontier-Systemen, die er geschlagen haben soll — und nutzt für Coding-Aufgaben GPT-5.5 Codex. Trainiert wurde vor allem per Reinforcement Learning: Faraday soll „Research Taste“ entwickeln, also das Gespür, welche Experimente sich lohnen und wie man sie sauber aufsetzt.

Wie ordnet der Gründer das ein? Hughes selbst relativiert den Benchmark-Sieg: „What was most interesting to us about this was not so much the result of beating those frontier agents — which of course we liked — but was actually the way we went about building this.“ Interessanter als das Schlagen der Frontier-Agenten sei der Weg dorthin gewesen.

Warum ist das relevant? Sollte sich das Ergebnis bestätigen, wäre es ein weiterer Beleg, dass spezialisierte kleine Agenten große Generalisten in Nischen schlagen können — mit deutlich geringeren Compute-Kosten. Für Forschungsabteilungen und wissenschaftsnahe Unternehmen entsteht damit eine neue Werkzeugklasse: der KI-Kollege, der Studien nachbaut, bevor man auf ihnen aufbaut.

◈ KI-GENERIERTER BERICHT · QUELLEN VERLINKT

Häufige Fragen

Sind die Ergebnisse unabhängig bestätigt?

Nein. Inherent hat keine konkreten Benchmark-Werte veröffentlicht; die Behauptung beruht auf Unternehmensangaben.

Was bedeutet Forschungs-Replikation?

Ein Agent versucht, die Experimente und Ergebnisse eines veröffentlichten Papers eigenständig nachzubauen — ein harter Test für wissenschaftliches Arbeiten.

Warum ist die Modellgröße bemerkenswert?

Faraday nutzt ein 27-Milliarden-Parameter-Modell und soll dennoch deutlich größere Frontier-Systeme übertroffen haben — ein Effizienz-Signal.