LIVE
+++ Kommentar: KI-Firmen sammeln Daten ohne Rücksicht +++ EdgeEver: Notiz-Archiv mit MCP-Zugang für KI-Agenten +++ PiClaw bringt den Pi-Coding-Agent in den Browser +++ LLMs als kognitives Virus: Preprint modelliert Abhängigkeit +++ AIHawk: Browser-Agent per MCP für Claude Code und Gemini +++ OpenGUI: KI-Agent steuert Android-Apps über die Oberfläche ++++++ Kommentar: KI-Firmen sammeln Daten ohne Rücksicht +++ EdgeEver: Notiz-Archiv mit MCP-Zugang für KI-Agenten +++ PiClaw bringt den Pi-Coding-Agent in den Browser +++ LLMs als kognitives Virus: Preprint modelliert Abhängigkeit +++ AIHawk: Browser-Agent per MCP für Claude Code und Gemini +++ OpenGUI: KI-Agent steuert Android-Apps über die Oberfläche +++
Alle News ›
AI IN LIFE AI IN LIFENEWS
DAILY
DE EN
MODELLE

Metas Muse Voice Transcribe: 3,1 % Fehlerrate im Livemodus

Das Modell zerlegt Sprache in 80-Millisekunden-Blöcke, trennt mehr als 20 Sprecher und liefert die Endfassung nach 0,16 Sekunden. Zum Download steht es nicht.

Metas Muse Voice Transcribe: 3,1 % Fehlerrate im Livemodus

Symbolbild: Auf einem Konferenztisch leuchtet ein Mikrofonarray, während zwei von hinten gezeigte Teilnehmende sich darüber beugen.

Muse Voice Transcribe schreibt laufende Sprache in Blöcken von 80 Millisekunden mit, erreicht dabei 3,1 Prozent Wortfehlerrate und trennt mehr als 20 Sprecher voneinander.

Auf einen Blick

  • Muse Voice Transcribe verarbeitet Audio in Blöcken von 80 Millisekunden; die Endfassung eines Satzes steht nach rund 0,16 Sekunden.
  • Wortfehlerrate 3,1 % im Streaming-Betrieb (Englisch) – vor ElevenLabs Scribe v2 mit 3,6 % und AssemblyAI Universal-3.5 mit 4,0 %.
  • Sprechertrennung: 17,5 % Fehlerrate im Mittel über AMI-IHM, AMI-SDM und VoxConverse; Konkurrenz liegt bei 21,1 bis 28,6 %.
  • Training auf über 70 Sprachen, 25 davon zum Start ausführlich geprüft; bis über 20 Personen pro Aufnahme werden getrennt.
  • Preis: 3 US-Dollar pro 1.000 Audiominuten (0,18 US-Dollar je Stunde); zugänglich über Meta Model API, Meta AI und Muse Code.

Muse Voice Transcribe von Meta Superintelligence Labs schreibt gesprochene Sprache mit, während sie noch läuft: Das Modell verarbeitet den Ton in Blöcken von 80 Millisekunden, trennt mehr als 20 Sprecher und erreicht nach Angaben von Meta eine Wortfehlerrate von 3,1 Prozent. Vorgestellt wurde es am 1. September 2026.

80 Millisekunden pro Block

Statt auf eine fertige Aufnahme zu warten, zerlegt das Modell den eingehenden Ton in Abschnitte von je 80 Millisekunden. Wie lange es pro Wort braucht, passt es dem Schwierigkeitsgrad an: Leichte Wörter gehen schnell durch, mehrdeutige bekommen mehr Zeit. Bis eine Passage als endgültig gilt, vergehen rund 0,16 Sekunden. Meta ordnet das System der Muse-Spark-Familie zu und beschreibt es als autoregressives multimodales Modell.

Im Streaming-Ranking von Artificial Analysis steht Muse Voice Transcribe mit 3,1 Prozent Wortfehlerrate auf Englisch vorn. ElevenLabs Scribe v2 kommt dort auf 3,6 Prozent, AssemblyAI Universal-3.5 auf 4,0 Prozent. Schneller festgelegt hat sich Scribe v2 allerdings mit 0,14 Sekunden.

Wer gerade spricht

Für ein Besprechungsprotokoll ist selten das einzelne Wort das Problem, sondern die Zuordnung: Wer hat was gesagt? Meta gibt für die Sprechertrennung eine mittlere Fehlerrate von 17,5 Prozent über die Testsätze AMI-IHM, AMI-SDM und VoxConverse an; die verglichenen Systeme liegen zwischen 21,1 und 28,6 Prozent. Mehr als 20 Stimmen in einer Aufnahme soll das Modell auseinanderhalten, auch bei Mitschnitten von über einer Stunde und ohne getrennten Nachbearbeitungslauf.

Dazu erkennt es Satzgrenzen und folgt Sprachwechseln mitten im Satz. Trainiert wurde auf über 70 Sprachen; ausführlich geprüft hat Meta zum Start 25 davon. Für die übrigen liegen keine veröffentlichten Messwerte vor.

Zugang, Preis und offene Fragen

Erreichbar ist das Modell über die Meta Model API, über Meta AI und über Muse Code. Meta ruft 3 US-Dollar pro 1.000 Audiominuten auf, das entspricht 0,18 US-Dollar je Stunde Ton. Einen Download der Gewichte sieht das Angebot nicht vor.

Offen bleibt, wie groß das Modell ist und woher die Trainingsdaten stammen – beides nennt Meta nicht. Sämtliche Genauigkeitswerte in diesem Text stammen aus Metas eigener Ankündigung und dem darin herangezogenen Ranking von Artificial Analysis; eine unabhängige Nachmessung durch Dritte liegt bislang nicht vor.

◈ KI-GENERIERTER BERICHT · QUELLEN VERLINKT

Häufige Fragen

Was ist Muse Voice Transcribe?

Ein Transkriptionsmodell von Meta Superintelligence Labs, das laufende Sprache in Blöcken von 80 Millisekunden verarbeitet, Satzgrenzen erkennt und mehr als 20 Sprecher auseinanderhält. Vorgestellt wurde es am 1. September 2026.

Wie genau transkribiert Muse Voice Transcribe?

Meta gibt 3,1 Prozent Wortfehlerrate auf Englisch im Streaming-Betrieb an, gemessen im Ranking von Artificial Analysis; ElevenLabs Scribe v2 liegt dort bei 3,6 Prozent, AssemblyAI Universal-3.5 bei 4,0 Prozent. Bei der Sprechertrennung nennt Meta 17,5 Prozent mittlere Fehlerrate.

Was kostet Muse Voice Transcribe und wo bekomme ich es?

3 US-Dollar pro 1.000 Audiominuten, also 0,18 US-Dollar je Stunde Ton, über die Meta Model API, Meta AI und Muse Code. Die Gewichte gibt Meta nicht heraus, ein Betrieb auf eigener Hardware ist damit nicht vorgesehen.