LIVE
+++ Wonderful: 550 Millionen Dollar bei 5 Milliarden Bewertung +++ Pentagon nimmt ChatGPT und Grok in GenAI.mil auf +++ US-Regierung stützt OpenAI im Rechtsstreit mit der NYT +++ Runway zeigt Solaris: KI erzeugt Oberflächen in Echtzeit +++ OpenAI verzögert Astra nach dem Hugging-Face-Hack +++ 30 neue Klagen gegen OpenAI nach Amoklauf in Kanada ++++++ Wonderful: 550 Millionen Dollar bei 5 Milliarden Bewertung +++ Pentagon nimmt ChatGPT und Grok in GenAI.mil auf +++ US-Regierung stützt OpenAI im Rechtsstreit mit der NYT +++ Runway zeigt Solaris: KI erzeugt Oberflächen in Echtzeit +++ OpenAI verzögert Astra nach dem Hugging-Face-Hack +++ 30 neue Klagen gegen OpenAI nach Amoklauf in Kanada +++
Alle News ›
AI IN LIFE AI IN LIFENEWS
DAILY
DE EN
TOOLS

Gemini durchsucht Videos jetzt agentisch

Statt fester Bildrate wählt das Modell selbst, welche Videostellen es prüft. Google nennt bis zu 88 Prozent weniger Tokens — nachgemessen hat das bisher niemand.

Gemini durchsucht Videos jetzt agentisch

Symbolbild: An einem Schnittplatz greift eine Person von hinten zum Jog-Rad, während eine Monitorwand unscharfe Videokacheln und ein Abspielgerät Statuslichter zeigt.

Gemini kann Videos jetzt agentisch auswerten: Das Modell entscheidet selbst, welche Abschnitte es in welcher Genauigkeit ansieht, statt jede Aufnahme mit einer festen Bildrate abzutasten.

Auf einen Blick

  • Verfügbar für Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite; die stärksten Messwerte nennt Google für 3.7 Flash.
  • Google beziffert die Ersparnis mit bis zu 88 % weniger Tokens, bis zu 66 % geringeren Kosten und bis zu 7 % mehr Genauigkeit.
  • Zugang über die Gemini API in Google AI Studio und über die Gemini Enterprise Agent Platform — hochgeladene Videos und YouTube-Links.
  • Keine Zusatzgebühr: Es gilt die reguläre Token-Abrechnung der Gemini API.
  • In der Gemini-App soll die Funktion bald erscheinen, in „Ask YouTube“ laut Google in den kommenden Monaten.

Gemini wertet Videos jetzt agentisch aus: Statt jedes Material mit einer festen Bildrate abzutasten, entscheidet das Modell selbst, welche Stellen es ansieht und wie genau. Google hat die Funktion in einem eigenen Blogbeitrag angekündigt. Sie steht zunächst für drei Modelle bereit.

Was sich am Verfahren ändert

Übliche Videoauswertung zerlegt eine Aufnahme in gleichmäßig verteilte Einzelbilder. Nach Googles Darstellung durchsucht Gemini das Material nun gezielt und wechselt dabei zwischen Bildspur, Tonspur und Transkript. Das Tempo der Abtastung richtet sich nach der gestellten Aufgabe, nicht nach einem voreingestellten Wert.

Entwickler schalten das Verhalten laut Ankündigung über einen Konfigurationswert in der Gemini API frei; Google zeigt dazu ein kurzes Python-Beispiel. Unterstützt werden hochgeladene Dateien und YouTube-Videos.

Die Zahlen stammen von Google selbst

Google nennt drei Kennzahlen: bis zu 88 % weniger Tokenverbrauch, bis zu 66 % niedrigere Kosten und bis zu 7 % höhere Genauigkeit. Die stärksten Werte erreicht demnach Gemini 3.7 Flash; die Funktion gilt außerdem für 3.6 Flash und 3.5 Flash-Lite.

Welche Testdaten hinter den Prozentangaben stehen, geht aus der Ankündigung nicht hervor. Es sind Herstellerangaben mit dem Zusatz „bis zu“ — eine unabhängige Nachmessung liegt zum Redaktionsschluss nicht vor.

Wofür Google die Funktion vorsieht

Als Anwendungsfälle nennt der Beitrag das Auffinden einzelner Momente im Sekundenbereich für den Videoschnitt sowie die Suche nach einer einzelnen Stelle in mehrstündigen Aufnahmen. Dazu kommen Anomalieerkennung durch erneutes, dichteres Abtasten auffälliger Abschnitte und das Zählen von Handlungen und Objekten über die Zeit.

Verfügbarkeit und Preis

Die Funktion läuft über die Gemini API in Google AI Studio und über die Gemini Enterprise Agent Platform. Eine gesonderte Gebühr fällt nicht an, abgerechnet wird nach dem regulären Token-Preis. Für die Gemini-App kündigt Google den Rollout „bald“ an, für die YouTube-Funktion „Ask YouTube“ in den kommenden Monaten — ein festes Datum nennt das Unternehmen in beiden Fällen nicht.

Was diese Meldung nicht belegt

Für diesen Text lag nur eine Quelle vor: Googles eigene Ankündigung. Leistungsangaben, Modellzuordnung und Zeitpläne sind damit nicht gegengeprüft. Offen bleibt außerdem, ob die genannte Ersparnis bei kurzen Clips ähnlich ausfällt wie bei mehrstündigem Material.

◈ KI-GENERIERTER BERICHT · QUELLEN VERLINKT

Häufige Fragen

Was bedeutet agentische Videoauswertung bei Gemini?

Das Modell tastet ein Video nicht mehr mit fester Bildrate ab, sondern sucht gezielt Abschnitte heraus und wechselt dabei zwischen Bild, Ton und Transkript.

Welche Gemini-Modelle können das?

Laut Google Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite. Die besten Messwerte nennt das Unternehmen für 3.7 Flash.

Kostet die agentische Videoauswertung extra?

Nein. Es gilt die reguläre Token-Abrechnung der Gemini API; eine zusätzliche Gebühr für die Funktion nennt Google nicht.