KI-Atlas: Wie wir bewerten — und was die Sterne nicht sagen
45 Kategorien, 95 Produkte, 123 Bewertungen: Methode, Grenzen und der Testplan, mit dem sich jede Empfehlung selbst nachprüfen lässt.
Kurz gesagt
Die Sterne im KI-Atlas bewerten die dokumentierte Eignung für eine konkrete Aufgabe, nicht die objektive Bestleistung eines Produkts. Gemessen wurde nichts — Grundlage sind offizielle Herstellerangaben.
Auf einen Blick
- 45 Kategorien, 95 Produkte, 123 Bewertungen, Stand 19. September 2026.
- Redaktionelle Eignung aus offiziellen Funktionsbeschreibungen: F = Funktionspassung (50 %), S = Steuerbarkeit (25 %), W = Workflow-Anschluss (25 %). Je 1–5, Gesamt auf halbe Sterne gerundet. Fünf Sterne bedeuten bevorzugte engere Auswahl für die konkrete Aufgabe, nicht objektive Bestleistung. Gleiche Sterne sind kein Fehler. Herstellerangaben: T1, überwiegend mittlere Konfidenz. Preise, Ausgabequalität, Latenz und Kosten pro brauchbarem Ergebnis nicht gemessen. Udio: Exportblock überschreibt den Mittelwert auf 1/5 für externe Musiklieferung.
- Kein universeller KI-Sieger, keine Vollerhebung aller weltweit existierenden Produkte, keine eigenen Produkttests oder kontospezifische Preis-/Lizenzprüfung. Medizin, Finanzen, Personal, Architektur und industrielle Anwendungen benötigen eigene Fachabnahmen. Weitere Kategorieübersicht und konkrete Projektkombinationen stehen in der HTML-Fassung.
- Gleiche Sternzahl ist kein Fehler: mehrere Werkzeuge lösen unterschiedliche Aufgaben.
- Die Serie erscheint in neun Teilen; dieser Beitrag erklärt die Methode dahinter.
Redaktionelle Eignung aus offiziellen Funktionsbeschreibungen: F = Funktionspassung (50 %), S = Steuerbarkeit (25 %), W = Workflow-Anschluss (25 %). Je 1–5, Gesamt auf halbe Sterne gerundet. Fünf Sterne bedeuten bevorzugte engere Auswahl für die konkrete Aufgabe, nicht objektive Bestleistung. Gleiche Sterne sind kein Fehler. Herstellerangaben: T1, überwiegend mittlere Konfidenz. Preise, Ausgabequalität, Latenz und Kosten pro brauchbarem Ergebnis nicht gemessen. Udio: Exportblock überschreibt den Mittelwert auf 1/5 für externe Musiklieferung.
Was diese Bewertung ausdrücklich nicht ist
Kein universeller KI-Sieger, keine Vollerhebung aller weltweit existierenden Produkte, keine eigenen Produkttests oder kontospezifische Preis-/Lizenzprüfung. Medizin, Finanzen, Personal, Architektur und industrielle Anwendungen benötigen eigene Fachabnahmen. Weitere Kategorieübersicht und konkrete Projektkombinationen stehen in der HTML-Fassung.
So lässt sich jede Empfehlung selbst prüfen
Gleiches Briefing, gleiche Referenzen, dokumentierte Modellversion/Modus/Tarif/Region, mindestens fünf Wiederholungen pro Kandidat, Blindbewertung soweit möglich, Fehlversuche mitzählen. Gesamtkosten einschließlich manueller Nacharbeit pro akzeptiertem Ergebnis berechnen. Zuerst Song mit Lyrics, filmische Kontinuität, Anfrage-zu-CRM und belegte Newsredaktion testen.
Die neun Teile der Serie
- Teil 1: Assistenten, Recherche und Wissenschaft
- Teil 2: Programmieren, Apps und Automatisierung
- Teil 3: Bilder, Design und Produktfotos
- Teil 4: Video, Schnitt und Restaurierung
- Teil 5: Avatare, Stimmen und Übersetzung
- Teil 6: Musik, Gesang und Sounddesign
- Teil 7: Büro, Daten und Dokumente
- Teil 8: Kundenkontakt, Vertrieb und Marketing
- Teil 9: Spezialfälle von 3D bis Reise
Häufige Fragen
Warum gibt es keinen Gesamtsieger?
Weil die Eignung von der Aufgabe abhängt. Ein Werkzeug, das für lange Dokumente fünf Sterne bekommt, kann für Musikproduktion unbrauchbar sein.
Sind Preise berücksichtigt?
Nur als Kostenfaktor in Worten. Tarife, Nutzungslimits und Kosten pro brauchbarem Ergebnis wurden nicht gemessen.
Quellen
- EU-KI-Verordnung, Artikel 50 (Transparenzpflichten)
- ChatGPT — Hersteller
- Claude — Hersteller
- Gemini / Gemini API — Hersteller
- Mistral Vibe, vormals Le Chat — Hersteller
- Grok — Hersteller
- DeepSeek API — Hersteller
- Qwen-Modellfamilie — Hersteller
- Perplexity — Hersteller
- Gemini Notebook / NotebookLM — Hersteller
- Elicit — Hersteller
- Consensus — Hersteller