KI-Atlas Teil 2: Programmieren, Apps und Automatisierung
12 Bewertungen aus 4 Kategorien — welche Werkzeuge für Programmieren, Apps und Automatisierung in die engere Wahl gehören und wo ihre Grenzen liegen.
Kurz gesagt
Für Programmieren, Apps und Automatisierung bewertet der interne KI-Atlas 12 Produkte in 4 Kategorien nach Funktionspassung, Steuerbarkeit und Workflow-Anschluss — auf Basis der Herstellerdokumentation, nicht eines eigenen Produkttests.
Auf einen Blick
- 4 Kategorien und 12 bewertete Produkte in diesem Teil.
- Bewertung: Funktionspassung 50 %, Steuerbarkeit 25 %, Workflow-Anschluss 25 %, je 1–5.
- Prüfstand: Auswertung offizieller Herstellerangaben, kein eigener Labortest.
- Stand der Erhebung: 19. September 2026; 45 Kategorien, 95 Produkte, 123 Bewertungen insgesamt.
- Jede Kategorie nennt einen konkreten Vergleichstest, mit dem sich die Auswahl selbst prüfen lässt.
Teil 2 der Serie KI-Atlas ordnet ein, welche Werkzeuge für Programmieren, Apps und Automatisierung in die engere Wahl gehören. Grundlage ist ein interner Vergleich vom 19. September 2026: 45 Kategorien, 95 Produkte, 123 Bewertungen. Bewertet wurde die Eignung anhand offizieller Funktionsbeschreibungen der Anbieter — Funktionspassung 50 Prozent, Steuerbarkeit 25 Prozent, Workflow-Anschluss 25 Prozent, je 1 bis 5 Punkte. Das ist ausdrücklich kein eigener Produkttest und keine Messung der Ausgabequalität.
04 · Programmierung & Repository-Arbeit
Codex und Claude Code für abgegrenzte Projektaufgaben testen; Cursor für Arbeit im KI-Editor; Copilot bei GitHub-zentriertem Team.
| Produkt | Bewertung | Besonders geeignet | Grenze | Kostenfaktor |
|---|---|---|---|---|
| OpenAI Codex | ★★★★★ 5 | Repo-Aufgaben bis zu überprüften Änderungen | Produktionsreife entsteht erst durch echte Tests und Review. | Tarif / Nutzungsgrenzen |
| Claude Code | ★★★★★ 5 | Terminal- und Repository-Workflows | Umgebungszugriff, Tests und Freigaben müssen eingerichtet sein. | Tarif / API-Nutzung |
| Cursor | ★★★★★ 5 | Interaktive Entwicklung im KI-Editor | Modellwechsel und Agentenschleifen verändern Kosten und Verhalten. | Tarif / Modellverbrauch |
| GitHub Copilot | ★★★★★ 5 | Bestehende Entwicklerteams im GitHub-Workflow | Repository-Regeln und menschliches Code-Review bleiben erforderlich. | Tarif / Premium-Nutzung |
Vergleichstest: Drei echte Issues mit versteckten Regressionstests lösen lassen; nur geprüfte Änderungen zählen.
05 · Websites, Apps & Prototypen
v0 für visuell kontrollierte Weboberflächen; Lovable oder Replit für einen integrierten App-Einstieg. Kein automatisches Produktionssiegel.
| Produkt | Bewertung | Besonders geeignet | Grenze | Kostenfaktor |
|---|---|---|---|---|
| v0 | ★★★★★ 5 | Web-UI mit sichtbarer Bearbeitung und Deployment | Authentifizierung, Datenzugriff und Zahlungslogik separat testen. | Generierung plus Hosting |
| Lovable | ★★★★½ 4.5 | Schneller Full-Stack-Prototyp | Eine funktionierende Vorschau beweist keine sichere Produktion. | Generierung plus Cloud-Dienste |
| Replit Agent | ★★★★★ 5 | App entwickeln und betreiben in einer Umgebung | Laufende Hostingkosten und Zugriffsregeln sind Teil des Projekts. | Agentennutzung plus Hosting |
Vergleichstest: Login, Rollentrennung, mobile Ansicht, Export und Wiederherstellung desselben Mini-Projekts testen.
21 · Automatisierung & systemübergreifende Agenten
n8n für technisch betreute individuelle Abläufe, Make für visuelle Integration, Zapier Agents für angebundene SaaS-Aufgaben. Das Modell ist nur ein Bauteil.
| Produkt | Bewertung | Besonders geeignet | Grenze | Kostenfaktor |
|---|---|---|---|---|
| n8n | ★★★★★ 5 | Individuelle Prozesse mit Kontrolle über Ausführungen | Selbsthosting verschiebt Betrieb und Wartung zu uns. | Hosting / Ausführungen / Modellkosten |
| Make | ★★★★★ 5 | Visuell aufgebaute Integrationsabläufe | Fehlerpfade, Schleifen und Operationen müssen geplant werden. | Tarif / Credits / Modellkosten |
| Zapier Agents | ★★★★★ 5 | Agenten mit vorhandenen SaaS-Verbindungen | Autonome Aktionen brauchen klar begrenzte Rechte. | Tarif / Aktivitäten / weitere Dienste |
Vergleichstest: Anfrage zu CRM-Entwurf verarbeiten; Dublette, API-Ausfall, Wiederholung und menschliche Freigabe testen.
44 · Agenten testen, überwachen & betreiben
LangSmith für Beobachtbarkeit; Databricks für KI innerhalb der Datenplattform. Beide brauchen eigene Sollfälle und Fehlergrenzen.
| Produkt | Bewertung | Besonders geeignet | Grenze | Kostenfaktor |
|---|---|---|---|---|
| LangSmith | ★★★★★ 5 | Traces und Untersuchung von Agentenabläufen | Protokolle allein beweisen keine Qualität; Sollfälle und Abnahmen zusätzlich nötig. | Traces / Speicher / Tarif |
| Databricks AI | ★★★★½ 4.5 | KI-Betrieb in bestehender Datenplattform | Datenengineering und fachliche Evaluation bleiben eigene Arbeit. | Cloud / Rechenleistung / Plattform |
Vergleichstest: Bekannte Fehler einspielen: falsche Quelle, Timeout, doppelter Auftrag, unerlaubtes Werkzeug; Erkennung und Wiederanlauf prüfen.
Die Serie umfasst neun Teile; die übrigen Teile tragen die Nummern 1, 3, 4, 5, 6, 7, 8, 9. Sterne stehen für die dokumentierte Eignung, nicht für einen Sieger: In mehreren Kategorien empfiehlt der Vergleich ausdrücklich zwei Kandidaten nebeneinander, weil sie unterschiedliche Aufgaben lösen.
Häufige Fragen
Ist das ein eigener Produkttest?
Nein. Bewertet wurde die dokumentierte Eignung aus offiziellen Herstellerangaben. Ausgabequalität, Geschwindigkeit und Preis-Leistung im Alltag sind damit nicht gemessen.
Wie kommen die Sterne zustande?
Aus drei Teilnoten von 1 bis 5: Funktionspassung zaehlt 50 Prozent, Steuerbarkeit und Workflow-Anschluss je 25 Prozent. Das Ergebnis wird auf halbe Sterne gerundet.
Warum stehen manchmal zwei Produkte gleichauf?
Weil sie unterschiedliche Aufgaben lösen. Der Vergleich nennt in solchen Fällen bewusst beide, statt einen künstlichen Sieger zu bestimmen.