
Claude Sonnet 4.5 im Detail: verifizierte SWE-bench- und OSWorld-Werte, was sich für agentisches Coding änderte und wo das Modell 2026 steht.
📌 Update 2026: Dies ist ein archivierter Test von Claude Sonnet 4.5, veröffentlicht am 29. September 2025. Anthropic hat seither Sonnet 5 (30. Juni 2026) und die breitere Claude-5-Familie ausgeliefert. Das aktuelle Angebot finden Sie im Claude-Update-Tracker. Wir lassen diesen Test online, weil Sonnet 4.5 einen echten Wendepunkt für agentisches Coding markierte — und weil man wissen muss, wo das Feld stand, um zu beurteilen, wo es heute steht.
Sonnet 4.5 führte die wichtigen Coding-Benchmarks an und galt weithin als das stärkste damals verfügbare Coding-Modell — eine Aussage, die von unabhängigen Auswertungen gestützt wurde, nicht nur von Anthropics eigenen Zahlen.
Es ist gut gealtert. Die agentischen Muster, die es praktikabel machte — Fokus auf Aufgaben mit langem Horizont, Computernutzung, Workflows mit Checkpoints — wurden zur Vorlage, an der die Claude-5-Familie und die Konkurrenz weiterarbeiteten.
Sonnet 4.5 hielt die Mittelklasse-Position über vier Opus-4.x-Veröffentlichungen hinweg, bevor es ersetzt wurde. Ein Modell, das vier Flaggschiff-Erneuerungen über sich übersteht, ist keine Überbrückung — es ist die Stufe, die der Anbieter als tragend eingestuft hat.
Das am 29. September 2025 veröffentlichte Sonnet 4.5 wurde von Anthropic als „das weltweit beste Modell für Agenten, Coding und Computernutzung" positioniert. Unabhängige Benchmarks stützten die Coding-Aussage weitgehend:
$3 Eingabe / $15 Ausgabe je Million Token — unverändert gegenüber Sonnet 4, und das zählte: Das beste Coding-Modell war zugleich das mittelpreisige.
Sonnet 5 erschien am 30. Juni 2026. Der Generationenabstand auf den Suiten, an denen beide gemessen wurden:
| Benchmark | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| SWE-bench Pro (agentisches Coding) | 58.1% | 63.2% | 69.2% |
| OSWorld-Verified (Computernutzung) | 78.5% | 81.2% | — |
| GDPval-AA v2 (Wissensarbeit) | — | 1,618 | 1,615 |
Die 1,618 von Sonnet 5 bei Wissensarbeit liegen knapp über den 1,615 von Opus 4.8. Dass ein Mittelklassemodell das frühere Flaggschiff bei allgemeiner Wissensarbeit einholt, ist der deutlichste Beleg dafür, dass die These von Sonnet 4.5 — leistungsfähige Modelle müssen nicht die teuren sein — richtig war und weitergetrieben wurde.
Sonnet 4.5 startete zu $3/$15 je Million Token. Sonnet 5 startete zum Einführungspreis von $2/$10 bis zum 31. August 2026 und kehrt danach zu $3/$15 zurück. Fast ein Jahr später kostet die Stufe dasselbe und leistet deutlich mehr — das ist das gesamte Argument für die Mittelklassestrategie in einer Zeile.
Claude Opus 5 erschien am 24. Juli 2026 zu $5/$25 — dieselben Preise wie Opus 4.8. Die Flaggschiffstufe hielt ihren Preis, während die Arbeitspferdstufe den Großteil des Fähigkeitszuwachses aufnahm. Genau dieses Muster zeigt sich 2026 bei jedem Anbieter.
Bestand hatte: Die Benchmark-Führung war real, aber der Abstand war knapp (77.2% gegenüber 74.9% für GPT-5 bei SWE-bench Verified). Dauerhafter erwies sich der Abstand bei den agentischen Fähigkeiten — der OSWorld-Sprung und die Verlässlichkeit über lange Sitzungen ließen sich von der Konkurrenz nicht schnell nachbauen.
Die Berichterstattung der Startwoche (einschließlich der Urfassung dieses Artikels) stützte sich auf das Narrativ der „weltbesten Coding-KI" und auf Anekdoten von Marathonsitzungen wie 30-stündigen Dauerläufen. Diese Behauptungen gingen auf Demobedingungen zurück; die Ergebnisse im Alltag hingen stark von der Qualität des Harness und der Aufgabenzerlegung ab. Behandeln Sie jede Überlegenheitsaussage jener Zeit, die auf einer einzigen Zahl beruht, als Momentaufnahme, nicht als Gesetz.
„Weltbeste Coding-KI" als dauerhaftes Etikett. Nach den aktuellen SWE-bench-Pro-Werten liegen die 69.2% von Opus 4.8 sechs Punkte über den 63.2% von Sonnet 5 — und beide auf einer Suite, die es beim Start von 4.5 noch gar nicht gab. Die Benchmark-Führung in dieser Kategorie ist eine Momentaufnahme mit einer Haltbarkeit von Monaten.
Nein. Sonnet 5 ist auf jeder gemessenen Achse besser und — während des Einführungsfensters — günstiger. Es gibt kein Szenario, in dem ein neues Projekt mit 4.5 beginnt.
Die Migration ist ein klarer Gewinn: besseres agentisches Coding, bessere Computernutzung und Preise, die nach August wieder gleichziehen. Die Muster, die Sie um Checkpoints und Aufgaben mit langem Horizont gebaut haben, lassen sich direkt übertragen.
Sonnet 4.5 ist der klarste Fall eines Anbieters, der entschied, dass sich Leistungsfähigkeit in der mittleren Stufe verdichten soll. Jede spätere Anthropic-Veröffentlichung und Googles gesamte 3.x-Flash-Strategie sind Variationen dieser Entscheidung.
Sonnet 4.5 blieb über vier Opus-4.x-Veröffentlichungen hinweg Anthropics Arbeitspferd der Mittelklasse, erhielt im Februar 2026 eine 4.6-Auffrischung und wurde schließlich am 30. Juni 2026 von Sonnet 5 abgelöst, das den Fokus auf agentisches Coding mit stärkerer Werkzeugnutzung und stärkerem Reasoning fortschrieb.
Sonnet 4.5 ist die Veröffentlichung, bei der die Teile — Benchmarks, Computernutzung, Checkpoints, Memory — erstmals in einem einzigen mittelpreisigen Modell ineinandergriffen, und alles, was Anthropic danach lieferte, ist eine Ausarbeitung dieser Kombination.
Wenn Sie heute ein Modell wählen, beginnen Sie beim aktuellen Claude-Angebot. Für Arbeitsweisen, die auf den agentischen Mustern dieser Generation aufbauen, siehe Best Practices für Coding mit Claude; wie es sich gegen Copilot und Cursor schlägt, zeigt der Dreiervergleich.
Sources: Ankündigung von Anthropic · Benchmark-Tests von DataCamp · Coding-Auswertung von Surge AI · Analyse von CodeRabbit · TechCrunch zur Markteinführung
Archivierter Test · Grundlegend überarbeitet am 29. Juli 2026
Seedance 2.5 bietet 30 Sekunden Audio-Video, 50 Referenzen und zeitgesteuerte Bearbeitung. Was offiziell ist, was es kostet und was Sie testen sollten.
MiniMax H3 erzeugt 2K-Video mit nativem Stereoton, nennt Preise pro Sekunde und stellt H3-Base-Gewichte unter einer Community License bereit.
Hermes Agent verbindet persistentes Memory mit selbstverbessernden Skills; Sicherheit und Ergebnisse hängen von Backend, Genehmigungen und Ihrer Prüfung ab.
OpenClaw ist eine leistungsfähige Agent-Runtime, deren Nutzen von bewusst geplanter Gateway-Sicherheit, Skill-Prüfung und Betriebsdisziplin abhängt.
KI-Musik 2026: Können und Prozesse von Suno und Udio, AIVAs volles Urheberrecht und wie der Warner-Vergleich deine kommerziellen Rechte umschreibt.
Der KI-Videomarkt nach Soras Abgang, mit echten Preisen: 0,50 bis 2,50 Dollar pro 10-Sekunden-Clip, wer jetzt führt und wie man pro Einstellung wählt.
Der ehrliche Vergleich der Gratis-Tarife 2026: Geminis großzügiges Paket, Claudes Qualität, ChatGPTs begrenzte Breite und wann Gratis nicht reicht.
Was GPT-5 im August 2025 lieferte, warum der erste Monat holperte und wie sich die Architektur vom Standpunkt der drei GPT-5.6-Stufen aus liest.