Toolso.AI
Toolso.AI
Alle ToolsKategorienIm TrendNeueste ToolsBlog
Toolso.AI
Toolso.AI

💌Abonnieren Sie AI Tools Weekly

Wöchentlich kuratierte Auswahl der neuesten und angesagtesten KI-Tools und Trends, direkt in Ihrem Posteingang Abonnieren

Toolso.AI
Toolso.AI

Entdecken Sie die besten KI-Tools, um Ihre Produktivität zu steigern

Email

Beliebte Kategorien

  • KI-Schreiben
  • KI-Bild
  • KI-Video
  • KI-Programmierung
  • Weitere Kategorien

Entdecken

  • Neueste Tools
  • Beliebte Tools
  • Mehr Tools
  • Tool einreichen
  • Preise

Über

  • Über uns
  • Kontakt
  • Blog
  • Änderungsprotokoll

Rechtliches

  • Cookie-Richtlinie
  • Datenschutzrichtlinie
  • Nutzungsbedingungen
  • Rückerstattungsrichtlinie
© 2026 Toolso.AI Alle Rechte vorbehalten
  1. Startseite
  2. Blog
  3. KI-Tool-Bewertungen
  4. Claude Sonnet 4.5 im Test: Der Meilenstein 2025
Titelbild des Artikels „Claude Sonnet 4.5 im Test: Der Meilenstein 2025“
2025/08/03
Aktualisiert am 2026/08/01

Claude Sonnet 4.5 im Test: Der Meilenstein 2025

Claude Sonnet 4.5 im Detail: verifizierte SWE-bench- und OSWorld-Werte, was sich für agentisches Coding änderte und wo das Modell 2026 steht.

📌 Update 2026: Dies ist ein archivierter Test von Claude Sonnet 4.5, veröffentlicht am 29. September 2025. Anthropic hat seither Sonnet 5 (30. Juni 2026) und die breitere Claude-5-Familie ausgeliefert. Das aktuelle Angebot finden Sie im Claude-Update-Tracker. Wir lassen diesen Test online, weil Sonnet 4.5 einen echten Wendepunkt für agentisches Coding markierte — und weil man wissen muss, wo das Feld stand, um zu beurteilen, wo es heute steht.

Das Urteil, damals und heute

Zum Start (September 2025)

Sonnet 4.5 führte die wichtigen Coding-Benchmarks an und galt weithin als das stärkste damals verfügbare Coding-Modell — eine Aussage, die von unabhängigen Auswertungen gestützt wurde, nicht nur von Anthropics eigenen Zahlen.

Im Rückblick (Juli 2026)

Es ist gut gealtert. Die agentischen Muster, die es praktikabel machte — Fokus auf Aufgaben mit langem Horizont, Computernutzung, Workflows mit Checkpoints — wurden zur Vorlage, an der die Claude-5-Familie und die Konkurrenz weiterarbeiteten.

Das Detail, das es bestätigt

Sonnet 4.5 hielt die Mittelklasse-Position über vier Opus-4.x-Veröffentlichungen hinweg, bevor es ersetzt wurde. Ein Modell, das vier Flaggschiff-Erneuerungen über sich übersteht, ist keine Überbrückung — es ist die Stufe, die der Anbieter als tragend eingestuft hat.

Was Sonnet 4.5 lieferte

Die Positionierung

Das am 29. September 2025 veröffentlichte Sonnet 4.5 wurde von Anthropic als „das weltweit beste Modell für Agenten, Coding und Computernutzung" positioniert. Unabhängige Benchmarks stützten die Coding-Aussage weitgehend:

Verifizierte Benchmark-Ergebnisse

  • SWE-bench Verified: 77.2% (82.0% mit erhöhtem Reasoning-Budget) — der damalige Spitzenwert, knapp vor der Coding-Variante von GPT-5 auf derselben Suite
  • OSWorld (Computernutzung): 61.4%, gegenüber 42.2% bei Sonnet 4 — ein Sprung in der Fähigkeit zu realen Computeraufgaben
  • Terminal-Bench: 61.3% mit erweitertem Denken — das erste Modell, das die 60%-Marke bei Terminalarbeit in der Sandbox durchbrach

Funktionale Meilensteine

  • Checkpoints — Fortschritt sichern und in langen Agentensitzungen zurückrollen
  • Native VS-Code-Erweiterung und Codeausführung innerhalb von Unterhaltungen
  • Memory-Tool für Aufgaben, die ein einzelnes Kontextfenster überdauern
  • Dateierstellung — Tabellen, Folien und Dokumente als vollwertige Ausgaben

Der Preis zum Start

$3 Eingabe / $15 Ausgabe je Million Token — unverändert gegenüber Sonnet 4, und das zählte: Das beste Coding-Modell war zugleich das mittelpreisige.

Wie weit sich die Linie bewegte: 4.5 → 5

Die Benchmark-Differenzen

Sonnet 5 erschien am 30. Juni 2026. Der Generationenabstand auf den Suiten, an denen beide gemessen wurden:

BenchmarkSonnet 4.6Sonnet 5Opus 4.8
SWE-bench Pro (agentisches Coding)58.1%63.2%69.2%
OSWorld-Verified (Computernutzung)78.5%81.2%—
GDPval-AA v2 (Wissensarbeit)—1,6181,615

Die Zahl, die die Stufe neu definiert

Die 1,618 von Sonnet 5 bei Wissensarbeit liegen knapp über den 1,615 von Opus 4.8. Dass ein Mittelklassemodell das frühere Flaggschiff bei allgemeiner Wissensarbeit einholt, ist der deutlichste Beleg dafür, dass die These von Sonnet 4.5 — leistungsfähige Modelle müssen nicht die teuren sein — richtig war und weitergetrieben wurde.

Die Preiskontinuität

Sonnet 4.5 startete zu $3/$15 je Million Token. Sonnet 5 startete zum Einführungspreis von $2/$10 bis zum 31. August 2026 und kehrt danach zu $3/$15 zurück. Fast ein Jahr später kostet die Stufe dasselbe und leistet deutlich mehr — das ist das gesamte Argument für die Mittelklassestrategie in einer Zeile.

Was Opus im Vergleich kostet

Claude Opus 5 erschien am 24. Juli 2026 zu $5/$25 — dieselben Preise wie Opus 4.8. Die Flaggschiffstufe hielt ihren Preis, während die Arbeitspferdstufe den Großteil des Fähigkeitszuwachses aufnahm. Genau dieses Muster zeigt sich 2026 bei jedem Anbieter.

Was Bestand hatte und was nicht

Bestand hatte

Bestand hatte: Die Benchmark-Führung war real, aber der Abstand war knapp (77.2% gegenüber 74.9% für GPT-5 bei SWE-bench Verified). Dauerhafter erwies sich der Abstand bei den agentischen Fähigkeiten — der OSWorld-Sprung und die Verlässlichkeit über lange Sitzungen ließen sich von der Konkurrenz nicht schnell nachbauen.

Braucht Kontext

Die Berichterstattung der Startwoche (einschließlich der Urfassung dieses Artikels) stützte sich auf das Narrativ der „weltbesten Coding-KI" und auf Anekdoten von Marathonsitzungen wie 30-stündigen Dauerläufen. Diese Behauptungen gingen auf Demobedingungen zurück; die Ergebnisse im Alltag hingen stark von der Qualität des Harness und der Aufgabenzerlegung ab. Behandeln Sie jede Überlegenheitsaussage jener Zeit, die auf einer einzigen Zahl beruht, als Momentaufnahme, nicht als Gesetz.

Die Behauptung, die nicht überlebte

„Weltbeste Coding-KI" als dauerhaftes Etikett. Nach den aktuellen SWE-bench-Pro-Werten liegen die 69.2% von Opus 4.8 sechs Punkte über den 63.2% von Sonnet 5 — und beide auf einer Suite, die es beim Start von 4.5 noch gar nicht gab. Die Benchmark-Führung in dieser Kategorie ist eine Momentaufnahme mit einer Haltbarkeit von Monaten.

Sollte Sonnet 4.5 Sie noch interessieren?

Wenn Sie heute ein Modell wählen

Nein. Sonnet 5 ist auf jeder gemessenen Achse besser und — während des Einführungsfensters — günstiger. Es gibt kein Szenario, in dem ein neues Projekt mit 4.5 beginnt.

Wenn Sie darauf aufgebaut haben

Die Migration ist ein klarer Gewinn: besseres agentisches Coding, bessere Computernutzung und Preise, die nach August wieder gleichziehen. Die Muster, die Sie um Checkpoints und Aufgaben mit langem Horizont gebaut haben, lassen sich direkt übertragen.

Wenn Sie die Strategie studieren

Sonnet 4.5 ist der klarste Fall eines Anbieters, der entschied, dass sich Leistungsfähigkeit in der mittleren Stufe verdichten soll. Jede spätere Anthropic-Veröffentlichung und Googles gesamte 3.x-Flash-Strategie sind Variationen dieser Entscheidung.

Wo es 2026 steht

Die Nachfolge

Sonnet 4.5 blieb über vier Opus-4.x-Veröffentlichungen hinweg Anthropics Arbeitspferd der Mittelklasse, erhielt im Februar 2026 eine 4.6-Auffrischung und wurde schließlich am 30. Juni 2026 von Sonnet 5 abgelöst, das den Fokus auf agentisches Coding mit stärkerer Werkzeugnutzung und stärkerem Reasoning fortschrieb.

Das Erbe in einem Satz

Sonnet 4.5 ist die Veröffentlichung, bei der die Teile — Benchmarks, Computernutzung, Checkpoints, Memory — erstmals in einem einzigen mittelpreisigen Modell ineinandergriffen, und alles, was Anthropic danach lieferte, ist eine Ausarbeitung dieser Kombination.

Wohin als Nächstes

Wenn Sie heute ein Modell wählen, beginnen Sie beim aktuellen Claude-Angebot. Für Arbeitsweisen, die auf den agentischen Mustern dieser Generation aufbauen, siehe Best Practices für Coding mit Claude; wie es sich gegen Copilot und Cursor schlägt, zeigt der Dreiervergleich.

Worauf zu achten ist

  1. Ob die Mittelklasse weiter zum Flaggschiff aufschließt — Sonnet 5 liegt bei Wissensarbeit bereits knapp vor Opus 4.8; noch eine Generation davon, und die Opus-Stufe braucht ein neues Argument
  2. Ob aus dem Einführungspreis der Normalpreis wird — die Rückkehr von $2/$10 auf $3/$15 am 1. September ist die Probe
  3. Ob SWE-bench Pro als Referenzsuite überlebt — die letzte hielt etwa ein Jahr
  4. Wie lange Opus 5 die $5/$25 hält — Preisstabilität beim Flaggschiff über zwei Generationen ist ungewöhnlich und beobachtenswert

Sources: Ankündigung von Anthropic · Benchmark-Tests von DataCamp · Coding-Auswertung von Surge AI · Analyse von CodeRabbit · TechCrunch zur Markteinführung

Archivierter Test · Grundlegend überarbeitet am 29. Juli 2026

Alle Beiträge

Autor

Logo von Toolso.AI
Toolso.AI

AI tools expert specializing in in-depth reviews, tutorials, and industry analysis

  • X
  • Website

Kategorien

  • KI-Tool-Bewertungen
  • Das Urteil, damals und heute
  • Zum Start (September 2025)
  • Im Rückblick (Juli 2026)
  • Das Detail, das es bestätigt
  • Was Sonnet 4.5 lieferte
  • Die Positionierung
  • Verifizierte Benchmark-Ergebnisse
  • Funktionale Meilensteine
  • Der Preis zum Start
  • Wie weit sich die Linie bewegte: 4.5 → 5
  • Die Benchmark-Differenzen
  • Die Zahl, die die Stufe neu definiert
  • Die Preiskontinuität
  • Was Opus im Vergleich kostet
  • Was Bestand hatte und was nicht
  • Bestand hatte
  • Braucht Kontext
  • Die Behauptung, die nicht überlebte
  • Sollte Sonnet 4.5 Sie noch interessieren?
  • Wenn Sie heute ein Modell wählen
  • Wenn Sie darauf aufgebaut haben
  • Wenn Sie die Strategie studieren
  • Wo es 2026 steht
  • Die Nachfolge
  • Das Erbe in einem Satz
  • Wohin als Nächstes
  • Worauf zu achten ist

Weitere Beiträge

Titelbild des Artikels „Seedance 2.5 Test: 30 Sekunden Audio-Video“
KI-Tool-Bewertungen

Seedance 2.5 Test: 30 Sekunden Audio-Video

Seedance 2.5 bietet 30 Sekunden Audio-Video, 50 Referenzen und zeitgesteuerte Bearbeitung. Was offiziell ist, was es kostet und was Sie testen sollten.

Profilbild von Toolso.AI
Toolso.AI
2026/08/01
Titelbild des Artikels „MiniMax H3 Test: 2K-Video, das Ton mitliefert“
KI-Tool-Bewertungen

MiniMax H3 Test: 2K-Video, das Ton mitliefert

MiniMax H3 erzeugt 2K-Video mit nativem Stereoton, nennt Preise pro Sekunde und stellt H3-Base-Gewichte unter einer Community License bereit.

Profilbild von Toolso.AI
Toolso.AI
2026/08/01
Titelbild des Artikels „Hermes-Agent-Test: Bessere Skills mit Nutzung“
KI-Tool-Bewertungen

Hermes-Agent-Test: Bessere Skills mit Nutzung

Hermes Agent verbindet persistentes Memory mit selbstverbessernden Skills; Sicherheit und Ergebnisse hängen von Backend, Genehmigungen und Ihrer Prüfung ab.

Profilbild von Toolso.AI
Toolso.AI
2026/08/01
Titelbild des Artikels „OpenClaw-Test: Leistungsstark, anpassbar, praxisnah“
KI-Tool-Bewertungen

OpenClaw-Test: Leistungsstark, anpassbar, praxisnah

OpenClaw ist eine leistungsfähige Agent-Runtime, deren Nutzen von bewusst geplanter Gateway-Sicherheit, Skill-Prüfung und Betriebsdisziplin abhängt.

Profilbild von Toolso.AI
Toolso.AI
2026/08/01
Titelbild des Artikels „KI-Musiktools 2026: Die Lizenz-Ära beginnt“
KI-Tool-Bewertungen

KI-Musiktools 2026: Die Lizenz-Ära beginnt

KI-Musik 2026: Können und Prozesse von Suno und Udio, AIVAs volles Urheberrecht und wie der Warner-Vergleich deine kommerziellen Rechte umschreibt.

Profilbild von Toolso.AI
Toolso.AI
2025/10/09
Titelbild des Artikels „Beste KI-Videotools 2026: Veo, Kling, Seedance“
KI-Tool-Bewertungen

Beste KI-Videotools 2026: Veo, Kling, Seedance

Der KI-Videomarkt nach Soras Abgang, mit echten Preisen: 0,50 bis 2,50 Dollar pro 10-Sekunden-Clip, wer jetzt führt und wie man pro Einstellung wählt.

Profilbild von Toolso.AI
Toolso.AI
2025/09/16
Titelbild des Artikels „Beste kostenlose KI-Tools 2026: Was Sie bekommen“
KI-Tool-Bewertungen

Beste kostenlose KI-Tools 2026: Was Sie bekommen

Der ehrliche Vergleich der Gratis-Tarife 2026: Geminis großzügiges Paket, Claudes Qualität, ChatGPTs begrenzte Breite und wann Gratis nicht reicht.

Profilbild von Toolso.AI
Toolso.AI
2025/09/06
Titelbild des Artikels „GPT-5 im Test: Der holprige Start, neu betrachtet“
KI-Tool-Bewertungen

GPT-5 im Test: Der holprige Start, neu betrachtet

Was GPT-5 im August 2025 lieferte, warum der erste Monat holperte und wie sich die Architektur vom Standpunkt der drei GPT-5.6-Stufen aus liest.

Profilbild von Toolso.AI
Toolso.AI
2025/08/20