
Alpha Arena ist ein öffentlicher Benchmark des KI-Forschungslabors Nof1, in dem Spitzenmodelle von OpenAI, Anthropic, Google, xAI, DeepSeek und Alibaba je 10.000 US-Dollar echtes Kapital eigenständig handeln, wobei Prompts, Gedankengänge und Handelsentscheidungen vollständig veröffentlicht werden.
Hast du dieses Tool genutzt? Bewerte es
Alpha Arena ist ein öffentlicher Live-Benchmark, in dem führende große Sprachmodelle jeweils echtes Geld erhalten und ohne menschliches Eingreifen eigenständig an realen Märkten handeln dürfen — und bei dem jeder Prompt, jeder Gedankengang und jede Handelsentscheidung für alle nachlesbar veröffentlicht wird. Die Seite beschreibt sich in sechs Worten: „AI trading in real markets" (KI, die an realen Märkten handelt).
Betrieben wird sie von Nof1, das kein Softwareanbieter ist, sondern ein KI-Forschungslabor. Diese Unterscheidung ist wichtig für alle, die hier ein Produkt zum Anmelden erwarten. Was Nof1 auf seiner Über-uns-Seite formuliert, ist ausdrücklich eine Forschungsthese: „Vor einem Jahrzehnt hat DeepMind die KI-Forschung revolutioniert. Ihre entscheidende Einsicht war, dass die Wahl der richtigen Umgebung – Spiele – zu raschem Fortschritt in der Spitzen-KI führt. Bei Nof1 glauben wir, dass Finanzmärkte die beste Trainingsumgebung für die nächste Ära der KI sind. Sie sind die ultimative Weltmodellierungsmaschine und der einzige Benchmark, der schwieriger wird, je klüger die KI wird."
Der auf dieser Seite formulierte Anspruch geht über das Führen einer Rangliste hinaus. Nof1 sagt, es nutze „Märkte, um neue Basismodelle zu trainieren, die unbegrenzt ihre eigenen Trainingsdaten erzeugen", setze dabei „offenes Lernen und groß angelegtes Reinforcement Learning ein, um die Komplexität der Märkte, des Endgegners, zu bewältigen", und sucht Bewerber, die es reizt, „AlphaZero für die reale Welt zu bauen". Alpha Arena ist mit anderen Worten das öffentlich sichtbare Experiment eines deutlich größeren Forschungsprogramms.
Unabhängige Berichterstattung bestätigt diese Identität und nicht bloß ihre Vermarktung. Das Venture-Fachmedium FinSMEs beschrieb das Unternehmen im Mai 2026 als „ein remote arbeitendes KI-Forschungslabor, das Spitzenmodelle mit Fokus auf Finanzmärkte trainiert", und berichtete von einer Finanzierungsrunde über 15 Millionen US-Dollar unter gemeinsamer Führung der an der Nasdaq notierten SUI Group und des Hedgefonds Karatage Opportunities. Gründer ist Jay Azhang, der den Start des Projekts am 17. Oktober 2025 öffentlich ankündigte und in unabhängigen Berichten sowohl von Protos als auch vom ukrainischen Krypto-Medium Incrypted als Gründer von Nof1 benannt wird.
Ungewöhnlich ist an diesem Benchmark nicht die Idee, KI an Märkten zu testen — das geschieht seit Jahren in Simulationen — sondern die Weigerung zu simulieren. Echtes Kapital, echte Ausführung, echte Slippage und echte Gebühren. Wie Azhang zum Start schrieb: „6 KI-Modelle handeln je 10.000 Dollar, vollständig autonom — echtes Geld, echte Märkte, echter Benchmark."
Und das ehrliche Ergebnis über zwei Saisons lautet: Die Modelle haben überwiegend verloren. Das ist das Interessanteste an diesem Projekt, und Nof1 veröffentlicht es, statt es zu verbergen.
Ein Live-Benchmark mit echtem Kapital. Jedes teilnehmende Modell erhält 10.000 US-Dollar echtes Geld und handelt eigenständig. Incrypteds Bericht zum Start zitiert das Labor, das Modelle beschreibt, die „vollständig autonom arbeiten und echte Geschäfte an den Live-Kryptomärkten tätigen: Bitcoin, Ethereum, Solana, Binance Coin, Dogecoin und XRP. Kein menschliches Eingreifen. Keine Beschränkungen außer jenen, die die Modelle selbst als Risikomanagement umzusetzen beschließen."
Identische Bedingungen über Anbieter hinweg. Der methodische Kern besteht darin, dass jedes Modell dieselben Eingaben und dasselbe Ausführungsgerüst erhält. Nof1s Forschungsblog nennt das Design unverblümt: „Wir gaben sechs führenden LLMs je 10.000 Dollar, um an realen Märkten autonom zu handeln, ausschließlich mit numerischen Marktdaten als Eingabe und demselben Prompt und Harness." Ohne diese Bedingung wäre der Vergleich sinnlos; mit ihr lassen sich Ergebnisunterschiede den Modellen zurechnen statt ihrem Gerüst.
Vier parallele Wettbewerbsspuren. Season 1.5 verteilt dieselben Modelle auf vier Regime — bezeichnet als 1: New Baseline, 2: Monk Mode, 3: Situational Awareness und 4: Max Leverage — samt einer Aggregate-Index-Ansicht darüber. Damit werden Unterschiede in Prompt und Risikohaltung zu kontrollierten Variablen statt zu Störgrößen, und genau deshalb kann dasselbe Modell mehrfach mit stark abweichenden Ergebnissen auf einer Rangliste erscheinen.
Vollständige Transparenz der Argumentation. Das ist die Funktion ohne echtes Gegenstück anderswo. Jede Entscheidung im Live-Feed trägt Modellnamen, Spur, Zeitstempel und eine Zusammenfassung in Klartext — und lässt sich in drei Rohfelder aufklappen: USER_PROMPT, CHAIN_OF_THOUGHT und TRADING_DECISIONS. Man liest genau, was einem Modell aufgetragen wurde, wie es dachte und was es tat. Wer Modellverhalten unter Druck untersucht, für den ist dieses Archiv das eigentliche Produkt.
Eine Rangliste mit echten Risikokennzahlen, nicht nur Renditen. Die Rangliste weist Kontowert, Rendite in Prozent, Gesamt-P&L, Gebühren, Trefferquote, größten Gewinn, größten Verlust, Sharpe-Ratio und Anzahl der Trades aus, filterbar nach Spur oder aggregiert. Gebühren und Sharpe neben die reine Rendite zu stellen, unterscheidet dies von einer bloßen Renditetabelle — und wie die Ergebnisse zeigen, steckt genau dort die Geschichte.
Spitzenmodelle konkurrierender Labore nebeneinander. Die beobachtete Rangliste umfasst GROK-4.20, GROK-4, GPT-5.1, CLAUDE-SONNET-4-5, GEMINI-3-PRO, DEEPSEEK-CHAT-V3.1, QWEN3-MAX und KIMI-K2-THINKING. Nur wenige öffentliche Settings stellen Modelle von OpenAI, Anthropic, Google, xAI, DeepSeek, Alibaba und Moonshot zeitgleich unter identische Bedingungen.
Anlageklassen, die zwischen den Saisons wechselten. Saison 1 handelte Krypto-Perpetuals. Season 1.5 wechselte zu US-Aktien und -Indizes — Live-Feed und Kurszeile decken TSLA, NDX, NVDA, MSFT, AMZN, GOOGL und PLTR ab. Dieser Wechsel ist selbst aufschlussreich: Eine Strategie, die in einem Regime funktionierte, überträgt sich nicht automatisch.
Die eigenen Erwartungen daran kalibrieren, was LLMs tatsächlich leisten. Das ist der Hauptnutzen, und er dämpft Erwartungen auf nützliche Weise. Wenn Ihnen erzählt wurde, man könne Spitzenmodelle auf Märkte richten und Renditen ernten, ist der veröffentlichte Verlauf die billigste verfügbare Korrektur: Über Saison 1 und Season 1.5 hinweg schlossen Modelle nur sechsmal von 32 Ergebnissätzen im Plus ab.
Modellverhalten und „Persönlichkeit" unter identischen Bedingungen untersuchen. Nof1s eigener früher Befund lautete, dass Modelle „echte Verhaltensunterschiede (Risiko, Positionsgröße, Haltedauer)" zeigen. Azhang beschrieb dies als „konsistente Verzerrungen", die auf „so etwas wie eine Anleger-'Persönlichkeit'" hinauslaufen. Wer das Gedankengang-Archiv liest, sieht, wie ein Modell Geduld begründet, während ein anderes zur selben Stunde beim selben Instrument Hebel rechtfertigt.
Forschung zur Prompt-Sensitivität. Der Blog meldet „eine Empfindlichkeit gegenüber kleinen Prompt-Änderungen", und die Vier-Spuren-Struktur macht das messbar statt anekdotisch. Wer agentische Systeme baut, findet im sichtbaren Abstand zwischen New Baseline und Max Leverage beim selben Modell eine konkrete Lektion darüber, wie viel vom Verhalten eines Agenten in seinen Anweisungen statt in seinen Gewichten steckt.
Lehre und Kommentar zu KI-Fähigkeitsversprechen. Die Kombination aus einer harten, unnachgiebigen Ergebnistafel und vollständig veröffentlichter Argumentation ergibt ein ungewöhnlich gutes Lehrstück — die Begründungen klingen oft genau dort am souveränsten, wo das Ergebnis schlecht ausfiel.
Verstehen, warum Handelskosten naive Agentenstrategien dominieren. Nof1s eigene Auswertung hält fest, dass „das P&L in frühen Läufen von den Handelskosten dominiert wurde, da Agenten übermäßig handelten und schnelle, winzige Gewinne mitnahmen, die von Gebühren aufgezehrt wurden". Wer einen automatisierten Agenten entwirft, der in einer gebührenbehafteten Umgebung häufig handelt, sollte diesen Satz zweimal lesen.
Vergleichende Bewertung jenseits statischer Benchmarks. Für Forschende, die daran verzweifeln, dass gesättigte Multiple-Choice-Benchmarks Spitzenmodelle nicht mehr unterscheiden, ist ein realer Markt ein Benchmark, der sich dem Auswendiglernen entzieht und laut Nof1 schwieriger wird, je besser die Modelle werden.
Wofür es nicht taugt. Es ist kein Anlageprodukt, kein Handelswerkzeug, kein Signaldienst und keine Strategie zum Nachahmen. Es bietet Nutzern kein Portfolio, keine Ausführung, keine Risikokontrollen und keine Beratung.
Schritt 1 – Beginnen Sie bei der Rangliste, nicht beim Live-Feed. Der Live-Feed ist fesselnd, aber anekdotisch. Die Rangliste liefert die Verteilung: welche Modelle, in welcher Spur, wo landeten und zu welchen Gebührenkosten.
Schritt 2 – Lesen Sie die Sharpe-Spalte vor der Renditespalte. Die Rendite sagt, was geschah; der Sharpe sagt, ob es verdient oder bloß überstanden war. In der beobachteten Rangliste drängen sich die Sharpe-Werte nahe null und rutschen ins Negative — auch bei Modellen mit hoher Rendite.
Schritt 3 – Vergleichen Sie ein Modell über alle vier Spuren. Das ist die lehrreichste Einzelübung auf der Seite. Wählen Sie ein Modell, das in New Baseline, Monk Mode, Situational Awareness und Max Leverage auftaucht, und betrachten Sie die Streuung. Die beobachteten Daten zeigen GROK-4.20 mit 13.459 Dollar in einer Spur, während GROK-4 in einer anderen bei 385,02 Dollar endete — Prompt und Risikoregime bewegten das Ergebnis stärker als die Modellwahl.
Schritt 4 – Klappen Sie den Gedankengang eines Verlusttrades auf. Öffnen Sie USER_PROMPT, CHAIN_OF_THOUGHT und TRADING_DECISIONS bei einer Entscheidung, die schieflief. Selbstbewusste Argumentation an einem schlechten Ergebnis zu lesen, ist die schnellste Kur gegen zu viel Vertrauen in flüssige Modellausgaben.
Schritt 5 – Halten Sie die Gebührenspalte gegen die P&L-Spalte. Bei mehreren Modellen machen die gezahlten Gebühren einen großen Teil des absoluten P&L aus oder übersteigen es. Das ist die konkrete Gestalt des vom Labor dokumentierten Übertradings.
Schritt 6 – Prüfen Sie die Daten, bevor Sie Schlüsse ziehen. Die Seite trägt einen ausdrücklichen Hinweis: „Der offizielle Wettbewerb endete am 3. Dezember 2025 um 17:00 Uhr EST. Die Modelle laufen nicht mehr." Sofern seither keine neue Saison begann, sehen Sie das Archiv einer abgeschlossenen Saison.
Schritt 7 – Lesen Sie den Forschungsblog wegen der Methodik, nicht nur der Ergebnisse. Der Blogeintrag erklärt, was den Modellen gegeben wurde und was nicht — unverzichtbarer Kontext, bevor man irgendeine Zahl als Urteil über die allgemeine Fähigkeit eines Modells behandelt.
Schritt 8 – Behandeln Sie das „Mystery Model"-Ergebnis mit Vorsicht. Der Sieger von Season 1.5 wird als „Mystery Model" veröffentlicht, mit 12,11 % aggregierter Rendite über zwei Wochen und 4.844 Dollar über alle Wettbewerbe hinweg. Da der Sieger unbenannt bleibt, lässt sich dieses Ergebnis keinem Anbieter zurechnen.
Gewichten Sie den Aggregatwert höher als jede einzelne Spur. Eine Spur über zwei Wochen ist eine sehr kleine Stichprobe. Den Aggregate Index gibt es genau deshalb, weil Einzelregime-Ergebnisse verrauscht sind — und selbst das Aggregat deckt ein kurzes Fenster ab.
Denken Sie daran, was den Modellen vorenthalten wurde. Azhang hat ausdrücklich gesagt, der Aufbau sei bewusst schwer: „LLMs kommen mit numerischen Zeitreihendaten nicht besonders gut zurecht, aber genau das war der einzige Kontext, den wir ihnen gaben", und die Modelle bekamen „ein eingeschränktes Anlageuniversum und einen ziemlich begrenzten Handlungsraum". Schwache Ergebnisse sind hier Evidenz über diese Konfiguration, kein Beweis, dass LLMs niemals handeln können.
Lesen Sie eine Zweiwochenrendite nicht als Können. Bei Trefferquoten zwischen 25 % und 30 % in Saison 1 sind Ergebnisunterschiede über vierzehn Tage stark glücksgetrieben. Sharpe, Trade-Anzahl und Gebührenlast tragen mehr Information als die Platzierung.
Achten Sie auf die Spannweite der Handelsfrequenz. In Saison 1 tätigte Gemini 238 Trades, Claude Sonnet 38. Frequenz ist eine Verhaltenssignatur, die unmittelbar mit Gebühren interagiert, und sagt das Ergebnis oft besser voraus als die Richtungstrefferquote.
Nutzen Sie den Testlauf als Warnbeispiel für Varianz. Vor der öffentlichen Saison führte das Team am 11. Oktober 2025 einen Versuch mit 200 Dollar je Modell durch, in dem Grok-4 am ersten Tag 500 % Rendite verbuchte. Diese Zahl ist als Fähigkeitssignal bedeutungslos und veranschaulicht gut, warum kurze Fenster und kleine Einsätze in die Irre führen.
Extrapolieren Sie nicht über Anlageklassen hinweg. Saison 1 waren Krypto-Perpetuals, Season 1.5 US-Aktien. Ergebnisse in einem Regime sagen wenig über das andere.
Behandeln Sie veröffentlichte Argumentation als Daten, nicht als Rat. Das Gedankengang-Archiv ist für Forschung wirklich wertvoll. Es ist keine Sammlung von Handelsideen, und die Modelle, die es hervorbrachten, verloren häufiger Geld, als sie welches verdienten.
Prüfen Sie, ob eine Saison läuft, bevor Sie die Zahlen für aktuell halten. Die Seite ist beim Wettbewerbsstatus ehrlich; Leser, die von einem Monate alten Artikel kommen, sind es oft nicht.
KI-Forschende und Evaluationsfachleute. Wenn Ihre Arbeit das Messen von Modellfähigkeiten umfasst, ist dies ein seltenes Beispiel für einen Benchmark mit wirklich gegnerischer Umgebung, realen Konsequenzen und vollständiger Argumentationstransparenz.
Ingenieure, die agentische Systeme bauen. Der sichtbare Abstand zwischen den Spuren ist eine praktische Lektion über Prompt- und Gerüstsensitivität, und das Verhältnis von Gebühren zu P&L ist eine direkte Warnung vor Agenten, die zu häufig handeln.
Quantitative und systematische Händler. Nicht als Strategiequelle, sondern als Evidenz dazu, ob universelle Sprachmodelle derzeit eine Bedrohung für systematische Ansätze darstellen oder einen Hebel bieten. Die veröffentlichten Sharpe-Werte sind die einschlägige Antwort.
Journalisten, Lehrende und Analysten, die KI-Versprechen behandeln. Der Datensatz ist öffentlich, die Methodik ist benannt, und die Ergebnisse widersprechen dem aufgeblasensten Marketing der Branche. Diese Kombination findet man selten.
Informierte Beobachter der KI-Branche. Wer wissen will, ob Spitzenmodelle in einer unnachgiebigen, offenen Umgebung kompetent handeln können, findet hier die direkteste verfügbare öffentliche Evidenz.
Wer die Finger davon lassen sollte. Privatanleger auf der Suche nach kopierbaren Signalen; alle, die ein Handelswerkzeug, eine Portfolioverwaltung oder Beratung suchen; und alle, die eine Zweiwochenrangliste als Grundlage für die Allokation eigenen Geldes nähmen. Nof1 veröffentlicht auf seiner Seite keinen Anlagehaftungsausschluss, aber die Ergebnisse sprechen für sich: Die meisten Teilnehmer verloren.
Alpha Arena ist ein reines Webprodukt, erreichbar unter nof1.ai. Die gesamte Seite besteht aus fünf Navigationszielen — LIVE, LEADERBOARD, BLOG, MODELS und ABOUT — und es gibt keine Desktop-Anwendung, keine mobile App, keine Browsererweiterung und keine öffentliche API-Dokumentation. Alles, was das Projekt der Öffentlichkeit bietet, lässt sich ohne Konto im Browser lesen.
Die Ausführungsinfrastruktur unterscheidet sich von der Darstellungsebene. Die Trades der Saison 1 wurden auf Hyperliquid ausgeführt, einer dezentralen Börse für unbefristete Terminkontrakte. Laut Incrypted wurde die Modellleistung zusätzlich über eine öffentlich zugängliche Tabelle verfolgt, die Sharpe-Ratios und den Gesamtportfoliowert misst. Dritte bauten auf den öffentlichen Daten eine Nachahmfunktion auf — Incrypted merkt an, Nutzer könnten „die Erfolge der Modelle verfolgen und ihre Strategie kopieren, etwa über die Plattform Coinpilot". Dieser Copy-Trading-Weg wird von einer externen Plattform bereitgestellt, nicht von Nof1, was für die Verteilung von Risiko und Verantwortung wesentlich ist.
Ankündigungen und Saisonupdates laufen über den offiziellen X-Account @the_nof1 und über den persönlichen Account von Gründer Jay Azhang, wo der Start am 17. Oktober 2025 zuerst bekanntgegeben wurde.
Ein praktischer Hinweis zum Zugriff: Die Seite liegt hinter Vercels Sicherheitsprüfpunkt und kann automatisierten Anfragen HTTP 429 zurückgeben. Der normale Browserzugriff ist davon nicht betroffen.
Alpha Arena ist vollständig kostenlos einsehbar, und es gibt keinerlei kostenpflichtige Stufe.
Nirgends auf der Seite finden sich Preisseite, Kontosystem, Login, Abonnement oder Bezahlvorgang. Das komplette öffentliche Dashboard — der Live-Entscheidungsfeed, die Rangliste mit allen Leistungskennzahlen, die aggregierten Diagramme und der Forschungsblog — ist ohne Registrierung zugänglich. Die einzige vorhandene Konversionsaktion ist eine „Join the Waitlist"-Aufforderung, und der einzige Handlungsaufruf der Über-uns-Seite betrifft Personal: „wir stellen ein: Ingenieure, Forschende, Gründer, eigenständige Denker", gefolgt von einem Kontaktlink.
Das passt zu dem, was diese Organisation ist. Nof1 finanziert sich als Forschungslabor, nicht über Nutzer. FinSMEs berichtete im Mai 2026 über die von SUI Group und Karatage Opportunities gemeinsam geführte Runde über 15 Millionen Dollar, deren Erlös „zur Ausweitung des Betriebs und der Entwicklungsarbeit" bestimmt ist.
Ein kommerzielles Produkt ist geplant, existiert aber noch nicht. Demselben Bericht zufolge beabsichtigt Nof1 nach Saison 2, „eine Verbraucherplattform mit den weltweit ersten Coding-Agenten für Märkte zu starten", aufgebaut auf den eigenen Spitzenmodellen des Labors. Saison 2 selbst wird als Ergänzung um Websuche, verlängerte Denkzeit und mehrstufige Ausführung beschrieben sowie als Entwicklung eigener Nof1-Modelle statt nur des Testens fremder. All das ist als offengelegte Roadmap zu behandeln und nicht als ausgelieferte Funktionalität — nichts davon steht heute zur Verfügung.
Die praktische Folge für Leser, die diesen Eintrag bewerten: Es gibt nichts zu kaufen, nichts zu testen und keine Verpflichtung einzugehen. Es gibt aber ebenso wenig eine Supportbeziehung, kein SLA und keine Garantie, dass eine bestimmte Saison stattfindet.
Der ehrliche Vergleich lautet: Die Stärke von Alpha Arena ist zugleich seine Schwäche. Reale Märkte machen es unfälschbar und nicht sättigbar; sie machen es zugleich stichprobenarm, teuer und verrauscht. Es ergänzt statistische Benchmarks, statt sie zu ersetzen.
Das zentrale Ergebnis ist, dass die Modelle überwiegend verloren, und dieser Kontext sollte alles Weitere rahmen. Protos berichtete in einer unabhängigen Darstellung unter dem Titel „LLM-Krypto-Handelswettbewerb zeigt: LLMs können keine Kryptowährungen handeln", dass „vier von sechs großen Sprachmodellen, die im Krypto-Handelswettbewerb 'Alpha Arena' gegeneinander antraten, im Minus schlossen, wobei OpenAIs ChatGPT die Verluste anführte, nachdem es 63 % seiner Mittel verloren hatte".
Die Verluste je Modell waren erheblich. Protos' Zahlen für Saison 1: ChatGPT verlor 6.267 Dollar, Gemini 5.671 Dollar, Grok 4.531 Dollar und Claude Sonnet 3.081 Dollar. Nur zwei lagen vorn — DeepSeek mit +489 Dollar und QWEN3 MAX mit +2.232 Dollar.
Das Muster hielt über die Saisons hinweg. FinSMEs berichtet, dass über Saison 1 und Season 1.5 zusammen, bei acht Modellen mit je 10.000 Dollar, „die Modelle über 32 Ergebnissätze hinweg nur sechsmal im Plus abschlossen". Das entspricht rund 81 % Misserfolg auf Modell-Spur-Ebene.
Die Trefferquoten waren schwach und einheitlich. Alle sechs Modelle der Saison 1 lagen zwischen 25 % und 30 %. Die Handelsfrequenz schwankte enorm — 238 Trades bei Gemini gegen 38 bei Claude Sonnet — was bedeutet, dass hier recht unterschiedliche Verhaltensstrategien verglichen werden und nicht bloß unterschiedliche Urteilsqualität.
Gebühren fraßen den Vorteil auf. Nof1 räumte selbst ein, dass „das P&L in frühen Läufen von den Handelskosten dominiert wurde, da Agenten übermäßig handelten und schnelle, winzige Gewinne mitnahmen, die von Gebühren getilgt wurden". QWEN3 MAX zahlte mit 1.654 Dollar die höchsten Gebühren; Gemini zahlte 1.331 Dollar und verlor dabei kräftig.
Selbst bei den Gewinnern war die risikoadjustierte Leistung schwach. Die beobachtete Rangliste zeigt Sharpe-Ratios nahe null — 0,019158 für das Modell mit dem höchsten Kontowert, 0,009537 und 0,000667 für die beiden folgenden, weiter unten negative Werte wie -0,010358 und -0,038861. Positive Renditen bei nahezu null Sharpe über zwei Wochen sind kein Beleg für Können.
Die Streuung innerhalb eines Modells untergräbt Schlüsse auf Modellebene. GROK-4.20 beendete eine Spur mit 13.459 Dollar (+34,59 %), während GROK-4 eine andere mit 385,02 Dollar abschloss — nahezu Totalverlust. Wenn die Modelle desselben Anbieters beide Extreme besetzen, sagt die Platzierung mehr über Regime und Glück als über Fähigkeit.
Die Stichprobe ist für statistische Aussagen viel zu klein, und das Labor stimmt dem zu. Protos berichtet, Nof1 „kündigt einen weiteren Handelswettbewerb mit besseren Prompts und 'statistischer Strenge' an" — ein implizites Eingeständnis, dass es den bisherigen Saisons daran fehlt. Zwei Wochen, eine Handvoll Modelle und einige Dutzend Ergebnissätze tragen keine starke Schlussfolgerung.
Das Harness beschränkt die Modelle, was das Labor offen dokumentiert. Nof1s Auswertung hält fest: „Wir haben daran gearbeitet, den Modellen eine faire Chance zu geben, aber das Harness setzt reale Beschränkungen. Jeder Agent muss verrauschte Marktmerkmale auswerten, sie mit dem aktuellen Kontostand in Beziehung setzen, unter strengen Regeln schlussfolgern und eine strukturierte Aktion zurückgeben — und all das in einem begrenzten Kontextfenster." Azhang ergänzte, die Modelle hätten „ein eingeschränktes Anlageuniversum und einen ziemlich begrenzten Handlungsraum" erhalten und ausschließlich numerische Zeitreihen, ein Format, mit dem LLMs schlecht umgehen. Schwache Ergebnisse sind daher Evidenz über genau diese Konfiguration.
Der Wettbewerb läuft derzeit nicht. Die Seite formuliert es klar: „Der offizielle Wettbewerb endete am 3. Dezember 2025 um 17:00 Uhr EST. Die Modelle laufen nicht mehr." Wer Live-Geschehen erwartet, findet womöglich nur ein Archiv.
Der Sieger von Season 1.5 ist nicht zurechenbar. Der Gewinnerbeitrag erscheint als „Mystery Model" — 12,11 % aggregierte Rendite über zwei Wochen, 4.844 Dollar über alle Wettbewerbe. Ein unbenannter Sieger lässt sich keinem Anbieter gutschreiben, was den Aussagewert dieses Ergebnisses begrenzt.
Auf der Seite fehlen jegliche rechtlichen oder Governance-Angaben. Die Über-uns-Seite nennt keine eingetragene juristische Person, keine Gründungsjurisdiktion, keine Adresse und keine Teamliste. Auf Startseite, Über-uns und Rangliste findet sich kein Link zu Datenschutzerklärung, Nutzungsbedingungen oder Cookie-Richtlinie. Die Identität des Unternehmens wird durch die Finanzpresse Dritter belegt, nicht durch die Seite selbst.
Es gibt weder einen Anlagehaftungsausschluss noch eine Angabe zum Regulierungsstatus. Die Seite stellt nicht klar, dass Ergebnisse keine Anlageberatung darstellen, und Nof1 legt keine Finanzlizenz oder aufsichtsrechtliche Zulassung offen. Dies ist eine Forschungsdemonstration und kein regulierter Finanzdienst; veröffentlichte Trades sollten nicht als Empfehlungen gelesen werden.
Copy-Trading findet außerhalb von Nof1s Perimeter statt. Da Drittplattformen es Nutzern ermöglichen, Modellstrategien zu spiegeln, übernimmt jeder, der das tut, Kapitalrisiko und regulatorische Exposition an einem Ort, den Nof1 weder betreibt noch beaufsichtigt.
Für veröffentlichte Prompts und Argumentationen gilt keine ausgewiesene Lizenz. Die vollständigen USER_PROMPT- und CHAIN_OF_THOUGHT-Aufzeichnungen sind offen einsehbar, doch die Seite legt keine ausdrücklichen Bedingungen für deren Weiterverwendung fest, womit die Position zu Nachdruck oder Datensatznutzung undefiniert bleibt.
Vollständig. Der Live-Entscheidungsfeed, die Rangliste mit allen Kennzahlen, die aggregierten Diagramme und der Forschungsblog sind ohne Konto einsehbar, und es gibt weder Preisseite noch Abonnement oder Bezahlvorgang. Die einzigen Daten, die Sie übermitteln können, sind eine E-Mail-Adresse für die Warteliste oder eine Nachricht über das Kontaktformular.
Ja. Jedem teilnehmenden Modell wurden 10.000 Dollar echtes Kapital zugeteilt, mit dem es ohne menschliches Eingreifen eigenständig handelte. Saison 1 führte Krypto-Perpetuals an der dezentralen Börse Hyperliquid aus; Season 1.5 handelte US-Aktien und -Indizes, darunter TSLA, NVDA, MSFT, AMZN, GOOGL, PLTR und den NDX-Index.
Spitzenmodelle konkurrierender Labore laufen unter identischen Bedingungen nebeneinander. Die beobachtete Rangliste umfasst GROK-4.20, GROK-4, GPT-5.1, CLAUDE-SONNET-4-5, GEMINI-3-PRO, DEEPSEEK-CHAT-V3.1, QWEN3-MAX und KIMI-K2-THINKING und deckt damit OpenAI, Anthropic, Google, xAI, DeepSeek, Alibaba und Moonshot ab.
Überwiegend nicht, und das ist der zentrale Befund. Vier von sechs Modellen beendeten Saison 1 im Minus, ChatGPT verlor 63 % seiner Mittel. Über Saison 1 und Season 1.5 zusammen schlossen Modelle nur sechsmal von 32 Ergebnissätzen im Plus ab. Selbst bei profitablen Läufen lagen die Sharpe-Ratios nahe null.
Nof1 bietet keinerlei Copy-Trading-Funktion. Drittplattformen wie Coinpilot bauten auf den öffentlichen Daten die Möglichkeit auf, Modellstrategien zu spiegeln, doch das liegt außerhalb von Nof1s Kontrolle — und da die meisten Modelle über die veröffentlichten Saisons Geld verloren, wäre es unratsam.
Die Seite gibt an, der offizielle Wettbewerb sei am 3. Dezember 2025 um 17:00 Uhr EST beendet worden und die Modelle liefen nicht mehr. Sofern seither keine neue Saison gestartet ist, sehen Sie das Archiv einer abgeschlossenen Saison. Nof1 hat einen weiteren Wettbewerb mit besseren Prompts und größerer statistischer Strenge angekündigt.
Nof1 ist ein von Jay Azhang gegründetes KI-Forschungslabor, das FinSMEs als „remote arbeitendes KI-Forschungslabor, das Spitzenmodelle mit Fokus auf Finanzmärkte trainiert" beschreibt. Im Mai 2026 sammelte es 15 Millionen Dollar in einer Runde unter gemeinsamer Führung der Nasdaq-notierten SUI Group und des Hedgefonds Karatage Opportunities ein. Die Website selbst nennt weder eingetragenen Firmennamen noch Adresse oder Teamliste.
Season 1.5 fuhr vier Regime — New Baseline, Monk Mode, Situational Awareness und Max Leverage —, die Anweisungen und Risikohaltung für dieselben Modelle variieren. Nof1s Forschungsblog meldet „eine Empfindlichkeit gegenüber kleinen Prompt-Änderungen", und die Rangliste bestätigt das: Die Modelle desselben Anbieters besetzen sowohl die Spitze als auch das Ende der beobachteten Tabelle.
Nein. Es ist ein Forschungsbenchmark, kein Finanzdienst. Die Seite veröffentlicht keinen Anlagehaftungsausschluss, und Nof1 legt keine Finanzlizenz oder aufsichtsrechtliche Zulassung offen; nichts von dem Gezeigten sollte als Empfehlung gelesen werden. Dass der veröffentlichte Verlauf zeigt, wie die meisten Modelle Geld verloren, ist selbst das stärkste Argument dagegen, es als Orientierung zu nehmen.
Sie sollten sie nicht für statistisch belastbar halten, und Nof1 behauptet das auch nicht — es hat angekündigt, künftige Wettbewerbe um „statistische Strenge" zu ergänzen, und damit implizit eingeräumt, dass sie den bisherigen Saisons fehlt. Der Wert liegt in der Transparenz und in der Richtung des Befunds, nicht in der Präzision: Eine kleine Stichprobe kann informativ bleiben, wenn die Misserfolgsquote bei rund 81 % liegt und die Begründung hinter jedem Trade nachprüfbar veröffentlicht ist.