Vous avez utilisé cet outil ? Notez-le
Vous avez utilisé cet outil ? Notez-le
Alpha Arena est un banc d'essai public et en direct dans lequel des modèles de langage de pointe reçoivent chacun de l'argent réel et sont autorisés à négocier sur de vrais marchés en toute autonomie, sans aucune intervention humaine — et où chaque invite, chaque raisonnement et chaque décision de trading sont publiés pour que quiconque puisse les lire. Le site se résume en six mots : « AI trading in real markets » (l'IA qui négocie sur des marchés réels).
Il est exploité par Nof1, qui n'est pas un éditeur de logiciels mais un laboratoire de recherche en IA. La distinction compte pour quiconque arrive ici en s'attendant à un produit auquel s'abonner. La formulation de Nof1 sur sa page À propos est explicitement une thèse de recherche : « Il y a dix ans, DeepMind a révolutionné la recherche en IA. Leur intuition clé était que choisir le bon environnement – les jeux – conduirait à des progrès rapides en IA de pointe. Chez Nof1, nous croyons que les marchés financiers sont le meilleur environnement d'entraînement pour la prochaine ère de l'IA. Ils constituent le moteur ultime de modélisation du monde et le seul banc d'essai qui devient plus difficile à mesure que l'IA devient plus intelligente. »
L'ambition affichée sur cette page dépasse la tenue d'un tableau des scores. Nof1 dit « utiliser les marchés pour entraîner de nouveaux modèles de base qui créent indéfiniment leurs propres données d'entraînement », en employant « l'apprentissage ouvert et l'apprentissage par renforcement à grande échelle pour affronter la complexité des marchés, le boss final », et recrute ceux que l'idée de « bâtir AlphaZero pour le monde réel » enthousiasme. Autrement dit, Alpha Arena est l'expérience publique rattachée à un programme de recherche bien plus vaste.
Le journalisme indépendant corrobore cette identité plutôt que son emballage marketing. La publication spécialisée FinSMEs décrivait l'entreprise en mai 2026 comme « un laboratoire de recherche en IA à distance entraînant des modèles de pointe axés sur les marchés financiers », en rapportant une levée de 15 millions de dollars co-menée par SUI Group — société cotée au Nasdaq — et le fonds spéculatif Karatage Opportunities. Le fondateur est Jay Azhang, qui a annoncé publiquement le lancement du projet le 17 octobre 2025 et que les couvertures indépendantes de Protos comme du média ukrainien Incrypted identifient comme fondateur de Nof1.
Ce qui rend ce banc d'essai inhabituel n'est pas l'idée de tester l'IA sur les marchés — cela se fait en simulation depuis des années — mais le refus de simuler. Capital réel, exécution réelle, glissement réel et frais réels. Comme l'écrivait Azhang au lancement : « 6 modèles d'IA négociant 10 000 dollars chacun, en pleine autonomie — argent réel, marchés réels, banc d'essai réel. »
Et le résultat honnête, sur deux saisons, est que les modèles ont majoritairement perdu. C'est ce qu'il y a de plus intéressant dans ce projet, et Nof1 le publie au lieu de le dissimuler.
Un banc d'essai en direct fonctionnant sur du capital réel. Chaque modèle participant reçoit 10 000 dollars d'argent véritable et négocie de façon autonome. La couverture du lancement par Incrypted cite le laboratoire décrivant des modèles qui « fonctionnent de manière complètement autonome, effectuant de vraies transactions sur les marchés de cryptomonnaies en direct : bitcoin, Ethereum, Solana, Binance Coin, Dogecoin et XRP. Aucune intervention humaine. Aucune restriction autre que celles que les modèles décident eux-mêmes d'appliquer en gestion du risque. »
Des conditions identiques d'un fournisseur à l'autre. Le cœur méthodologique est que chaque modèle reçoit les mêmes entrées et le même harnais d'exécution. Le blog de recherche de Nof1 énonce le dispositif sans détour : « Nous avons donné 10 000 dollars à six LLM de premier plan pour négocier en autonomie sur de vrais marchés, en n'utilisant que des données de marché numériques comme entrées et le même prompt et le même harnais. » Sans cette contrainte, la comparaison n'aurait aucun sens ; avec elle, les écarts de résultat s'attribuent aux modèles plutôt qu'à leur échafaudage.
Quatre pistes de compétition parallèles. La Season 1.5 répartit les mêmes modèles sur quatre régimes — intitulés 1: New Baseline, 2: Monk Mode, 3: Situational Awareness et 4: Max Leverage — avec une vue Aggregate Index qui les recoupe. Les différences d'invite et de posture de risque deviennent ainsi des variables contrôlées plutôt que des facteurs de confusion, ce qui explique qu'un même modèle apparaisse plusieurs fois sur un tableau avec des résultats radicalement différents.
Une transparence complète du raisonnement. C'est la fonctionnalité sans véritable équivalent ailleurs. Chaque décision du flux en direct porte le nom du modèle, sa piste, un horodatage et un résumé en langage clair, et se déplie en trois champs bruts : USER_PROMPT, CHAIN_OF_THOUGHT et TRADING_DECISIONS. On lit exactement ce qu'un modèle a reçu comme consigne, comment il a raisonné et ce qu'il a fait. Pour qui étudie le comportement des modèles sous pression, cette archive est le produit.
Un classement avec de vraies mesures de risque, pas seulement des rendements. Le classement affiche la valeur du compte, le pourcentage de rendement, le P&L total, les frais, le taux de réussite, le meilleur gain, la pire perte, le ratio de Sharpe et le nombre de transactions, filtrables par piste ou consultables en agrégé. Placer les frais et le Sharpe à côté du rendement brut est ce qui distingue ce tableau d'un simple palmarès de performances — et, au vu des résultats, c'est précisément là que se trouve l'histoire.
Des modèles de pointe de laboratoires concurrents, côte à côte. Le classement observé comprend GROK-4.20, GROK-4, GPT-5.1, CLAUDE-SONNET-4-5, GEMINI-3-PRO, DEEPSEEK-CHAT-V3.1, QWEN3-MAX et KIMI-K2-THINKING. Rares sont les cadres publics qui placent des modèles d'OpenAI, Anthropic, Google, xAI, DeepSeek, Alibaba et Moonshot dans des conditions identiques au même moment.
Des classes d'actifs qui ont changé entre les saisons. La saison 1 portait sur des contrats perpétuels crypto. La Season 1.5 est passée aux actions et indices américains — le flux en direct et les cotations couvrent TSLA, NDX, NVDA, MSFT, AMZN, GOOGL et PLTR. Ce basculement est en soi instructif : une stratégie qui fonctionnait dans un régime ne se transpose pas automatiquement.
Recalibrer ce que l'on croit que les LLM savent faire. C'est la valeur première, et elle refroidit utilement les attentes. Si l'on vous a dit que des modèles de pointe braqués sur les marchés produisent des rendements, le relevé public est la correction la moins chère qui soit : sur la saison 1 et la Season 1.5, les modèles n'ont terminé en bénéfice que six fois sur 32 séries de résultats.
Étudier le comportement et la « personnalité » des modèles à conditions égales. La découverte précoce de Nof1 est que les modèles présentent « de véritables différences comportementales (risque, dimensionnement, durée de détention) ». Azhang a décrit cela comme des « biais constants » équivalant à « quelque chose comme une 'personnalité' d'investisseur ». Parcourez l'archive des raisonnements et vous verrez un modèle justifier la patience pendant qu'un autre rationalise l'effet de levier sur le même instrument, à la même heure.
Recherche sur la sensibilité aux invites. Le blog signale « une sensibilité aux petits changements d'invite », et la structure à quatre pistes rend cela mesurable plutôt qu'anecdotique. Si vous construisez des systèmes agentiques, l'écart visible entre New Baseline et Max Leverage sur un même modèle est une leçon concrète sur la part du comportement d'un agent qui réside dans ses instructions plutôt que dans ses poids.
Enseigner et commenter les promesses de capacité en IA. L'association d'un tableau de scores impitoyable et de raisonnements intégralement publiés en fait un support pédagogique rare — le raisonnement sonne souvent le plus assuré précisément là où le résultat a mal tourné.
Comprendre pourquoi les coûts de transaction dominent les stratégies d'agents naïves. Le bilan de Nof1 note que « le P&L a été dominé par les coûts de transaction lors des premières exécutions, les agents ayant sur-négocié et pris des gains rapides et minimes que les frais ont effacés ». Quiconque conçoit un agent automatisé qui agit fréquemment dans un environnement à frais devrait relire cette phrase deux fois.
Une évaluation comparative au-delà des bancs d'essai statiques. Pour les chercheurs agacés que des questionnaires saturés ne distinguent plus les modèles de pointe, un marché réel est un banc d'essai qui résiste à la mémorisation et qui, selon Nof1, devient plus difficile à mesure que les modèles progressent.
Ce à quoi il ne sert pas. Ce n'est ni un produit d'investissement, ni un outil de trading, ni un service de signaux, ni une stratégie à copier. Il ne fournit aux utilisateurs ni portefeuille, ni exécution, ni contrôle du risque, ni conseil.
Privilégiez l'agrégat à n'importe quelle piste isolée. Une piste sur deux semaines constitue un très petit échantillon. L'Aggregate Index existe précisément parce que les résultats d'un régime unique sont bruités, et même l'agrégat couvre une fenêtre courte.
Rappelez-vous ce dont les modèles ont été privés. Azhang a été explicite : le dispositif était délibérément difficile. « Les LLM ne gèrent pas très bien les séries temporelles numériques, mais c'est tout le contexte que nous leur avons donné », et les modèles ont reçu « un univers d'actifs restreint et un espace d'action assez limité ». De mauvais résultats ici constituent une preuve sur cette configuration, pas la démonstration que les LLM ne pourront jamais négocier.
Ne lisez pas un rendement sur deux semaines comme une compétence. Avec des taux de réussite groupés entre 25 % et 30 % en saison 1, les écarts de résultat sur quinze jours sont fortement pondérés par la chance. Le Sharpe, le nombre de transactions et la charge de frais portent plus d'information que le classement.
Surveillez l'écart de fréquence. En saison 1, Gemini a effectué 238 transactions contre 38 pour Claude Sonnet. La fréquence est une signature comportementale qui interagit directement avec les frais, et elle prédit souvent mieux le résultat que la justesse directionnelle.
Servez-vous du tour d'essai comme exemple de variance. Avant la saison publique, l'équipe a mené un essai le 11 octobre 2025 avec 200 dollars par modèle, où Grok-4 a affiché 500 % de rendement le premier jour. Ce chiffre n'a aucune valeur comme signal de capacité et illustre bien pourquoi les fenêtres courtes et les petites mises induisent en erreur.
N'extrapolez pas d'une classe d'actifs à l'autre. La saison 1 portait sur des perpétuels crypto, la Season 1.5 sur des actions américaines. Les résultats de l'un disent peu de l'autre.
Traitez les raisonnements publiés comme des données, pas comme des conseils. L'archive des chaînes de raisonnement a une réelle valeur de recherche. Ce n'est pas un ensemble d'idées de trading, et les modèles qui l'ont produite ont perdu de l'argent plus souvent qu'ils n'en ont gagné.
Vérifiez si une saison est en cours avant de supposer que les chiffres sont à jour. Le site est honnête sur le statut de la compétition ; les lecteurs arrivant d'un article vieux de plusieurs mois le sont souvent moins.
Chercheurs en IA et spécialistes de l'évaluation. Si votre travail consiste à mesurer les capacités des modèles, voici un exemple rare de banc d'essai doté d'un environnement véritablement adverse, de conséquences réelles et d'une transparence complète du raisonnement.
Ingénieurs construisant des systèmes agentiques. L'écart visible entre les pistes est une leçon pratique sur la sensibilité aux invites et à l'échafaudage, et le rapport frais/P&L constitue un avertissement direct sur les agents qui agissent trop souvent.
Traders quantitatifs et systématiques. Non comme source de stratégie, mais comme élément de preuve sur la question de savoir si les modèles de langage généralistes menacent aujourd'hui les approches systématiques ou leur offrent un levier. Les ratios de Sharpe publiés constituent la réponse pertinente.
Journalistes, enseignants et analystes traitant des promesses de l'IA. Les données sont publiques, la méthodologie est énoncée, et les résultats contredisent le marketing le plus gonflé du secteur. Cette combinaison est difficile à trouver.
Observateurs avertis du secteur de l'IA. Pour savoir si des modèles de pointe peuvent agir avec compétence dans un environnement ouvert et impitoyable, c'est la preuve publique la plus directe disponible.
Qui devrait s'abstenir. Les investisseurs particuliers en quête de signaux à recopier ; quiconque cherche un outil de trading, un gestionnaire de portefeuille ou un service de conseil ; quiconque prendrait un classement de deux semaines pour une base d'allocation de son propre argent. Nof1 ne publie aucune clause de non-responsabilité en matière d'investissement sur son site, mais les résultats parlent d'eux-mêmes : la plupart des participants ont perdu.
Alpha Arena est un produit exclusivement web, accessible sur nof1.ai. L'ensemble du site se compose de cinq destinations de navigation — LIVE, LEADERBOARD, BLOG, MODELS et ABOUT — sans application de bureau, application mobile, extension de navigateur ni documentation d'API publique. Tout ce que le projet offre au public se lit dans un navigateur, sans compte.
L'infrastructure d'exécution diffère de la couche de présentation. Les transactions de la saison 1 ont été exécutées sur Hyperliquid, une bourse décentralisée de contrats à terme perpétuels. Selon Incrypted, la performance des modèles était en outre suivie via une feuille de calcul publiquement accessible mesurant les ratios de Sharpe et la valeur totale du portefeuille. Des tiers ont construit une capacité de suivi par-dessus les données publiques — Incrypted note que les utilisateurs pouvaient « suivre les succès des modèles, ainsi que copier leur stratégie, par exemple via la plateforme Coinpilot ». Ce chemin de copy-trading est fourni par une plateforme extérieure et non par Nof1, ce qui détermine où se situent le risque et la responsabilité.
Les annonces et mises à jour de saison passent par le compte X officiel @the_nof1 et par le compte personnel du fondateur Jay Azhang, où le lancement a d'abord été annoncé le 17 octobre 2025.
Une remarque pratique sur l'accès : le site se trouve derrière le point de contrôle de sécurité de Vercel et peut renvoyer un HTTP 429 aux requêtes automatisées. L'accès depuis un navigateur ordinaire n'est pas affecté.
Alpha Arena se consulte intégralement gratuitement, et il n'existe aucun palier payant.
Il n'y a nulle part sur le site de page tarifaire, de système de comptes, de connexion, d'abonnement ni de tunnel de paiement. L'intégralité du tableau de bord public — le flux de décisions en direct, le classement avec toutes ses mesures de performance, les graphiques agrégés et le blog de recherche — est accessible sans inscription. La seule action de conversion présente est une invitation « Join the Waitlist », et le seul appel à l'action de la page À propos relève du recrutement : « nous recrutons : ingénieurs, chercheurs, fondateurs, penseurs originaux », suivi d'un lien de contact.
C'est cohérent avec la nature de l'organisation. Nof1 est financé comme un laboratoire de recherche, pas par ses utilisateurs. FinSMEs a rapporté en mai 2026 la levée de 15 millions de dollars co-menée par SUI Group et Karatage Opportunities, les fonds étant destinés « à développer les opérations et les efforts de développement ».
Un produit commercial est prévu mais n'existe pas encore. Selon le même article, après la saison 2 « Nof1 entend lancer une plateforme grand public dotée des premiers agents de codage au monde dédiés aux marchés », bâtie sur les modèles de pointe du laboratoire. La saison 2 elle-même est décrite comme ajoutant la recherche web, un temps de raisonnement étendu et l'exécution multi-étapes, et comme développant les propres modèles de Nof1 plutôt que de seulement tester ceux des autres. Il faut traiter tout cela comme une feuille de route annoncée et non comme une capacité livrée — rien de tout cela n'est utilisable aujourd'hui.
L'implication pratique pour qui évalue cette fiche : il n'y a rien à acheter, rien à essayer et aucun engagement à prendre. Il n'y a pas non plus de relation de support, pas de SLA et aucune garantie qu'une saison donnée se tienne.
La comparaison honnête est que la force d'Alpha Arena est exactement sa faiblesse. Les marchés réels le rendent infalsifiable et insaturable ; ils le rendent aussi limité en échantillon, coûteux et bruité. Il complète les bancs d'essai statistiques plus qu'il ne les remplace.
Le résultat principal est que les modèles ont majoritairement perdu, et ce contexte devrait encadrer tout le reste. Protos, dans une couverture indépendante intitulée « Un concours de trading crypto par LLM conclut que les LLM ne savent pas trader la crypto », rapportait que « quatre des six grands modèles de langage opposés dans la compétition de trading crypto 'Alpha Arena' ont terminé dans le rouge, ChatGPT d'OpenAI menant les pertes après avoir perdu 63 % de ses fonds ».
Les pertes par modèle ont été substantielles. Les chiffres de Protos pour la saison 1 : ChatGPT a perdu 6 267 dollars, Gemini 5 671 dollars, Grok 4 531 dollars et Claude Sonnet 3 081 dollars. Seuls deux ont terminé en avance — DeepSeek à +489 dollars et QWEN3 MAX à +2 232 dollars.
Le schéma s'est maintenu d'une saison à l'autre. FinSMEs rapporte que sur la saison 1 et la Season 1.5 réunies, avec huit modèles recevant chacun 10 000 dollars, « sur 32 séries de résultats, les modèles n'ont terminé en bénéfice que six fois ». Cela représente environ 81 % d'échecs au niveau modèle-piste.
Les taux de réussite étaient faibles et homogènes. Les six modèles de la saison 1 se situaient tous entre 25 % et 30 % de réussite. La fréquence de négociation variait énormément — 238 transactions pour Gemini contre 38 pour Claude Sonnet — ce qui signifie que l'on compare des stratégies comportementales assez différentes, et pas seulement des qualités de jugement.
Les frais ont dévoré l'avantage. Nof1 a lui-même reconnu que « le P&L a été dominé par les coûts de transaction lors des premières exécutions, les agents ayant sur-négocié et pris des gains rapides et minimes que les frais ont effacés ». QWEN3 MAX a payé le plus de frais avec 1 654 dollars ; Gemini en a payé 1 331 tout en perdant lourdement.
La performance ajustée du risque était faible même pour les gagnants. Le classement observé montre des ratios de Sharpe groupés près de zéro — 0,019158 pour le premier modèle en valeur de compte, 0,009537 et 0,000667 pour les deux suivants, avec des valeurs négatives telles que -0,010358 et -0,038861 plus bas. Des rendements positifs à Sharpe quasi nul sur deux semaines ne prouvent aucune compétence.
La dispersion au sein d'un même modèle sape les conclusions au niveau du modèle. GROK-4.20 a terminé une piste à 13 459 dollars (+34,59 %) tandis que GROK-4 finissait une autre à 385,02 dollars — une perte quasi totale. Quand les modèles d'un même fournisseur occupent les deux extrêmes, le classement en dit davantage sur le régime et la chance que sur la capacité.
L'échantillon est bien trop réduit pour des affirmations statistiques, et le laboratoire en convient. Protos rapporte que Nof1 « annonce une autre compétition à venir avec de meilleures invites et une 'rigueur statistique' » — reconnaissance implicite que les saisons existantes en manquent. Deux semaines, une poignée de modèles et quelques dizaines de séries de résultats ne peuvent soutenir d'inférence forte.
Le harnais contraint les modèles, ce que le laboratoire documente ouvertement. Le bilan de Nof1 indique : « Nous avons travaillé à donner aux modèles une chance équitable, mais le harnais impose de vraies contraintes. Chaque agent doit analyser des caractéristiques de marché bruitées, les relier à l'état courant du compte, raisonner sous des règles strictes et renvoyer une action structurée, le tout dans une fenêtre de contexte limitée. » Azhang a ajouté que les modèles disposaient « d'un univers d'actifs restreint et d'un espace d'action assez limité » et ne recevaient que des séries temporelles numériques, un format que les LLM traitent mal. De mauvais résultats constituent donc une preuve sur cette configuration précise.
La compétition n'est pas en cours actuellement. Le site l'indique clairement : « La compétition officielle s'est achevée le 3 décembre 2025 à 17h00 EST. Les modèles ne tournent plus. » Qui arrive en s'attendant à une action en direct pourrait ne trouver qu'une archive.
Le vainqueur de la Season 1.5 est inattribuable. L'entrée gagnante est publiée sous le nom de « Mystery Model » — 12,11 % de rendement agrégé sur deux semaines, 4 844 dollars toutes compétitions confondues. Un vainqueur anonyme ne peut être porté au crédit d'aucun fournisseur, ce qui limite la portée de ce résultat.
Le site ne comporte aucune divulgation juridique ou de gouvernance. La page À propos ne nomme aucune entité juridique enregistrée, aucune juridiction d'immatriculation, aucune adresse ni liste d'équipe. Sur l'accueil, la page À propos et le classement, aucun lien vers une politique de confidentialité, des conditions d'utilisation ou une politique de cookies. L'identité de l'entreprise est corroborée par la presse financière tierce plutôt que par le site lui-même.
Il n'y a ni clause de non-responsabilité en matière d'investissement ni statut réglementaire annoncé. Le site n'indique pas que les résultats ne constituent pas un conseil en investissement, et Nof1 ne divulgue aucune licence financière ni agrément réglementaire. Il s'agit d'une démonstration de recherche et non d'un service financier régulé ; les transactions publiées ne doivent pas être lues comme des recommandations.
Le copy-trading se déroule hors du périmètre de Nof1. Puisque des plateformes tierces permettent de répliquer les stratégies des modèles, quiconque le fait assume un risque de capital et une exposition réglementaire dans un lieu que Nof1 n'exploite ni ne supervise.
Les invites et raisonnements publiés ne sont assortis d'aucune licence explicite. Les enregistrements complets USER_PROMPT et CHAIN_OF_THOUGHT sont librement consultables, mais le site n'énonce aucune condition explicite de réutilisation, ce qui laisse indéfinie la position sur la republication ou l'usage comme jeu de données.
Entièrement. Le flux de décisions en direct, le classement avec toutes ses mesures, les graphiques agrégés et le blog de recherche sont consultables sans compte, et il n'existe nulle part de page tarifaire, d'abonnement ou de tunnel de paiement. Les seules données que vous pouvez transmettre sont une adresse e-mail pour la liste d'attente ou un message via le formulaire de contact.
Oui. Chaque modèle participant s'est vu allouer 10 000 dollars de capital réel et a négocié en autonomie sans intervention humaine. La saison 1 exécutait des perpétuels crypto sur la bourse décentralisée Hyperliquid ; la Season 1.5 portait sur des actions et indices américains dont TSLA, NVDA, MSFT, AMZN, GOOGL, PLTR et l'indice NDX.
Des modèles de pointe de laboratoires concurrents tournent côte à côte dans des conditions identiques. Le classement observé comprend GROK-4.20, GROK-4, GPT-5.1, CLAUDE-SONNET-4-5, GEMINI-3-PRO, DEEPSEEK-CHAT-V3.1, QWEN3-MAX et KIMI-K2-THINKING, couvrant OpenAI, Anthropic, Google, xAI, DeepSeek, Alibaba et Moonshot.
Majoritairement non, et c'est la conclusion centrale. Quatre des six modèles ont terminé la saison 1 dans le rouge, ChatGPT perdant 63 % de ses fonds. Sur la saison 1 et la Season 1.5 réunies, les modèles n'ont terminé en bénéfice que six fois sur 32 séries de résultats. Même parmi les exécutions profitables, les ratios de Sharpe se situaient près de zéro.
Nof1 ne propose aucune fonction de copy-trading. Des plateformes tierces telles que Coinpilot ont bâti la possibilité de répliquer les stratégies au-dessus des données publiques, mais cela échappe au contrôle de Nof1 et, la plupart des modèles ayant perdu de l'argent sur les saisons publiées, ce serait peu avisé.
Le site indique que la compétition officielle s'est achevée le 3 décembre 2025 à 17h00 EST et que les modèles ne tournent plus. Sauf lancement d'une nouvelle saison depuis, ce qui s'affiche est l'archive d'une saison terminée. Nof1 a annoncé une compétition ultérieure avec de meilleures invites et davantage de rigueur statistique.
Nof1 est un laboratoire de recherche en IA fondé par Jay Azhang, décrit par FinSMEs comme « un laboratoire de recherche en IA à distance entraînant des modèles de pointe axés sur les marchés financiers ». Il a levé 15 millions de dollars en mai 2026 lors d'un tour co-mené par SUI Group, cotée au Nasdaq, et le fonds Karatage Opportunities. Le site lui-même ne publie ni nom d'entité juridique enregistrée, ni adresse, ni liste d'équipe.
La Season 1.5 a fait tourner quatre régimes — New Baseline, Monk Mode, Situational Awareness et Max Leverage — qui font varier les consignes et la posture de risque données aux mêmes modèles. Le blog de recherche de Nof1 signale « une sensibilité aux petits changements d'invite », et le classement le confirme : les modèles d'un même fournisseur occupent à la fois le haut et le bas du tableau observé.
Non. C'est un banc d'essai de recherche, pas un service financier. Le site ne publie aucune clause de non-responsabilité en matière d'investissement et Nof1 ne divulgue aucune licence financière ni agrément réglementaire ; rien de ce qui est affiché ne doit être lu comme une recommandation. Le relevé public montrant que la plupart des modèles ont perdu de l'argent constitue l'argument le plus fort contre son usage comme guide.
Il ne faut pas les tenir pour statistiquement solides, et Nof1 ne le prétend pas — le laboratoire a annoncé que les compétitions futures ajouteraient une « rigueur statistique », concédant implicitement que les saisons actuelles en manquent. La valeur tient à la transparence et au sens du résultat, non à sa précision : un petit échantillon reste informatif quand le taux d'échec avoisine 81 % et que le raisonnement derrière chaque transaction est publié et vérifiable.
Comment utiliser Alpha Arena
Étape 1 — Commencez par le classement, pas par le flux en direct. Le flux est captivant mais anecdotique. Le classement donne la distribution : quels modèles, sur quelles pistes, ont fini où, et à quel coût en frais.
Étape 2 — Lisez la colonne Sharpe avant la colonne rendement. Le pourcentage de rendement dit ce qui s'est passé ; le Sharpe dit si cela a été gagné ou simplement survécu. Sur le classement observé, les valeurs de Sharpe se massent près de zéro et passent en négatif — y compris pour des modèles bien placés en rendement.
Étape 3 — Comparez un même modèle sur les quatre pistes. C'est l'exercice le plus instructif du site. Choisissez un modèle présent dans New Baseline, Monk Mode, Situational Awareness et Max Leverage, et observez la dispersion. Les données observées montrent GROK-4.20 terminant à 13 459 dollars sur une piste tandis que GROK-4 finissait à 385,02 dollars sur une autre — l'invite et le régime de risque ont davantage pesé sur le résultat que le choix du modèle.
Étape 4 — Dépliez le raisonnement d'une transaction perdante. Ouvrez USER_PROMPT, CHAIN_OF_THOUGHT et TRADING_DECISIONS sur une décision qui a mal tourné. Lire un raisonnement assuré accolé à un mauvais résultat est le remède le plus rapide contre l'excès de confiance dans une sortie de modèle bien tournée.
Étape 5 — Confrontez la colonne des frais à celle du P&L. Pour plusieurs modèles, les frais payés représentent une part importante du P&L absolu, voire le dépassent. C'est la forme concrète du problème de sur-négociation documenté par le laboratoire.
Étape 6 — Vérifiez les dates avant de conclure. Le site affiche un avis explicite : « La compétition officielle s'est achevée le 3 décembre 2025 à 17h00 EST. Les modèles ne tournent plus. » Sauf nouvelle saison depuis, ce que vous consultez est l'archive d'une saison terminée.
Étape 7 — Lisez le blog de recherche pour la méthodologie, pas seulement pour les résultats. L'entrée de blog explique ce que les modèles ont reçu et ce qu'ils n'ont pas reçu, contexte indispensable avant de traiter un chiffre comme un verdict sur la capacité générale d'un modèle.
Étape 8 — Maniez avec prudence le résultat du « Mystery Model ». Le vainqueur de la Season 1.5 est publié sous le nom de « Mystery Model », avec un rendement agrégé de 12,11 % sur deux semaines et 4 844 dollars gagnés toutes compétitions confondues. Le vainqueur étant anonyme, ce résultat ne peut être attribué à aucun fournisseur.