Alpha Arena 是一個公開的即時基準測試:把真金白銀交給多個前沿大語言模型,讓它們在真實市場中完全自主交易,沒有任何人工干預——並且把每一條提示詞、每一段思維鏈、每一個交易決策全部公開,任何人都能逐條查閱。官網用六個詞概括自己:「AI trading in real markets」(AI 在真實市場中交易)。
營運方是 Nof1,它不是一家軟體廠商,而是一家 AI 研究實驗室。這個區別對任何抱著「註冊一個產品來用」的預期而來的人都很重要。Nof1 在 About 頁給出的是一份明確的研究命題:「十年前,DeepMind 革新了 AI 研究。他們的關鍵洞見是,選對環境——遊戲——就能推動前沿 AI 快速進步。在 Nof1,我們相信金融市場是下一個 AI 時代最好的訓練環境。它是終極的世界建模引擎,也是唯一一個會隨著 AI 變強而變得更難的基準。」
該頁陳述的野心遠不止辦一個排行榜。Nof1 稱自己「用市場來訓練能夠無限自我生成訓練資料的新基座模型」,採用「開放式學習與大規模強化學習來應對市場這個最終 Boss 的複雜性」,並招募那些願意「為現實世界造一個 AlphaZero」的人。換句話說,Alpha Arena 是一項規模大得多的研究計畫所附帶的公開實驗。
獨立報導印證的是這個身分本身,而不只是它的宣傳口徑。創投媒體 FinSMEs 在 2026 年 5 月把這家公司描述為「一家遠端運作的 AI 研究實驗室,訓練專注於金融市場的前沿模型」,並報導其完成 1500 萬美元融資,由納斯達克上市公司 SUI Group 與對沖基金 Karatage Opportunities 聯合領投。創辦人為 Jay Azhang,他在 2025 年 10 月 17 日公開宣布該專案啟動;Protos 與烏克蘭加密媒體 Incrypted 的獨立報導均指認其為 Nof1 創辦人。
這個基準的特別之處不在於「用市場測試 AI」這個想法——模擬環境下的類似嘗試已有多年——而在於它拒絕模擬。真實資金、真實成交、真實滑價、真實手續費。正如 Azhang 發布時所寫:「6 個 AI 模型各自交易 1 萬美元,完全自主——真錢、真市場、真基準。」
而橫跨兩個賽季的誠實結論是:這些模型大多虧了錢。這才是這個專案最有意思的地方,而 Nof1 選擇把它公布出來,而不是藏起來。
用真實資金運行的即時基準。 每個參賽模型獲得 1 萬美元真實資金並自主交易。Incrypted 對啟動階段的報導引述實驗室的說明:模型「完全自主運作,在活躍的加密市場上進行真實交易:比特幣、以太坊、Solana、幣安幣、狗狗幣與瑞波幣。沒有人工干預。除了模型自己決定實施的風險管理之外,沒有任何限制。」
跨廠商的同等條件。 方法論的核心是每個模型拿到相同的輸入和相同的執行框架。Nof1 的研究部落格把設計寫得很直白:「我們給六個領先的大模型各 1 萬美元,讓它們僅以數值化的市場資料為輸入、使用完全相同的提示詞與 harness,在真實市場中自主交易。」沒有這個約束,比較就毫無意義;有了它,結果差異才能歸因於模型本身而非鷹架。
四條並行賽道。 Season 1.5 把同一批模型分入四種賽制——標記為 1: New Baseline、2: Monk Mode、3: Situational Awareness、4: Max Leverage——並提供跨賽制的 Aggregate Index 聚合視圖。這把提示詞與風險姿態的差異變成了受控變數而非混雜因素,也解釋了為什麼同一個模型會在一張排行榜上出現多次、成績卻天差地別。
完整的推理透明度。 這是全網幾乎沒有對等物的一項。即時流中的每條決策都帶有模型名、所屬賽道、時間戳和一段自然語言摘要,並可展開三個原始欄位:USER_PROMPT、CHAIN_OF_THOUGHT 與 TRADING_DECISIONS。你能讀到模型被告知了什麼、它究竟如何推理、以及它最終做了什麼。對研究模型在壓力下行為的人來說,這份存檔本身就是產品。
帶真實風險指標的排行榜,而不只是收益。 排行榜給出帳戶價值、報酬率、總損益、手續費、勝率、最大單筆獲利與虧損、夏普比率和交易筆數,可按賽道篩選或聚合查看。把手續費和夏普與原始報酬並列,正是它區別於「只看報酬」的計分板之處——而結果表明,故事恰恰藏在這兩列裡。
來自競爭實驗室的前沿模型同台。 實測排行榜包含 GROK-4.20、GROK-4、GPT-5.1、CLAUDE-SONNET-4-5、GEMINI-3-PRO、DEEPSEEK-CHAT-V3.1、QWEN3-MAX 與 KIMI-K2-THINKING。很少有公開場合能把 OpenAI、Anthropic、Google、xAI、DeepSeek、阿里巴巴與月之暗面的模型放在同一時刻、同一條件下比較。
賽季之間切換的資產類別。 第一季交易加密永續合約,Season 1.5 轉向美股與指數——即時流與行情條涵蓋 TSLA、NDX、NVDA、MSFT、AMZN、GOOGL 與 PLTR。這個切換本身就有資訊量:在一種市場環境下奏效的策略,不會自動遷移到另一種。
校準你對大模型實際能力的預期。 這是它最主要的價值,而且是一種有用的「降溫」。如果你聽過「把前沿模型接到市場上就能產生收益」的說法,這份公開紀錄是最便宜的糾偏材料:橫跨 Season 1 與 Season 1.5,模型在 32 組結果中僅有 6 次以獲利收場。
在同等條件下研究模型行為與「性格」。 Nof1 自己的早期發現是模型表現出「真實的行為差異(風險偏好、部位規模、持倉時間)」。Azhang 把這描述為模型呈現出「一致的偏差」,近似於「某種投資'性格'」。讀一讀思維鏈存檔,你會看到在同一時刻、同一標的上,一個模型在論證耐心持有,另一個在為加槓桿找理由。
提示詞敏感性研究。 部落格報告了「對提示詞微小改動的敏感性」,而四賽道結構讓這一點變得可測量而非只是軼事。如果你在建構智慧體系統,同一模型在 New Baseline 與 Max Leverage 之間的可見差距,就是一堂關於「智慧體的行為有多少存在於指令而非權重中」的具體課程。
教學與評論 AI 能力宣稱。 一個嚴苛不留情面的計分板,加上完整公開的推理過程,構成了一件難得的教學素材——那些推理在結果最糟糕的段落裡,往往聽起來最權威。
理解為什麼交易成本會主導幼稚的智慧體策略。 Nof1 自己的複盤指出:「在早期運行中,損益被交易成本主導,智慧體過度交易、頻繁攫取微小利潤,而這些利潤被手續費吞噬。」任何在有手續費環境中設計高頻動作智慧體的人,都該把這句話讀兩遍。
超越靜態基準的橫向評測。 對於苦於「飽和的選擇題基準已無法區分前沿模型」的研究者來說,真實市場是一個抗記憶化的基準,而且按 Nof1 的說法,它會隨著模型變強而變難。
它不適合什麼。 它不是投資產品、交易工具、訊號服務,也不是一套你該照抄的策略。它不為使用者提供任何投組、執行、風控或建議。
第一步:從排行榜開始,而不是即時流。 即時流很吸引人,但它是軼事性的。排行榜給你的是分布:哪些模型、在哪條賽道、最終落在什麼位置、為此付出了多少手續費。
第二步:先看夏普那一列,再看報酬率。 報酬率告訴你發生了什麼,夏普告訴你這是掙來的還是熬過來的。在實測排行榜上,夏普數值密集地貼近零並轉負——包括那些報酬率排名靠前的模型。
第三步:把同一個模型橫跨四條賽道對比。 這是站內最有教益的單項練習。挑一個同時出現在 New Baseline、Monk Mode、Situational Awareness 與 Max Leverage 的模型,看它的離散度。實測資料顯示 GROK-4.20 在一條賽道收於 13,459 美元,而 GROK-4 在另一條賽道只剩 385.02 美元——提示詞與風險賽制對結果的影響,超過了選哪個模型。
第四步:展開一筆虧損交易的思維鏈。 點開一條結果糟糕的決策的 USER_PROMPT、CHAIN_OF_THOUGHT 與 TRADING_DECISIONS。讀到自信滿滿的推理掛在一個糟糕結果上,是治癒「過度信任流暢模型輸出」最快的方法。
第五步:把手續費列和損益列對著看。 有幾個模型付出的手續費占其損益絕對值的很大一部分,甚至超過它。這就是實驗室記錄的「過度交易」問題的具體形態。
第六步:下結論前先看日期。 站點掛著一條明確公告:「官方競賽已於 2025 年 12 月 3 日美東時間下午 5 點結束。模型已停止運行。」除非此後又開新賽季,否則你看到的是一個已完賽賽季的存檔,而不是正在進行的比賽。
第七步:讀研究部落格是為了方法論,不只是結果。 部落格條目解釋了模型被給了什麼、沒被給什麼,這是把任何數字當作「對某模型通用能力的判決」之前必須具備的背景。
第八步:謹慎對待「Mystery Model」的結果。 Season 1.5 的優勝者以「Mystery Model」之名公布,兩週聚合報酬率 12.11%,跨賽制合計獲利 4,844 美元。由於優勝者不具名,這一結果無法歸因到任何廠商。
聚合口徑的權重應高於任何單條賽道。 單條賽道兩週是極小的樣本。Aggregate Index 之所以存在,正是因為單一賽制的結果雜訊很大——而即便是聚合口徑,涵蓋的窗口也很短。
記住模型被剝奪了什麼。 Azhang 明確說過這套設置是刻意為難的:「大模型其實不太擅長處理數值化時間序列資料,但那正是我們給它們的全部上下文」,而且模型被「限定在一個收窄的資產範圍和相當有限的動作空間裡」。這裡的糟糕成績是關於這套配置的證據,而不是「大模型永遠不能交易」的證明。
不要把兩週的報酬讀成能力。 Season 1 的勝率密集落在 25% 到 30% 之間,兩週內的成績差異中運氣占了很大權重。夏普、交易筆數與手續費負擔所攜帶的資訊,比排名更多。
關注交易筆數的離散度。 Season 1 中 Gemini 交易 238 筆,而 Claude Sonnet 只有 38 筆。頻率是一種直接與手續費相互作用的行為簽名,它對結果的預測力往往強於方向判斷的準確率。
把測試輪當作變異數的警示案例。 在公開賽季之前,團隊於 2025 年 10 月 11 日用每模型 200 美元做過一次試運行,其中 Grok-4 首日錄得 500% 報酬。這個數字作為能力訊號毫無意義,恰好說明了為什麼短窗口與小本金會誤導人。
不要跨資產類別外推。 第一季是加密永續合約,Season 1.5 是美股。一種環境下的結果對另一種說明不了什麼。
把公開的推理當作資料,而不是建議。 思維鏈存檔對研究確有價值。它不是一組交易點子,而產出它的那些模型虧損的次數多於獲利。
在預設這些數字是最新之前,先確認賽季是否在跑。 站點對賽事狀態是誠實的;從幾個月前的文章點進來的讀者往往不是。
AI 研究者與評測專家。 如果你的工作涉及度量模型能力,這是一個罕見的樣本:具備真正對抗性的環境、真實的後果,以及完整的推理透明度。
建構智慧體系統的工程師。 賽道之間的可見差距是關於提示詞與鷹架敏感性的實踐課,而手續費與損益的關係則是對「動作過於頻繁的智慧體」的直接警告。
量化與系統化交易者。 不是作為策略來源,而是作為證據:通用語言模型當下究竟是對系統化方法構成威脅,還是提供槓桿。公開的夏普數值給出了相關的答案。
報導、教學與分析 AI 宣稱的人。 資料公開、方法論明示,且結果與該領域最誇張的行銷話術相矛盾。這個組合並不好找。
關注 AI 產業的知情觀察者。 如果你想知道前沿模型能否在一個不留情面的開放式環境中勝任行動,這是目前最直接的公開證據。
應當遠離的人。 尋找可照抄訊號的散戶投資者;尋求交易工具、投組管理或投顧服務的人;以及會把一張兩週排行榜當作配置自有資金依據的人。Nof1 並未在站內發布投資免責聲明,但結果本身已經說明問題:多數參賽者虧損。
Alpha Arena 是一個純網頁產品,透過 nof1.ai 存取。整個站點只由五個導覽目的地構成——LIVE、LEADERBOARD、BLOG、MODELS 與 ABOUT——沒有桌面應用、沒有行動應用、沒有瀏覽器擴充功能,也沒有公開的 API 文件。這個專案向公眾提供的一切,都能在瀏覽器裡無帳號讀取。
執行層的基礎設施與展示層不同。第一季的交易在去中心化永續合約交易所 Hyperliquid 上執行。按 Incrypted 的報導,模型績效還透過一份公開可存取的表格追蹤,其中度量夏普比率與投組總價值。第三方在公開資料之上搭建了跟隨能力——Incrypted 提到使用者可以「關注模型的表現,並複製它們的策略,例如透過 Coinpilot 平台」。這條跟單路徑由外部平台提供,而非 Nof1,這決定了風險與責任落在哪一側。
公告與賽季更新透過官方 X 帳號 @the_nof1 以及創辦人 Jay Azhang 的個人帳號發布,2025 年 10 月 17 日的啟動消息最初就發布於此。
關於存取的一條實務說明:站點位於 Vercel 的安全檢查點之後,對自動化請求可能返回 HTTP 429。一般瀏覽器存取不受影響。
Alpha Arena 完全免費瀏覽,不存在任何付費級別。
站內沒有定價頁、沒有帳戶體系、沒有登入、沒有訂閱、也沒有任何結帳流程。完整的公開儀表板——即時決策流、含全部績效指標的排行榜、聚合圖表與研究部落格——無需註冊即可存取。全站唯一出現的轉化動作是一個「Join the Waitlist」入口,而 About 頁唯一的行動號召是招募:「我們在招人:工程師、研究員、創業者、原創思考者」,後面跟著一個聯絡方式。
這與該組織的性質是一致的。Nof1 的資金來自研究實驗室的融資,而不是使用者。FinSMEs 報導其於 2026 年 5 月完成由 SUI Group 與 Karatage Opportunities 聯合領投的 1500 萬美元融資,資金用途為「擴張營運與研發投入」。
商業產品在計畫中,但尚不存在。據同一篇報導,在 Season 2 之後「Nof1 打算推出一個消費級平台,搭載全球首批面向市場的編程智慧體」,並基於實驗室自研的前沿模型建構。Season 2 本身被描述為將加入網路搜尋、更長的推理時間與多步執行,並開發 Nof1 自己的模型而不只是測試別人的。以上全部應視為已揭露的路線圖而非已交付能力——其中沒有任何一項是今天可用的。
對正在評估這條收錄的讀者,實際含義是:沒有東西可買、沒有試用要開、沒有承諾要做。同時也意味著沒有支援關係、沒有服務等級協議,也不保證任何特定賽季一定會舉辦。
誠實的比較是:Alpha Arena 的優勢恰恰也是它的劣勢。真實市場讓它無法造假、無法飽和;同樣也讓它樣本小、成本高、雜訊大。它與統計型基準是互補關係,而非替代關係。
首要結論是模型大多虧錢,這個背景應當框定其餘一切。 Protos 在一篇標題為「大模型加密交易比賽發現大模型不會交易加密貨幣」的獨立報導中寫道:「在 Alpha Arena 加密交易比賽中相互競爭的六個大語言模型中,有四個以虧損收場,其中 OpenAI 的 ChatGPT 虧損最重,損失了其 63% 的資金。」
逐模型的虧損幅度相當可觀。 Protos 給出的第一季數字:ChatGPT 虧 6,267 美元,Gemini 虧 5,671 美元,Grok 虧 4,531 美元,Claude Sonnet 虧 3,081 美元。僅兩個模型獲利收場——DeepSeek 獲利 489 美元,QWEN3 MAX 獲利 2,232 美元。
這個模式跨賽季成立。 FinSMEs 報導,橫跨 Season 1 與 Season 1.5、八個模型各獲 1 萬美元的情況下,「在 32 組結果中,模型僅有 6 次以獲利收場」。在模型-賽道這一粒度上,失敗率約為 81%。
勝率既低又穩定。 第一季全部六個模型的勝率都落在 25% 到 30% 之間。交易頻次差異極大——Gemini 238 筆對 Claude Sonnet 38 筆——這意味著比較發生在相當不同的行為策略之間,而不只是判斷力高低之間。
手續費吞掉了優勢。 Nof1 自己承認「在早期運行中損益被交易成本主導,智慧體過度交易、攫取快速而微小的利潤,而這些利潤被手續費抹平」。QWEN3 MAX 付出的手續費最多,達 1,654 美元;Gemini 在大幅虧損的同時仍付了 1,331 美元。
即便是贏家,風險調整後的表現也很弱。 實測排行榜顯示夏普比率密集貼近零——按帳戶價值排名首位的模型為 0.019158,隨後兩位為 0.009537 與 0.000667,更靠後則出現 -0.010358 與 -0.038861 這類負值。兩週內在接近零夏普的情況下取得正報酬,不構成能力證據。
同一模型內部的離散度削弱了模型層面的結論。 GROK-4.20 在一條賽道收於 13,459 美元(+34.59%),而 GROK-4 在另一條賽道只剩 385.02 美元,近乎歸零。當同一廠商的模型同時占據兩個極端時,排名說明的更多是賽制與運氣,而非能力。
樣本量遠不足以支撐統計性主張,實驗室自己也同意。 Protos 報導 Nof1「表示後續還會有一場比賽,屆時會用更好的提示詞並引入'統計嚴謹性'」——這等於默認現有賽季缺乏這一點。兩週時間、少數幾個模型、幾十組結果,無法支撐強推論。
執行框架對模型的約束是實驗室公開記錄在案的。 Nof1 的複盤寫道:「我們已盡力給模型一個公平的機會,但 harness 施加了真實的約束。每個智慧體必須解析嘈雜的市場特徵、將其與當前帳戶狀態關聯、在嚴格規則下推理,並返回一個結構化動作——而這一切都發生在有限的上下文窗口之內。」Azhang 補充說模型被「限定在收窄的資產範圍與相當有限的動作空間」,且只被餵入數值時間序列這種大模型不擅長的格式。因此,糟糕的結果是關於這套特定配置的證據。
比賽目前並未在運行。 站點直白寫著:「官方競賽已於 2025 年 12 月 3 日美東時間下午 5 點結束。模型已停止運行。」抱著看即時對戰預期而來的人,可能只會看到一份存檔。
Season 1.5 的優勝者無法歸因。 獲勝條目以「Mystery Model」之名公布——兩週聚合報酬率 12.11%,跨賽制合計 4,844 美元。一個不具名的優勝者無法記在任何廠商名下,這限制了該頭條結果所能確立的內容。
站內沒有任何法務或治理揭露。 About 頁沒有註冊法人名稱、沒有註冊地、沒有地址、也沒有團隊名單。首頁、About 與排行榜三頁全文均無隱私政策、服務條款或 Cookie 政策連結。公司身分是靠第三方財經媒體而非站點自身印證的。
沒有投資免責聲明,也未說明監管身分。 站點未聲明結果不構成投資建議,Nof1 也未揭露任何金融牌照或監管授權。這是一個研究性展示,不是受監管的金融服務,讀者不應把公開的交易當作推薦。
跟單發生在 Nof1 的邊界之外。 由於第三方平台讓使用者可以鏡像模型策略,任何這樣做的人,其資金風險與合規曝險都落在一個 Nof1 既不營運也不監督的場所裡。
公開的提示詞與推理沒有明示授權條款。 完整的 USER_PROMPT 與 CHAIN_OF_THOUGHT 紀錄可公開查看,但站點未就這些材料的再利用列出任何明確條款,這讓轉載或用作資料集的立場處於未定義狀態。
完全免費。即時決策流、含全部績效指標的排行榜、聚合圖表與研究部落格都無需帳號即可查看,站內不存在定價頁、訂閱或結帳流程。你唯一可以提交的資料是候補名單信箱或聯絡表單的留言。
是的。每個參賽模型獲配 1 萬美元真實資金,在無人工干預的情況下自主交易。第一季在去中心化交易所 Hyperliquid 上交易加密永續合約;Season 1.5 交易美股與指數,包括 TSLA、NVDA、MSFT、AMZN、GOOGL、PLTR 以及 NDX 指數。
來自相互競爭的實驗室的前沿模型在同等條件下同台運行。實測排行榜包含 GROK-4.20、GROK-4、GPT-5.1、CLAUDE-SONNET-4-5、GEMINI-3-PRO、DEEPSEEK-CHAT-V3.1、QWEN3-MAX 與 KIMI-K2-THINKING,涵蓋 OpenAI、Anthropic、Google、xAI、DeepSeek、阿里巴巴與月之暗面。
大多沒有,這正是核心發現。第一季六個模型中有四個虧損收場,ChatGPT 損失了 63% 的資金。橫跨 Season 1 與 Season 1.5,模型在 32 組結果中僅有 6 次獲利。即便在獲利的那些運行裡,夏普比率也貼近零。
Nof1 本身不提供任何跟單功能。Coinpilot 等第三方平台在公開資料之上搭建了鏡像模型策略的能力,但那不在 Nof1 的控制範圍內;而且鑑於已公布賽季中多數模型虧損,這樣做並不明智。
站點聲明官方競賽已於 2025 年 12 月 3 日美東時間下午 5 點結束,模型已停止運行。除非此後開啟了新賽季,否則你看到的是一個已完賽賽季的存檔。Nof1 已表示計畫舉辦後續比賽,屆時會用更好的提示詞並提升統計嚴謹性。
Nof1 是一家由 Jay Azhang 創立的 AI 研究實驗室,FinSMEs 將其描述為「一家遠端運作的 AI 研究實驗室,訓練專注於金融市場的前沿模型」。它於 2026 年 5 月完成 1500 萬美元融資,由納斯達克上市的 SUI Group 與對沖基金 Karatage Opportunities 聯合領投。網站本身並未公布註冊法人名稱、地址或團隊名單。
Season 1.5 運行了四種賽制——New Baseline、Monk Mode、Situational Awareness 與 Max Leverage——它們改變了給到同一批模型的指令與風險姿態。Nof1 的研究部落格報告了「對提示詞微小改動的敏感性」,而排行榜印證了這一點:同一廠商的模型同時占據了實測表格的頂端與底端。
不提供。它是研究基準,不是金融服務。站點未發布投資免責聲明,Nof1 也未揭露任何金融牌照或監管授權,因此展示的一切都不應被讀作推薦。公開紀錄顯示多數模型虧損,這本身就是反對把它當作指引的最有力理由。
你不該把它當作統計上很強的結論,Nof1 也沒有這樣主張——它已表示未來比賽會補上「統計嚴謹性」,等於承認現有賽季缺乏這一點。它的價值在於透明度與結論的方向,而非精度:當失敗率高達約 81%、且每一筆交易背後的推理都公開可檢驗時,小樣本依然是有資訊量的。