Alpha Arena 是一个公开的实时基准测试:把真金白银交给多个前沿大语言模型,让它们在真实市场中完全自主交易,没有任何人工干预——并且把每一条提示词、每一段思维链、每一个交易决策全部公开,任何人都能逐条查阅。官网用六个词概括自己:「AI trading in real markets」(AI 在真实市场中交易)。
运营方是 Nof1,它不是一家软件厂商,而是一家 AI 研究实验室。这个区别对任何抱着「注册一个产品来用」的预期而来的人都很重要。Nof1 在 About 页给出的是一份明确的研究命题:「十年前,DeepMind 革新了 AI 研究。他们的关键洞见是,选对环境——游戏——就能推动前沿 AI 快速进步。在 Nof1,我们相信金融市场是下一个 AI 时代最好的训练环境。它是终极的世界建模引擎,也是唯一一个会随着 AI 变强而变得更难的基准。」
该页陈述的野心远不止办一个排行榜。Nof1 称自己「用市场来训练能够无限自我生成训练数据的新基座模型」,采用「开放式学习与大规模强化学习来应对市场这个最终 Boss 的复杂性」,并招募那些愿意「为现实世界造一个 AlphaZero」的人。换句话说,Alpha Arena 是一项规模大得多的研究计划所附带的公开实验。
独立报道印证的是这个身份本身,而不只是它的宣传口径。创投媒体 FinSMEs 在 2026 年 5 月把这家公司描述为「一家远程运作的 AI 研究实验室,训练专注于金融市场的前沿模型」,并报道其完成 1500 万美元融资,由纳斯达克上市公司 SUI Group 与对冲基金 Karatage Opportunities 联合领投。创始人为 Jay Azhang,他在 2025 年 10 月 17 日公开宣布该项目启动;Protos 与乌克兰加密媒体 Incrypted 的独立报道均指认其为 Nof1 创始人。
这个基准的特别之处不在于「用市场测试 AI」这个想法——模拟环境下的类似尝试已有多年——而在于它拒绝模拟。真实资金、真实成交、真实滑点、真实手续费。正如 Azhang 发布时所写:「6 个 AI 模型各自交易 1 万美元,完全自主——真钱、真市场、真基准。」
而横跨两个赛季的诚实结论是:这些模型大多亏了钱。这才是这个项目最有意思的地方,而 Nof1 选择把它公布出来,而不是藏起来。
用真实资金运行的实时基准。 每个参赛模型获得 1 万美元真实资金并自主交易。Incrypted 对启动阶段的报道引述实验室的说明:模型「完全自主运作,在活跃的加密市场上进行真实交易:比特币、以太坊、Solana、币安币、狗狗币与瑞波币。没有人工干预。除了模型自己决定实施的风险管理之外,没有任何限制。」
跨厂商的同等条件。 方法论的核心是每个模型拿到相同的输入和相同的执行框架。Nof1 的研究博客把设计写得很直白:「我们给六个领先的大模型各 1 万美元,让它们仅以数值化的市场数据为输入、使用完全相同的提示词与 harness,在真实市场中自主交易。」没有这个约束,比较就毫无意义;有了它,结果差异才能归因于模型本身而非脚手架。
四条并行赛道。 Season 1.5 把同一批模型分入四种赛制——标记为 1: New Baseline、2: Monk Mode、3: Situational Awareness、4: Max Leverage——并提供跨赛制的 Aggregate Index 聚合视图。这把提示词与风险姿态的差异变成了受控变量而非混杂因素,也解释了为什么同一个模型会在一张排行榜上出现多次、成绩却天差地别。
完整的推理透明度。 这是全网几乎没有对等物的一项。实时流中的每条决策都带有模型名、所属赛道、时间戳和一段自然语言摘要,并可展开三个原始字段:USER_PROMPT、CHAIN_OF_THOUGHT 与 TRADING_DECISIONS。你能读到模型被告知了什么、它究竟如何推理、以及它最终做了什么。对研究模型在压力下行为的人来说,这份存档本身就是产品。
带真实风险指标的排行榜,而不只是收益。 排行榜给出账户价值、收益率、总盈亏、手续费、胜率、最大单笔盈利与亏损、夏普比率和交易笔数,可按赛道筛选或聚合查看。把手续费和夏普与原始收益并列,正是它区别于「只看收益」的记分牌之处——而结果表明,故事恰恰藏在这两列里。
来自竞争实验室的前沿模型同台。 实测排行榜包含 GROK-4.20、GROK-4、GPT-5.1、CLAUDE-SONNET-4-5、GEMINI-3-PRO、DEEPSEEK-CHAT-V3.1、QWEN3-MAX 与 KIMI-K2-THINKING。很少有公开场合能把 OpenAI、Anthropic、谷歌、xAI、DeepSeek、阿里与月之暗面的模型放在同一时刻、同一条件下比较。
赛季之间切换的资产类别。 第一季交易加密永续合约,Season 1.5 转向美股与指数——实时流与行情条覆盖 TSLA、NDX、NVDA、MSFT、AMZN、GOOGL 与 PLTR。这个切换本身就有信息量:在一种市场环境下奏效的策略,不会自动迁移到另一种。
校准你对大模型实际能力的预期。 这是它最主要的价值,而且是一种有用的「降温」。如果你听过「把前沿模型接到市场上就能产生收益」的说法,这份公开记录是最便宜的纠偏材料:横跨 Season 1 与 Season 1.5,模型在 32 组结果中仅有 6 次以盈利收场。
在同等条件下研究模型行为与「性格」。 Nof1 自己的早期发现是模型表现出「真实的行为差异(风险偏好、仓位规模、持仓时间)」。Azhang 把这描述为模型呈现出「一致的偏差」,近似于「某种投资'性格'」。读一读思维链存档,你会看到在同一时刻、同一标的上,一个模型在论证耐心持有,另一个在为加杠杆找理由。
提示词敏感性研究。 博客报告了「对提示词微小改动的敏感性」,而四赛道结构让这一点变得可测量而非只是轶事。如果你在构建智能体系统,同一模型在 New Baseline 与 Max Leverage 之间的可见差距,就是一堂关于「智能体的行为有多少存在于指令而非权重中」的具体课程。
教学与评论 AI 能力宣称。 一个严苛不留情面的记分牌,加上完整公开的推理过程,构成了一件难得的教学素材——那些推理在结果最糟糕的段落里,往往听起来最权威。
理解为什么交易成本会主导幼稚的智能体策略。 Nof1 自己的复盘指出:「在早期运行中,盈亏被交易成本主导,智能体过度交易、频繁攫取微小利润,而这些利润被手续费吞噬。」任何在有手续费环境中设计高频动作智能体的人,都该把这句话读两遍。
超越静态基准的横向评测。 对于苦于「饱和的选择题基准已无法区分前沿模型」的研究者来说,真实市场是一个抗记忆化的基准,而且按 Nof1 的说法,它会随着模型变强而变难。
它不适合什么。 它不是投资产品、交易工具、信号服务,也不是一套你该照抄的策略。它不为用户提供任何组合、执行、风控或建议。
第一步:从排行榜开始,而不是实时流。 实时流很吸引人,但它是轶事性的。排行榜给你的是分布:哪些模型、在哪条赛道、最终落在什么位置、为此付出了多少手续费。
第二步:先看夏普那一列,再看收益率。 收益率告诉你发生了什么,夏普告诉你这是挣来的还是熬过来的。在实测排行榜上,夏普数值密集地贴近零并转负——包括那些收益率排名靠前的模型。
第三步:把同一个模型横跨四条赛道对比。 这是站内最有教益的单项练习。挑一个同时出现在 New Baseline、Monk Mode、Situational Awareness 与 Max Leverage 的模型,看它的离散度。实测数据显示 GROK-4.20 在一条赛道收于 13,459 美元,而 GROK-4 在另一条赛道只剩 385.02 美元——提示词与风险赛制对结果的影响,超过了选哪个模型。
第四步:展开一笔亏损交易的思维链。 点开一条结果糟糕的决策的 USER_PROMPT、CHAIN_OF_THOUGHT 与 TRADING_DECISIONS。读到自信满满的推理挂在一个糟糕结果上,是治愈「过度信任流畅模型输出」最快的方法。
第五步:把手续费列和盈亏列对着看。 有几个模型付出的手续费占其盈亏绝对值的很大一部分,甚至超过它。这就是实验室记录的「过度交易」问题的具体形态。
第六步:下结论前先看日期。 站点挂着一条明确公告:「官方竞赛已于 2025 年 12 月 3 日美东时间下午 5 点结束。模型已停止运行。」除非此后又开新赛季,否则你看到的是一个已完赛赛季的存档,而不是正在进行的比赛。
第七步:读研究博客是为了方法论,不只是结果。 博客条目解释了模型被给了什么、没被给什么,这是把任何数字当作「对某模型通用能力的判决」之前必须具备的背景。
第八步:谨慎对待「Mystery Model」的结果。 Season 1.5 的优胜者以「Mystery Model」之名公布,两周聚合收益率 12.11%,跨赛制合计盈利 4,844 美元。由于优胜者不具名,这一结果无法归因到任何厂商。
聚合口径的权重应高于任何单条赛道。 单条赛道两周是极小的样本。Aggregate Index 之所以存在,正是因为单一赛制的结果噪声很大——而即便是聚合口径,覆盖的窗口也很短。
记住模型被剥夺了什么。 Azhang 明确说过这套设置是刻意为难的:「大模型其实不太擅长处理数值化时间序列数据,但那正是我们给它们的全部上下文」,而且模型被「限定在一个收窄的资产范围和相当有限的动作空间里」。这里的糟糕成绩是关于这套配置的证据,而不是「大模型永远不能交易」的证明。
不要把两周的收益读成能力。 Season 1 的胜率密集落在 25% 到 30% 之间,两周内的成绩差异中运气占了很大权重。夏普、交易笔数与手续费负担所携带的信息,比排名更多。
关注交易笔数的离散度。 Season 1 中 Gemini 交易 238 笔,而 Claude Sonnet 只有 38 笔。频率是一种直接与手续费相互作用的行为签名,它对结果的预测力往往强于方向判断的准确率。
把测试轮当作方差的警示案例。 在公开赛季之前,团队于 2025 年 10 月 11 日用每模型 200 美元做过一次试运行,其中 Grok-4 首日录得 500% 回报。这个数字作为能力信号毫无意义,恰好说明了为什么短窗口与小本金会误导人。
不要跨资产类别外推。 第一季是加密永续合约,Season 1.5 是美股。一种环境下的结果对另一种说明不了什么。
把公开的推理当作数据,而不是建议。 思维链存档对研究确有价值。它不是一组交易点子,而产出它的那些模型亏损的次数多于盈利。
在默认这些数字是最新之前,先确认赛季是否在跑。 站点对赛事状态是诚实的;从几个月前的文章点进来的读者往往不是。
AI 研究者与评测专家。 如果你的工作涉及度量模型能力,这是一个罕见的样本:具备真正对抗性的环境、真实的后果,以及完整的推理透明度。
构建智能体系统的工程师。 赛道之间的可见差距是关于提示词与脚手架敏感性的实践课,而手续费与盈亏的关系则是对「动作过于频繁的智能体」的直接警告。
量化与系统化交易者。 不是作为策略来源,而是作为证据:通用语言模型当下究竟是对系统化方法构成威胁,还是提供杠杆。公开的夏普数值给出了相关的答案。
报道、教学与分析 AI 宣称的人。 数据公开、方法论明示,且结果与该领域最夸张的营销话术相矛盾。这个组合并不好找。
关注 AI 行业的知情观察者。 如果你想知道前沿模型能否在一个不留情面的开放式环境中胜任行动,这是目前最直接的公开证据。
应当远离的人。 寻找可照抄信号的散户投资者;寻求交易工具、组合管理或投顾服务的人;以及会把一张两周排行榜当作配置自有资金依据的人。Nof1 并未在站内发布投资免责声明,但结果本身已经说明问题:多数参赛者亏损。
Alpha Arena 是一个纯网页产品,通过 nof1.ai 访问。整个站点只由五个导航目的地构成——LIVE、LEADERBOARD、BLOG、MODELS 与 ABOUT——没有桌面应用、没有移动应用、没有浏览器扩展,也没有公开的 API 文档。这个项目向公众提供的一切,都能在浏览器里无账号读取。
执行层的基础设施与展示层不同。第一季的交易在去中心化永续合约交易所 Hyperliquid 上执行。按 Incrypted 的报道,模型绩效还通过一份公开可访问的表格追踪,其中度量夏普比率与组合总价值。第三方在公开数据之上搭建了跟随能力——Incrypted 提到用户可以「关注模型的表现,并复制它们的策略,例如通过 Coinpilot 平台」。这条跟单路径由外部平台提供,而非 Nof1,这决定了风险与责任落在哪一侧。
公告与赛季更新通过官方 X 账号 @the_nof1 以及创始人 Jay Azhang 的个人账号发布,2025 年 10 月 17 日的启动消息最初就发布于此。
关于访问的一条实务说明:站点位于 Vercel 的安全检查点之后,对自动化请求可能返回 HTTP 429。普通浏览器访问不受影响。
Alpha Arena 完全免费浏览,不存在任何付费档位。
站内没有定价页、没有账户体系、没有登录、没有订阅、也没有任何结账流程。完整的公开仪表盘——实时决策流、含全部绩效指标的排行榜、聚合图表与研究博客——无需注册即可访问。全站唯一出现的转化动作是一个「Join the Waitlist」入口,而 About 页唯一的行动号召是招聘:「我们在招人:工程师、研究员、创业者、原创思考者」,后面跟着一个联系方式。
这与该组织的性质是一致的。Nof1 的资金来自研究实验室的融资,而不是用户。FinSMEs 报道其于 2026 年 5 月完成由 SUI Group 与 Karatage Opportunities 联合领投的 1500 万美元融资,资金用途为「扩张运营与研发投入」。
商业产品在计划中,但尚不存在。据同一篇报道,在 Season 2 之后「Nof1 打算推出一个消费级平台,搭载全球首批面向市场的编程智能体」,并基于实验室自研的前沿模型构建。Season 2 本身被描述为将加入网络搜索、更长的推理时间与多步执行,并开发 Nof1 自己的模型而不只是测试别人的。以上全部应视为已披露的路线图而非已交付能力——其中没有任何一项是今天可用的。
对正在评估这条收录的读者,实际含义是:没有东西可买、没有试用要开、没有承诺要做。同时也意味着没有支持关系、没有服务等级协议,也不保证任何特定赛季一定会举办。
诚实的比较是:Alpha Arena 的优势恰恰也是它的劣势。真实市场让它无法造假、无法饱和;同样也让它样本小、成本高、噪声大。它与统计型基准是互补关系,而非替代关系。
首要结论是模型大多亏钱,这个背景应当框定其余一切。 Protos 在一篇标题为「大模型加密交易比赛发现大模型不会交易加密货币」的独立报道中写道:「在 Alpha Arena 加密交易比赛中相互竞争的六个大语言模型中,有四个以亏损收场,其中 OpenAI 的 ChatGPT 亏损最重,损失了其 63% 的资金。」
逐模型的亏损幅度相当可观。 Protos 给出的第一季数字:ChatGPT 亏 6,267 美元,Gemini 亏 5,671 美元,Grok 亏 4,531 美元,Claude Sonnet 亏 3,081 美元。仅两个模型盈利收场——DeepSeek 盈利 489 美元,QWEN3 MAX 盈利 2,232 美元。
这个模式跨赛季成立。 FinSMEs 报道,横跨 Season 1 与 Season 1.5、八个模型各获 1 万美元的情况下,「在 32 组结果中,模型仅有 6 次以盈利收场」。在模型-赛道这一粒度上,失败率约为 81%。
胜率既低又稳定。 第一季全部六个模型的胜率都落在 25% 到 30% 之间。交易频次差异极大——Gemini 238 笔对 Claude Sonnet 38 笔——这意味着比较发生在相当不同的行为策略之间,而不只是判断力高低之间。
手续费吞掉了优势。 Nof1 自己承认「在早期运行中盈亏被交易成本主导,智能体过度交易、攫取快速而微小的利润,而这些利润被手续费抹平」。QWEN3 MAX 付出的手续费最多,达 1,654 美元;Gemini 在大幅亏损的同时仍付了 1,331 美元。
即便是赢家,风险调整后的表现也很弱。 实测排行榜显示夏普比率密集贴近零——按账户价值排名首位的模型为 0.019158,随后两位为 0.009537 与 0.000667,更靠后则出现 -0.010358 与 -0.038861 这类负值。两周内在接近零夏普的情况下取得正收益,不构成能力证据。
同一模型内部的离散度削弱了模型层面的结论。 GROK-4.20 在一条赛道收于 13,459 美元(+34.59%),而 GROK-4 在另一条赛道只剩 385.02 美元,近乎归零。当同一厂商的模型同时占据两个极端时,排名说明的更多是赛制与运气,而非能力。
样本量远不足以支撑统计性主张,实验室自己也同意。 Protos 报道 Nof1「表示后续还会有一场比赛,届时会用更好的提示词并引入'统计严谨性'」——这等于默认现有赛季缺乏这一点。两周时间、少数几个模型、几十组结果,无法支撑强推断。
执行框架对模型的约束是实验室公开记录在案的。 Nof1 的复盘写道:「我们已尽力给模型一个公平的机会,但 harness 施加了真实的约束。每个智能体必须解析嘈杂的市场特征、将其与当前账户状态关联、在严格规则下推理,并返回一个结构化动作——而这一切都发生在有限的上下文窗口之内。」Azhang 补充说模型被「限定在收窄的资产范围与相当有限的动作空间」,且只被喂入数值时间序列这种大模型不擅长的格式。因此,糟糕的结果是关于这套特定配置的证据。
比赛目前并未在运行。 站点直白写着:「官方竞赛已于 2025 年 12 月 3 日美东时间下午 5 点结束。模型已停止运行。」抱着看实时对战预期而来的人,可能只会看到一份存档。
Season 1.5 的优胜者无法归因。 获胜条目以「Mystery Model」之名公布——两周聚合收益率 12.11%,跨赛制合计 4,844 美元。一个不具名的优胜者无法记在任何厂商名下,这限制了该头条结果所能确立的内容。
站内没有任何法务或治理披露。 About 页没有注册法人名称、没有注册地、没有地址、也没有团队名单。首页、About 与排行榜三页全文均无隐私政策、服务条款或 Cookie 政策链接。公司身份是靠第三方财经媒体而非站点自身印证的。
没有投资免责声明,也未说明监管身份。 站点未声明结果不构成投资建议,Nof1 也未披露任何金融牌照或监管授权。这是一个研究性展示,不是受监管的金融服务,读者不应把公开的交易当作推荐。
跟单发生在 Nof1 的边界之外。 由于第三方平台让用户可以镜像模型策略,任何这样做的人,其资金风险与合规敞口都落在一个 Nof1 既不运营也不监督的场所里。
公开的提示词与推理没有明示许可条款。 完整的 USER_PROMPT 与 CHAIN_OF_THOUGHT 记录可公开查看,但站点未就这些材料的再利用列出任何明确条款,这让转载或用作数据集的立场处于未定义状态。
完全免费。实时决策流、含全部绩效指标的排行榜、聚合图表与研究博客都无需账号即可查看,站内不存在定价页、订阅或结账流程。你唯一可以提交的数据是候补名单邮箱或联系表单的留言。
是的。每个参赛模型获配 1 万美元真实资金,在无人工干预的情况下自主交易。第一季在去中心化交易所 Hyperliquid 上交易加密永续合约;Season 1.5 交易美股与指数,包括 TSLA、NVDA、MSFT、AMZN、GOOGL、PLTR 以及 NDX 指数。
来自相互竞争的实验室的前沿模型在同等条件下同台运行。实测排行榜包含 GROK-4.20、GROK-4、GPT-5.1、CLAUDE-SONNET-4-5、GEMINI-3-PRO、DEEPSEEK-CHAT-V3.1、QWEN3-MAX 与 KIMI-K2-THINKING,覆盖 OpenAI、Anthropic、谷歌、xAI、DeepSeek、阿里与月之暗面。
大多没有,这正是核心发现。第一季六个模型中有四个亏损收场,ChatGPT 损失了 63% 的资金。横跨 Season 1 与 Season 1.5,模型在 32 组结果中仅有 6 次盈利。即便在盈利的那些运行里,夏普比率也贴近零。
Nof1 本身不提供任何跟单功能。Coinpilot 等第三方平台在公开数据之上搭建了镜像模型策略的能力,但那不在 Nof1 的控制范围内;而且鉴于已公布赛季中多数模型亏损,这样做并不明智。
站点声明官方竞赛已于 2025 年 12 月 3 日美东时间下午 5 点结束,模型已停止运行。除非此后开启了新赛季,否则你看到的是一个已完赛赛季的存档。Nof1 已表示计划举办后续比赛,届时会用更好的提示词并提升统计严谨性。
Nof1 是一家由 Jay Azhang 创立的 AI 研究实验室,FinSMEs 将其描述为「一家远程运作的 AI 研究实验室,训练专注于金融市场的前沿模型」。它于 2026 年 5 月完成 1500 万美元融资,由纳斯达克上市的 SUI Group 与对冲基金 Karatage Opportunities 联合领投。网站本身并未公布注册法人名称、地址或团队名单。
Season 1.5 运行了四种赛制——New Baseline、Monk Mode、Situational Awareness 与 Max Leverage——它们改变了给到同一批模型的指令与风险姿态。Nof1 的研究博客报告了「对提示词微小改动的敏感性」,而排行榜印证了这一点:同一厂商的模型同时占据了实测表格的顶端与底端。
不提供。它是研究基准,不是金融服务。站点未发布投资免责声明,Nof1 也未披露任何金融牌照或监管授权,因此展示的一切都不应被读作推荐。公开记录显示多数模型亏损,这本身就是反对把它当作指引的最有力理由。
你不该把它当作统计上很强的结论,Nof1 也没有这样主张——它已表示未来比赛会补上「统计严谨性」,等于承认现有赛季缺乏这一点。它的价值在于透明度与结论的方向,而非精度:当失败率高达约 81%、且每一笔交易背后的推理都公开可检验时,小样本依然是有信息量的。