Toolso.AI
Toolso.AI
すべてのツールカテゴリ急上昇最新ツール料金プランブログ
Toolso.AI
Toolso.AI

💌AIツールウィークリーを購読

最新かつ最も注目されるAIツールとトレンドの週次厳選セレクションをメールボックスにお届けします 購読

Toolso.AI
Toolso.AI

生産性を向上させる最高のAIツールを発見する

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

人気カテゴリ

  • AI執筆
  • AI画像
  • AI動画
  • AIコーディング
  • 他のカテゴリ

探索

  • 最新ツール
  • 人気ツール
  • 他のツール
  • ツールを提出
  • 料金

会社概要

  • 会社概要
  • お問い合わせ
  • ブログ
  • 変更履歴

法的情報

  • クッキーポリシー
  • プライバシーポリシー
  • 利用規約
  • 返金ポリシー
© 2026 Toolso.AI 無断転載を禁じます
期間限定期間限定注目掲載24時間優先審査・被リンク不要・30日間注目表示$29.90終了後 $59.9010月31日以降 $59.90に値上げ終了まで--:--:--今すぐ投稿
  1. ホーム
  2. すべてのツール
  3. アナリティクス
  4. Alpha Arena
Alpha Arenaのインターフェースプレビュー
Alpha Arenaのロゴ

Alpha Arena

Alpha ArenaはAI研究ラボNof1が運営する公開ベンチマークで、OpenAI・Anthropic・Google・xAI・DeepSeek・アリババのフロンティアモデルがそれぞれ1万ドルの実資金を自律運用し、プロンプトと思考過程、売買判断のすべてが公開されます。

アナリティクスリサーチテストツール#自律#LLM#AIエージェント
無料で試す
保存
アクセス数
閲覧数
価格
フリーミアム
公開日
2026年8月22日
ドメイン
nof1.ai
ユーザー評価

このツールを使いましたか?評価してください

このツールを評価する

Alpha Arena 製品情報

無料で試す
ツール情報
保存
アクセス数
閲覧数
価格
フリーミアム
公開日
2026年8月22日
ドメイン
nof1.ai
ユーザー評価

このツールを使いましたか?評価してください

このツールを評価する

注目のツール

関連ツール

無料で試す

Alpha Arenaとは

Alpha Arenaは、フロンティアの大規模言語モデルに実際の資金を預け、人間の介入なしに実際の市場で自律的に売買させる公開のライブベンチマークです。しかも、すべてのプロンプト、すべての思考過程、すべての売買判断が誰でも読める形で公開されます。サイトは自らを一言でこう表しています。「AI trading in real markets」(実際の市場で取引するAI)。

運営しているのはNof1で、ソフトウェアベンダーではなくAI研究ラボです。「登録して使う製品」を期待して訪れた人にとって、この区別は重要です。AboutページにあるNof1の言葉は、明確に研究上の命題です。「10年前、DeepMindはAI研究を一変させました。彼らの核心的な洞察は、正しい環境——ゲーム——を選ぶことがフロンティアAIの急速な進歩につながる、というものでした。Nof1は、金融市場こそ次の時代のAIにとって最良の訓練環境だと考えています。市場は究極の世界モデリングエンジンであり、AIが賢くなるほど難しくなる唯一のベンチマークです。」

同ページが掲げる野心は、順位表の運営にとどまりません。Nof1は「市場を用いて、自ら訓練データを無限に生成する新しい基盤モデルを訓練している」と述べ、「オープンエンド学習と大規模強化学習によって、最終ボスである市場の複雑さに対処する」とし、「現実世界のためのAlphaZeroを作りたい」人材を募集しています。つまりAlpha Arenaは、はるかに大きな研究プログラムに付随する公開実験です。

独立した報道は、その宣伝文句ではなく、この立ち位置そのものを裏づけています。ベンチャー専門メディアFinSMEsは2026年5月、同社を「金融市場に焦点を当てたフロンティアモデルを訓練する、リモート運営のAI研究ラボ」と紹介し、ナスダック上場企業のSUI GroupとヘッジファンドのKaratage Opportunitiesが共同主導した1500万ドルの資金調達を報じました。創業者はJay Azhangで、2025年10月17日にプロジェクトの開始を公に告知しており、Protosとウクライナの暗号資産メディアIncryptedの独立報道はいずれも彼をNof1の創業者だとしています。

このベンチマークが特異なのは、市場でAIを試すという発想そのものではありません——シミュレーション上の試みは何年も前からあります——シミュレーションを拒んだ点にあります。実際の資金、実際の約定、実際のスリッページ、実際の手数料です。Azhangが開始時に書いたとおり、「6つのAIモデルがそれぞれ1万ドルを完全自律で取引する——本物の金、本物の市場、本物のベンチマーク」です。

そして2シーズンを通じた正直な結論は、モデルの多くが損を出したということです。それこそがこのプロジェクトで最も興味深い点であり、Nof1はそれを隠さずに公開しています。

主な機能

実資金で動くライブベンチマーク。 参加する各モデルは1万ドルの実際の資金を受け取り、自律的に売買します。開始時を扱ったIncryptedの報道は、ラボの説明をこう引用しています。モデルは「完全に自律的に動作し、ビットコイン、イーサリアム、Solana、バイナンスコイン、ドージコイン、リップルのライブ暗号資産市場で実際の取引を行う。人間の介入はない。モデル自身がリスク管理として実装すると決めたもの以外に制約はない」。

ベンダーをまたぐ同一条件。 方法論の核心は、すべてのモデルが同じ入力と同じ実行フレームを受け取ることです。Nof1の研究ブログは設計を率直に記しています。「6つの先進的なLLMにそれぞれ1万ドルを与え、数値化された市場データのみを入力として、同一のプロンプトとハーネスで実際の市場を自律的に売買させた。」この制約がなければ比較は無意味になり、あればこそ結果の差を足場ではなくモデル自体に帰属させられます。

4本の並行トラック。 Season 1.5は同じモデル群を4つの方式に分けます。1: New Baseline、2: Monk Mode、3: Situational Awareness、4: Max Leverageで、これらを横断するAggregate Indexの集計ビューも用意されています。これによりプロンプトとリスク姿勢の違いが交絡要因ではなく統制変数になり、同じモデルが1つの順位表に複数回現れて成績が大きく分かれる理由もここにあります。

完全な推論の透明性。 他に実質的な同等物が見当たらない機能です。ライブフィードの各判断にはモデル名、所属トラック、タイムスタンプ、平易な要約が付き、USER_PROMPT、CHAIN_OF_THOUGHT、TRADING_DECISIONSという3つの生フィールドに展開できます。モデルが何を伝えられ、どう推論し、結局何をしたのかをそのまま読めます。プレッシャー下のモデル挙動を研究する人にとって、この記録そのものが製品です。

リターンだけでなく実際のリスク指標も載る順位表。 順位表は口座価値、リターン率、総損益、手数料、勝率、最大の利益と損失、シャープレシオ、取引回数を示し、トラック別の絞り込みや集計表示が可能です。手数料とシャープを素のリターンと並べて置くことが、単なるリターン表との違いであり、結果を見ると物語はまさにこの2列にあります。

競合ラボのフロンティアモデルが同席。 実測の順位表にはGROK-4.20、GROK-4、GPT-5.1、CLAUDE-SONNET-4-5、GEMINI-3-PRO、DEEPSEEK-CHAT-V3.1、QWEN3-MAX、KIMI-K2-THINKINGが含まれます。OpenAI、Anthropic、Google、xAI、DeepSeek、アリババ、Moonshotのモデルを同じ時点、同じ条件に置く公開の場はそう多くありません。

シーズン間で変わった資産クラス。 シーズン1は暗号資産の無期限先物、Season 1.5は米国株と指数でした。ライブフィードと気配表示はTSLA、NDX、NVDA、MSFT、AMZN、GOOGL、PLTRを含みます。この切り替え自体が情報です。ある局面で通用した戦略が、別の局面に自動的に移るわけではありません。

活用シーン

LLMに実際何ができるのか、期待値を較正する。 これが第一の価値であり、有益な方向に期待を下げてくれます。フロンティアモデルを市場につなげば収益が出ると聞いたことがあるなら、公開された記録が最も安価な訂正材料です。シーズン1とSeason 1.5を通じて、モデルが利益で終えたのは32組の結果のうちわずか6回でした。

同一条件下でのモデルの挙動と「性格」を研究する。 Nof1自身の初期の発見は、モデルが「実際の行動上の差異(リスク、建玉サイズ、保有時間)」を示すというものでした。Azhangはこれを「一貫したバイアス」、すなわち「投資上の『性格』のようなもの」と表現しています。思考過程の記録を読むと、同じ時刻の同じ銘柄について、あるモデルが辛抱を正当化し、別のモデルがレバレッジを合理化している様子が見えます。

プロンプト感度の研究。 ブログは「小さなプロンプト変更への感受性」を報告しており、4トラック構造がこれを逸話ではなく測定可能な対象にしています。エージェントシステムを作る人にとって、同一モデルのNew BaselineとMax Leverageの間に見える差は、エージェントの挙動がどれだけ重みではなく指示に宿るかを示す具体的な教訓です。

AIの能力主張についての教育と論評。 情け容赦のないスコアボードと、完全に公開された推論の組み合わせは、稀に見る教材になります。結果が最も悪かった箇所ほど、推論はもっともらしく響くものです。

なぜ取引コストが素朴なエージェント戦略を支配するのかを理解する。 Nof1自身のまとめは「初期の実行では損益が取引コストに支配され、エージェントが過剰に売買し、素早く小さな利益を取っては手数料に消された」と述べています。手数料の発生する環境で頻繁に行動するエージェントを設計する人は、この一文を二度読むべきです。

静的ベンチマークを超えた比較評価。 飽和した選択式ベンチマークではもはやフロンティアモデルを弁別できないと感じている研究者にとって、実際の市場は暗記が効かないベンチマークであり、Nof1の主張どおりならモデルが良くなるほど難しくなります。

向いていない用途。 投資商品でも売買ツールでもシグナル配信でもなく、真似すべき戦略でもありません。利用者にポートフォリオも約定もリスク管理も助言も提供しません。

Alpha Arenaの使い方

ステップ1 — ライブフィードではなく順位表から始める。 ライブフィードは魅力的ですが逸話的です。順位表は分布を与えてくれます。どのモデルがどのトラックでどこに着地し、そのために手数料をいくら払ったかが分かります。

ステップ2 — リターン率より先にシャープの列を見る。 リターン率は何が起きたかを教え、シャープはそれが実力で得たものか、耐えて残ったものかを教えます。実測の順位表ではシャープの値はゼロ付近に集まり、マイナスにも沈みます。リターン上位のモデルも例外ではありません。

ステップ3 — 同じモデルを4トラック横断で比べる。 サイト内で最も学びの多い単一の演習です。New Baseline、Monk Mode、Situational Awareness、Max Leverageのすべてに登場するモデルを選び、そのばらつきを見てください。実測データではGROK-4.20があるトラックで13,459ドルで終え、GROK-4は別のトラックで385.02ドルしか残りませんでした。プロンプトとリスク方式が、モデル選択よりも結果を大きく動かしたのです。

ステップ4 — 損失取引の思考過程を展開する。 結果が悪かった判断のUSER_PROMPT、CHAIN_OF_THOUGHT、TRADING_DECISIONSを開いてみてください。自信に満ちた推論が悪い結果に結びついている様を読むことは、流暢なモデル出力を過信する癖を治す最短の方法です。

ステップ5 — 手数料の列と損益の列を並べて見る。 いくつかのモデルでは支払った手数料が損益の絶対値の大きな割合を占め、あるいはそれを上回ります。ラボが記録した過剰売買問題の具体的な形です。

ステップ6 — 結論を出す前に日付を確認する。 サイトには明確な告知があります。「公式競技は2025年12月3日 米国東部時間午後5時をもって終了しました。モデルはもう稼働していません。」以後に新シーズンが始まっていない限り、見えているのは終了したシーズンの記録です。

ステップ7 — 研究ブログは結果ではなく方法論のために読む。 ブログの記事は、モデルに何が与えられ何が与えられなかったかを説明しています。どの数字であれ、それをモデルの一般的能力への判決として扱う前に不可欠な文脈です。

ステップ8 — 「Mystery Model」の結果は慎重に扱う。 Season 1.5の優勝者は「Mystery Model」として公開され、2週間の集計リターンは12.11%、競技全体で4,844ドルを稼ぎました。優勝者が匿名であるため、この結果はどのベンダーにも帰属させられません。

活用のコツとベストプラクティス

単一トラックより集計値に重みを置く。 1トラックの2週間はきわめて小さい標本です。Aggregate Indexが存在するのは、まさに単一方式の結果がノイズだらけだからであり、その集計ですら短い期間しか覆いません。

モデルが何を奪われていたかを忘れない。 Azhangはこの設定が意図的に難しいと明言しています。「LLMは数値の時系列データをあまりうまく扱えないが、我々が与えた文脈はそれだけだった」と述べ、モデルには「絞り込まれた資産範囲とかなり限定された行動空間」が与えられていました。ここでの不振はこの構成についての証拠であって、LLMが決して取引できないという証明ではありません。

2週間のリターンを実力と読まない。 シーズン1の勝率が25〜30%に集中している以上、2週間の成績差には運の比重が大きく効きます。シャープ、取引回数、手数料負担のほうが順位より多くの情報を運びます。

取引回数のばらつきに注目する。 シーズン1ではGeminiが238回、Claude Sonnetが38回でした。頻度は手数料と直接に相互作用する行動上の署名であり、方向の的中率より結果をよく予測することが少なくありません。

テストラウンドを分散の警告例として使う。 公開シーズンに先立ち、チームは2025年10月11日にモデルあたり200ドルで試験運用を行い、そこでGrok-4は初日に500%のリターンを記録しました。この数字は能力を示す指標としては無意味で、短い期間と小さな元手がなぜ誤解を招くかをよく示しています。

資産クラスをまたいで外挿しない。 シーズン1は暗号資産の無期限先物、Season 1.5は米国株でした。一方の局面の結果は他方についてほとんど語りません。

公開された推論は助言ではなくデータとして扱う。 思考過程の記録は研究にとって確かに価値があります。売買アイデア集ではなく、それを生んだモデルたちは利益より損失のほうが多かったのです。

数字が最新だと決めつける前に、シーズンが動いているか確かめる。 サイトは競技の状態について正直ですが、数か月前の記事から来た読者はそうでないことが多いのです。

どんな人に向いているか

AI研究者と評価の専門家。 モデル能力の測定に関わる仕事なら、真に敵対的な環境と実際の結果、そして完全な推論の透明性を備えた稀な事例です。

エージェントシステムを作るエンジニア。 トラック間の目に見える差はプロンプトと足場の感度についての実践的な教訓であり、手数料と損益の関係は行動しすぎるエージェントへの直接的な警告です。

クオンツとシステムトレーダー。 戦略の供給源としてではなく、汎用言語モデルが現時点でシステム的手法にとって脅威なのか梃子なのかについての証拠として有用です。公開されたシャープの値がその答えです。

AIの主張を扱う記者、教育者、アナリスト。 データが公開され、方法論が明示され、結果はこの分野で最も誇張されたマーケティングと真っ向から食い違います。この組み合わせはなかなか見つかりません。

AI業界を注視する情報感度の高い観察者。 フロンティアモデルが容赦のないオープンエンドな環境で有能に行動できるかを知りたいなら、現在入手できる最も直接的な公開証拠です。

近づかないほうがよい人。 真似できるシグナルを探す個人投資家、売買ツールやポートフォリオ運用、投資助言サービスを求める人、そして2週間の順位表を自己資金の配分根拠にしてしまう人です。Nof1はサイトに投資免責文言を掲げていませんが、結果自体が答えを語っています。参加者の多くは損をしました。

対応プラットフォーム

Alpha Arenaはnof1.aiでアクセスするウェブ専用の製品です。サイト全体はLIVE、LEADERBOARD、BLOG、MODELS、ABOUTという5つの遷移先だけで構成され、デスクトップアプリもモバイルアプリもブラウザ拡張も、公開APIドキュメントもありません。このプロジェクトが一般に提供するすべては、アカウントなしでブラウザから読めます。

執行側のインフラは表示層とは別です。シーズン1の取引は分散型無期限先物取引所Hyperliquid上で執行されました。Incryptedの報道によれば、モデルの成績はシャープレシオとポートフォリオ総額を測る公開スプレッドシートでも追跡されていました。第三者は公開データの上に追随機能を築いており、Incryptedは利用者が「モデルの成果を追い、その戦略を複製できる。たとえばCoinpilotプラットフォーム経由で」と伝えています。このコピートレードの経路はNof1ではなく外部プラットフォームが提供しており、リスクと責任がどちら側にあるかを左右します。

告知とシーズンの更新は公式Xアカウント@the_nof1と創業者Jay Azhangの個人アカウントで配信され、2025年10月17日の開始告知も最初はここで発表されました。

アクセスに関する実務上の注意が一つあります。サイトはVercelのセキュリティチェックポイントの背後にあり、自動化されたリクエストにはHTTP 429を返すことがあります。通常のブラウザからのアクセスには影響しません。

料金とプラン

Alpha Arenaは全体を無料で閲覧でき、いかなる有料階層もありません。

サイトのどこにも料金ページ、アカウント体系、ログイン、サブスクリプション、決済フローはありません。ライブの判断フィード、全成績指標を備えた順位表、集計チャート、研究ブログからなる公開ダッシュボードの全体を、登録なしで利用できます。サイト上に存在する唯一のコンバージョン動線は「Join the Waitlist」であり、Aboutページの唯一の行動喚起は採用です。「我々は採用中です。エンジニア、研究者、創業者、独創的な思考をする人」という文言の後に連絡先が続きます。

これはこの組織の性質と一致しています。Nof1の原資は利用者ではなく研究ラボへの投資です。FinSMEsは2026年5月、SUI GroupとKaratage Opportunitiesが共同主導した1500万ドルのラウンドを報じ、資金使途を「事業の拡大と開発の推進」としています。

商用製品は計画されていますが、まだ存在しません。同じ報道によれば、シーズン2の後に「Nof1は市場向けの世界初のコーディングエージェントを備えた消費者向けプラットフォームを立ち上げる意向」で、ラボ自身のフロンティアモデルの上に構築されます。シーズン2自体は、ウェブ検索と延長された推論時間、複数ステップの実行を加え、他社モデルを試すだけでなくNof1自身のモデルを開発するものとして説明されています。これらはすべて公表されたロードマップであって出荷済みの機能ではなく、今日使えるものは一つもありません。

この掲載を検討している読者にとっての実務的な含意はこうです。買うものも、試すものも、約束することもありません。同時に、サポート関係もSLAもなく、特定のシーズンが必ず開催される保証もありません。

代替サービス

  • 静的なLLMベンチマーク(MMLU系の問題集、コーディングや推論の評価) — 再現性と時系列での比較可能性ははるかに優れますが、飽和が進み訓練データ汚染にも弱いです。これらは閉じた形式で知識と推論を測り、Alpha Arenaは結果を伴う不確実性下の意思決定を測ります。
  • バックテスト基盤とクオンツ研究プラットフォーム — 売買戦略を評価する通常の手段で、標本ははるかに大きく資金リスクもありません。スリッページや実際の流動性、手数料の重さをここまで捉えることはできませんが、統計的に意味のある結果を出せます。2週間の実弾運用にはできないことです。
  • シミュレーション環境のエージェントベンチマーク — 再現可能で安価かつ反復可能ですが、シミュレータの前提そのものが試験対象になってしまう代償が伴います。
  • 人間の選好投票に基づくモデルアリーナ — 多様なタスクにわたる主観的品質を捉えるのが得意で、測っているのはある判断が外部の現実に照らして正しかったかではなく、人々が何を好むかです。
  • ベンダー自身が公表する能力レポート — 一次情報で方法論も詳細ですが、第三者ベンチマークなら避けられる明白な利益相反があります。

正直な比較はこうです。Alpha Arenaの強みはそのまま弱みです。実際の市場はこれを偽装不能で飽和しないものにしますが、同時に標本を小さく、コストを高く、ノイズを多くします。統計型ベンチマークを置き換えるのではなく補完します。

制限事項と注意点

中心的な結果はモデルの多くが損を出したことであり、この文脈が他のすべてを枠づけるべきです。 Protosは「LLMの暗号資産取引コンテスト、LLMは暗号資産を取引できないと判明」と題した独立報道でこう伝えています。「『Alpha Arena』暗号資産取引競技で対戦した6つの大規模言語モデルのうち4つが赤字で終わり、OpenAIのChatGPTが資金の63%を失って損失幅の首位となった。」

モデル別の損失額は相当なものでした。 Protosが示すシーズン1の数字は、ChatGPTが6,267ドルの損失、Geminiが5,671ドルの損失、Grokが4,531ドルの損失、Claude Sonnetが3,081ドルの損失です。前進したのは2つだけで、DeepSeekが489ドル、QWEN3 MAXが2,232ドルの利益でした。

この傾向はシーズンをまたいで持続しました。 FinSMEsは、シーズン1とSeason 1.5を合わせて8モデルがそれぞれ1万ドルを受け取った状況で「32組の結果のうち、モデルが利益で終えたのはわずか6回」と報じています。モデル×トラックの粒度で見れば失敗率は約81%です。

勝率は低く、そして一定でした。 シーズン1の6モデルすべてが25〜30%の勝率に収まりました。売買頻度は大きく分かれ、Geminiの238回に対しClaude Sonnetは38回で、これは判断力の優劣というよりかなり異なる行動戦略同士の比較だということを意味します。

手数料が優位を食い潰しました。 Nof1自身が「初期の実行では損益が取引コストに支配され、エージェントが過剰に売買し、素早く小さな利益を取っては手数料に消された」と認めています。QWEN3 MAXは1,654ドルと最も多く手数料を払い、Geminiは大きく負けながら1,331ドルを払いました。

勝者ですらリスク調整後の成績は弱いものでした。 実測の順位表ではシャープレシオがゼロ付近に集まっています。口座価値首位のモデルが0.019158、次の2つが0.009537と0.000667で、下位には-0.010358や-0.038861といった負の値も現れます。2週間、ゼロに近いシャープで得たプラスのリターンは、技量の証拠にはなりません。

同一モデル内部のばらつきがモデル単位の結論を掘り崩します。 GROK-4.20はあるトラックを13,459ドル(+34.59%)で終え、GROK-4は別のトラックで385.02ドル、ほぼ全損に近い形で終わりました。同じベンダーのモデルが両極端を占めるとき、順位が語るのは能力よりも方式と運です。

標本は統計的主張を支えるにはあまりに小さく、ラボもそれに同意しています。 ProtosはNof1が「より良いプロンプトと『統計的厳密さ』を備えた別の競技が来ると述べている」と伝えており、これは既存シーズンにそれが欠けていることの事実上の認めです。2週間、少数のモデル、数十組の結果では強い推論は支えられません。

ハーネスがモデルを制約する点は、ラボが公然と記録しています。 Nof1のまとめはこう述べます。「我々はモデルに公平な機会を与えようと努めたが、ハーネスは実際の制約を課す。各エージェントはノイズの多い市場特徴を解析し、それを現在の口座状態に関連づけ、厳格な規則の下で推論し、構造化された行動を返さねばならず、そのすべてが限られたコンテキストウィンドウの中で行われる。」Azhangはさらに、モデルには「絞り込まれた資産範囲とかなり限定された行動空間」が与えられ、LLMが不得手な数値時系列だけを与えられたと付け加えています。したがって不振な結果は、この特定の構成についての証拠です。

競技は現在稼働していません。 サイトは率直にこう記します。「公式競技は2025年12月3日 米国東部時間午後5時をもって終了しました。モデルはもう稼働していません。」ライブの対戦を期待して訪れた人は、記録だけを目にすることになるかもしれません。

Season 1.5の優勝者は帰属不能です。 優勝エントリーは「Mystery Model」として公開され、2週間の集計リターン12.11%、競技全体で4,844ドルでした。匿名の優勝者はどのベンダーの功績にもできず、この見出しの結果が確立できることには限りがあります。

サイトには法務やガバナンスの開示が一切ありません。 Aboutページには登記された法人名も、設立法域も、住所も、チーム名簿もありません。トップ、About、順位表の3ページのいずれにもプライバシーポリシー、利用規約、クッキーポリシーへのリンクがありません。会社の身元はサイト自身ではなく第三者の金融メディアによって裏づけられています。

投資免責文言も、規制上の地位の表示もありません。 サイトは結果が投資助言ではないと述べておらず、Nof1はいかなる金融ライセンスや規制上の認可も開示していません。これは規制された金融サービスではなく研究のデモンストレーションであり、公開された取引を推奨として受け取るべきではありません。

コピートレードはNof1の境界の外で起きます。 第三者プラットフォームが利用者にモデル戦略の複製を可能にしているため、そうする人の資金リスクとコンプライアンス上の露出は、Nof1が運営も監督もしていない場で発生します。

公開されたプロンプトと推論には明示的なライセンスがありません。 USER_PROMPTとCHAIN_OF_THOUGHTの記録の全体を公開で閲覧できますが、サイトはその素材の再利用について明示的な条件を示しておらず、転載やデータセットとしての利用に関する立場は未定義のままです。

よくある質問(FAQ)

Q1. Alpha Arenaは無料で使えますか。

完全に無料です。ライブの判断フィード、全成績指標を備えた順位表、集計チャート、研究ブログのいずれもアカウントなしで閲覧でき、サイトに料金ページやサブスクリプション、決済フローはありません。提出できるデータは順番待ちリスト用のメールアドレスか問い合わせフォームのメッセージだけです。

Q2. AIモデルは本当に実際のお金で取引しているのですか。

はい。参加した各モデルには1万ドルの実際の資金が割り当てられ、人間の介入なしに自律的に売買しました。シーズン1は分散型取引所Hyperliquidで暗号資産の無期限先物を、Season 1.5はTSLA、NVDA、MSFT、AMZN、GOOGL、PLTR、NDX指数を含む米国株と指数を扱いました。

Q3. どのモデルが参加していますか。

競合するラボのフロンティアモデルが同一条件で並走します。実測の順位表にはGROK-4.20、GROK-4、GPT-5.1、CLAUDE-SONNET-4-5、GEMINI-3-PRO、DEEPSEEK-CHAT-V3.1、QWEN3-MAX、KIMI-K2-THINKINGが含まれ、OpenAI、Anthropic、Google、xAI、DeepSeek、アリババ、Moonshotにまたがります。

Q4. AIモデルは実際に利益を出しましたか。

多くは出していません。これが中心的な発見です。シーズン1では6モデルのうち4つが赤字で終わり、ChatGPTは資金の63%を失いました。シーズン1とSeason 1.5を合わせて、モデルが利益で終えたのは32組の結果のうち6回だけで、利益を出した回でもシャープレシオはゼロ付近でした。

Q5. モデルの取引をコピーできますか。

Nof1はコピートレード機能を一切提供していません。Coinpilotのような第三者プラットフォームが公開データの上にモデル戦略を複製する機能を作りましたが、それはNof1の管理外であり、公開されたシーズンで大半のモデルが損失を出したことを踏まえると勧められません。

Q6. Alpha Arenaはまだ稼働していますか。

サイトは公式競技が2025年12月3日 米国東部時間午後5時に終了し、モデルはもう稼働していないと明記しています。以後に新シーズンが始まっていない限り、表示されているのは終了したシーズンの記録です。Nof1はより良いプロンプトと高い統計的厳密さを備えた後続の競技を計画していると述べています。

Q7. Nof1とはどんな組織ですか。

Nof1はJay Azhangが設立したAI研究ラボで、FinSMEsは「金融市場に焦点を当てたフロンティアモデルを訓練する、リモート運営のAI研究ラボ」と紹介しています。2026年5月に、ナスダック上場のSUI GroupとヘッジファンドのKaratage Opportunitiesが共同主導する1500万ドルを調達しました。ウェブサイト自体は登記法人名、住所、チーム名簿を公表していません。

Q8. なぜ同じモデルがトラックによって成績が大きく違うのですか。

Season 1.5はNew Baseline、Monk Mode、Situational Awareness、Max Leverageという4つの方式を走らせ、同じモデルに与える指示とリスク姿勢を変えました。Nof1の研究ブログは「小さなプロンプト変更への感受性」を報告しており、順位表がそれを裏づけています。同じベンダーのモデルが実測表の最上位と最下位を同時に占めているのです。

Q9. Alpha Arenaは投資助言を提供しますか。

提供しません。金融サービスではなく研究ベンチマークです。サイトは投資免責文言を掲げておらず、Nof1は金融ライセンスや規制上の認可も開示していないため、表示されるいかなるものも推奨として読むべきではありません。大半のモデルが損失を出したという公開記録そのものが、これを指針としないための最も強い論拠です。

Q10. たった2週間の取引で、結果を信頼できるのですか。

統計的に強い結論として扱うべきではなく、Nof1もそう主張していません。今後の競技に「統計的厳密さ」を加えると述べたこと自体、現行シーズンにそれが欠けていることを暗に認めたものです。価値は精度ではなく透明性と結論の方向にあります。失敗率が約81%に達し、すべての取引の背後にある推論が検証可能な形で公開されているなら、小さな標本でも情報を含みます。

類似のツールをご存知ですか?
他の素晴らしいAIツールをご存知でしたら、ぜひ私たちに提出してください