Design ArenaはWebベースのAIデザインベンチマークです。クリエイティブなプロンプトを1つ送ると複数のAIモデルが回答し、あなたのブラインド投票でどの出力が勝つかが決まります。利用規約では、AIが生成したデザイン出力を通じて機械学習モデルを評価・ランク付けするベンチマークプラットフォームと説明され、提供元はArcada Labs Incorporatedです。
同じセッションは制作ツールとしても使えます。ユーザーはWebサイトやゲームから画像、動画、プレゼンテーション、アプリまで作りたいものを説明し、上位モデルがそのアイデアをどう形にするかを並べて確認できます。
規模の数字は2つの異なる出典から来ています。ホームページは、190+か国の数百万人がモデルを見つけて比較するためにDesign Arenaを使っているとしています。2026年8月の独立したニュース報道は、世界で530万人という数字を挙げました。
この名前は、大規模言語モデルを評価する公開WebプラットフォームであるArena(旧LMArena、Chatbot Arena)と混同しやすいものです。Design Arenaの利用規約は提供元をArcada Labs Incorporatedと明記しており、焦点はチャットの返答ではなく視覚的・インタラクティブな出力にあります。
各投票セッションでは、アクティブなモデルプールから4モデルと予備の1モデルが選ばれ、すべてのモデルがまったく同じプロンプトを受け取ります。ブランドによる偏りを防ぐため、評価の間ずっとモデル名は伏せられます。出力も同じタイミングで公開されるので速いモデルが有利になりませんが、方法論のメモではこのルールは今後変わる可能性があるとしています。
セッションは1回きりのA対Bの選択ではなく、小さなトーナメント表として組まれます。まず2組を判定し、続いて勝者と敗者が対戦し、5回の対戦はそれぞれ1票を生み、勝率とレーティングモデルの両方に反映されます。こうして1つのプロンプトから1位〜4位の完全な順位が出ます。
メインのModel Arenaに参加できるのは、テキスト入力を受け付け、単一ファイルのHTML/JS/CSSコードファイルを返すモデルだけです。偏りを最小限にするためシステムプロンプトはプロバイダー間で一定に保たれ、どのモデルも同じ指示で作業します。
順位は、一対比較データ向けに作られた統計手法であるBradley-Terryモデルで算出され、Elo形式のレーティングで表示されます。各モデルの推定強度はRating = 400 × log₁₀(strength)で換算されます。誤差範囲には近似95%のWilsonスコア信頼区間を使います。一対比較の投票はすべて同じ重みで扱われ、フィルタリングや編集上の調整はありません。リーダーボードは2時間ごとにライブの結果で更新され、得票が50未満のモデルには、順位がまだ動く可能性を示す「new」(新規)タグが付きます。
モデルの顔ぶれは頻繁に変わり、それがDesign ArenaがAIモデルリーダーボードとして役立つ理由の一つです。2026年9月22日には、変更履歴にclaude-opus-5-5、gpt-6-sol、gpt-6-lunaの追加が記録されました。削除には、複数のカテゴリで一貫して最下位だったといった短い理由が添えられます。
18歳未満の人向けではありません。利用規約は、拘束力のある契約を結べる18歳以上の人にのみ利用を認めています。
確認したページに独立した料金ページは見つからず、/pricingはnot found(見つからない)を返しました。利用規約には、別段の定めがない限りサービスの利用に料金はかからない、たとえば一部の限定的な追加機能はこの限りでない、と記されています。以下の有料ルールは、アカウントと請求画面の文言に基づきます。
| 利用方法 | 対象 | 公表されている費用 |
|---|---|---|
| 無料枠 | 利用上限内での日常的なプロンプト作成と投票 | 利用規約上は無料 |
| 前払いクレジット | 無料枠を超える利用とProの特典 | $5〜$100のチャージ |
| Premiumモード | 1回の生成にEloで上位のモデルを使用 | 生成1回ごとの実費 |
| リーダーボードAPI | プログラムで取得する順位データ | 無料、出典表示が必要 |
クレジットは前払い残高として機能し、無料枠の上限を超えたときにのみ差し引かれます。チャージ額は1回あたり$5から$100です。無料利用には共通の1日あたりの上限に加えてカテゴリごとの上限があり、これらはプロンプトの複雑さによって変わるため、無料で生成できる回数は決まった数字ではありません。Proの特典の一つは動画の長さで、無料枠の5秒に対して最大15秒です。
Premiumモードはその生成についてEloで最良のモデルを選び、生成1回ごとの実費を請求します。タイプ別の価格はアカウント画面内で読み込まれ、確認したページには表示されていませんでした。
カテゴリを使えるかどうかはクレジット次第の場合があります。カテゴリが一時停止されていると、近日再開予定で今はクレジットを追加すれば使えるというメッセージが表示され、スライドショーとWebサイトは制限なしで使い続けられます。
リーダーボードAPIは別の枠組みで、そのデータは個人・商用のプロジェクトに無料で使えます。
最も近い比較対象はテキスト中心のアリーナです。独立したニュース報道は、LM Arenaがテキストの応答について似たアプローチを取っていると説明しました。現在はArenaという名称でarena.aiで運営されているこのサービスも、WebDevモデル、テキストモデル、画像生成、動画生成のリーダーボードを掲載しているため、両者はWebと画像のタスクで重なりますが、成り立ちと重点が異なります。
Artificial Analysisは別の道を取っています。品質、価格、出力速度、レイテンシーにわたり、AIモデルとAPIプロバイダーの独立したベンチマークを公開しています。Image ArenaとVideo Arenaのリーダーボードも運営しているので、好みと同じくらいコストと速度が重要な場合に向いています。
| 選択肢 | 主なシグナル | 最適な用途 |
|---|---|---|
| Design Arena | 視覚的・インタラクティブな出力へのクラウドによるブラインド投票 | Webサイト、UI、スライド、ロゴ、ゲーム |
| Arena.ai | クラウド投票、テキスト中心でWebDevとメディアのボードもあり | チャットと汎用的なモデル選び |
| Artificial Analysis | 計測した品質、価格、速度、レイテンシー | コストと性能のトレードオフ |
Design Arena自身のページは、順位のルールを同じようには説明していません。
そのため順位は固定のテストスイートではなく、こうしたルールのもとでのクラウドの選好を反映しており、新しく加わったモデルは目に見えて動くことがあります。
ユーザーのプロンプトはgemini-2.5-flash-lite-preview-09-2025へのAPI呼び出しでモデレーションされ、メモによるとこのモデルはコストを理由に選ばれました。公開されているモデレーション指示は、政治的な内容、政治家、政治的・宗教的なシンボルがないかもプロンプトで確認するよう求めているため、時事的な依頼や選挙キャンペーン風のデザイン依頼はフラグが立つことがあります。
基本的なプロンプト作成と投票は利用規約上無料で、カテゴリとプロンプトの複雑さによって変わる無料利用の上限内で使えます。$5〜$100の前払いクレジットがその上限を超える利用をまかない、Premiumモードは生成1回ごとの実費を請求します。
ブラインドの1対1対戦で集まった票がBradley-Terryモデルに入り、Elo形式のレーティングになります。リーダーボードは2時間ごとに更新され、得票が50未満のモデルには新規の表示が付きます。
はい。申請が承認されれば、Design Arena APIは個人・商用のプロジェクトに無料で使えますが、公開で使う場合はDesign Arenaをクレジット表記し、designarena.aiにリンクする必要があります。
プロンプト、出力、アップロードしたメディアは、学習用途を含め、第三者のAI技術プロバイダーと共有される場合があります。Design Arenaは先にユーザー名とメールアドレスを削除する措置を取りますが、コンテンツ内に書かれた個人情報はそれでも共有される可能性があります。
いいえ。Arena(旧LMArena、Chatbot Arena)は大規模言語モデルの評価に特化した別のプラットフォームで、Arcada Labs IncorporatedのDesign Arenaは視覚的・インタラクティブなデザイン出力でモデルを順位付けします。