Design Arena 是一個網頁版 AI 設計基準:你提交一個創意提示詞,多個 AI 模型分別作答,你的盲投決定哪個結果勝出。其條款將它描述為一個透過 AI 生成的設計輸出來評估並排名機器學習模型的基準測試平台,由 Arcada Labs Incorporated 提供。
同一個工作階段也能當作創作工具。使用者描述想做的東西,從網站、遊戲到圖像、影片、簡報或應用程式,然後並排檢視頂尖模型如何呈現這個構想。
規模數字來自兩個不同出處。首頁稱,190+ 個國家的數百萬人使用 Design Arena 來發掘並比較模型。2026 年 8 月的一篇獨立新聞報導給出的數字是全球 530 萬人。
這個名稱容易與 Arena(前身為 LMArena 與 Chatbot Arena)混淆,後者是一個評估大型語言模型的公開網頁平台。Design Arena 自己的條款寫明提供者是 Arcada Labs Incorporated,它關注的是視覺與互動輸出,而不是聊天回覆。
每次投票會從活躍模型池中抽出四個模型外加一個備用模型,每個模型收到完全相同的提示詞。整個評估過程中模型身分保持隱藏,以避免品牌偏見。輸出也在同一時刻揭曉,讓速度較快的模型不占優勢;方法說明稱這條規則日後可能調整。
一次工作階段的結構是一個小型對戰表,而不是單次 A 對 B 的二選一。先評兩組對決,然後勝者與敗者再交鋒,五場對決各產生一票,同時計入勝率與評分模型。結果是由一個提示詞得出從第 1 到第 4 的完整排序。
在主要的 Model Arena 中,模型只有在接受文字輸入並回傳單一檔案的 HTML/JS/CSS 程式碼檔時才能參加。各提供者的系統提示詞保持一致以盡量減少偏差,因此每個模型都依據相同的指令運作。
排名採用 Bradley-Terry 模型計算,這是一種為兩兩比較資料設計的統計方法,結果以 Elo 式評分呈現。每個模型的估計強度按 Rating = 400 × log₁₀(strength) 換算。誤差範圍採用近似 95% 的 Wilson 分數信賴區間。每一張兩兩投票權重相同,不做過濾或編輯調整。排行榜每兩小時以即時結果更新一次,票數少於 50 的模型帶有「new」(新)標籤,提示其位置可能還會變動。
模型名單變動頻繁,這也是 Design Arena 作為 AI 模型排行榜有用的部分原因。2026 年 9 月 22 日,更新紀錄記載新增了 claude-opus-5-5、gpt-6-sol 與 gpt-6-luna。移除會附上簡短理由,例如某個模型在各類別中一直排名墊底。
它不適合 18 歲以下的任何人:條款只允許年滿 18 歲、能夠訂立具約束力契約的人使用。
在所查看的頁面中沒有找到獨立的價格頁,/pricing 回傳找不到(not found)。條款規定,除非另有說明,使用服務不收取費用,例如某些有限的附加功能另有規定。以下付費規則來自帳戶與帳務介面的文字。
| 存取方式 | 涵蓋內容 | 公布的費用 |
|---|---|---|
| 免費方案 | 使用額度內的日常提示與投票 | 依條款不收費 |
| 預付點數 | 超出免費方案的用量,外加 Pro 權益 | 儲值 $5 至 $100 |
| Premium 模式 | 依 Elo 排名靠前的模型完成一次生成 | 依每次生成的實際成本 |
| 排行榜 API | 以程式取得的排名資料 | 免費,需標明出處 |
點數是一種預付餘額,只有在超出免費方案額度時才會扣除。每次儲值金額從 $5 到 $100。免費用量在一個共用的每日額度之外還有依類別的上限,這些額度會隨提示詞複雜度變化,因此免費生成次數不是固定數字。Pro 權益之一是影片長度:最長 15 秒,而免費方案為 5 秒。
Premium 模式會為該次生成依 Elo 挑選最好的模型,並依每次生成的實際成本收費。各類型價格在帳戶區域內載入,在所查看的頁面上沒有顯示。
類別是否可用可能取決於點數。某個類別暫停時,會有訊息說明它即將回歸、現在加值點數即可使用,而簡報與網站仍可無限制使用。
排行榜 API 是另一條獨立路線:其資料可免費用於個人與商業專案。
最接近的對照是一個以文字為主的競技場。一篇獨立新聞報導稱 LM Arena 在文字回覆上採取了類似做法。該服務現名 Arena,位於 arena.ai,也列出 WebDev 模型、文字模型、圖像生成與影片生成的排行榜,因此兩者在網頁與圖像任務上有重疊,但來歷與側重點不同。
Artificial Analysis 走的是另一條路:它發布針對 AI 模型與 API 提供者的獨立基準,涵蓋品質、價格、輸出速度與延遲。它也經營 Image Arena 與 Video Arena 排行榜,因此當成本與速度和美感同樣重要時,它更合適。
| 選項 | 主要訊號 | 最適合 |
|---|---|---|
| Design Arena | 對視覺與互動輸出的群眾盲投 | 網站、UI、簡報、Logo、遊戲 |
| Arena.ai | 群眾投票,以文字為主,另有 WebDev 與媒體榜單 | 聊天與通用模型選擇 |
| Artificial Analysis | 實測的品質、價格、速度、延遲 | 成本與效能取捨 |
Design Arena 自己的幾處頁面對排名規則的描述並不相同:
因此,排名反映的是這些規則下的群眾偏好,而不是固定的測試套件,新加入的模型排名可能明顯變動。
使用者提示詞透過呼叫 gemini-2.5-flash-lite-preview-09-2025 的 API 進行審查,方法說明稱選擇這個模型是出於成本考量。公開的審查指令還要求它檢查提示詞中是否涉及任何政治內容、政治人物,或政治、宗教符號,因此時事類或競選風格的設計需求可能被標記。
依條款,基本的提示與投票不收費,但限於免費用量,這些額度因類別與提示詞複雜度而異。$5 至 $100 的預付點數用於超出這些額度的用量,Premium 模式依每次生成的實際成本收費。
來自盲測兩兩對決的投票輸入 Bradley-Terry 模型,產生 Elo 式評分。排行榜每兩小時更新一次,票數少於 50 的模型標為新模型。
可以。申請核准後,Design Arena API 可免費用於個人與商業專案,但公開使用時必須標明 Design Arena 並連結到 designarena.ai。
提示詞、輸出與上傳的媒體可能與第三方 AI 技術提供者分享,包括用於訓練。Design Arena 會先採取措施移除使用者名稱與電子郵件地址,但寫在內容本身裡的個人資訊仍可能被分享。
不是。Arena(前身為 LMArena 與 Chatbot Arena)是一個專注於評估大型語言模型的獨立平台,而來自 Arcada Labs Incorporated 的 Design Arena 則依視覺與互動設計輸出為模型排名。