Design Arena 是一个网页端 AI 设计基准:你提交一个创意提示词,多个 AI 模型分别作答,你的盲投决定哪个结果胜出。其条款将它描述为一个通过 AI 生成的设计输出来评估和排名机器学习模型的基准测试平台,由 Arcada Labs Incorporated 提供。
同一个会话也可以当作创作工具。用户描述想做的东西,从网站、游戏到图像、视频、演示文稿或应用,然后并排查看头部模型如何呈现这个想法。
规模数字来自两个不同出处。首页称,190+ 个国家的数百万人使用 Design Arena 来发现和比较模型。2026 年 8 月的一篇独立新闻报道给出的数字是全球 530 万人。
这个名字容易与 Arena(前身为 LMArena 和 Chatbot Arena)混淆,后者是一个评估大语言模型的公开网页平台。Design Arena 自己的条款写明提供方是 Arcada Labs Incorporated,它关注的是视觉与交互输出,而不是聊天回复。
每次投票会从活跃模型池中抽取四个模型外加一个备用模型,每个模型收到完全相同的提示词。整个评估过程中模型身份保持隐藏,以防品牌偏见。输出也在同一时刻揭晓,让速度更快的模型不占优势;方法说明称这条规则以后可能调整。
一次会话的结构是一个小型对阵表,而不是单次 A 对 B 的二选一。先评两组对决,然后胜者和负者再交锋,五场对决各产生一票,同时计入胜率和评分模型。结果是由一个提示词得出从第 1 到第 4 的完整排序。
在主要的 Model Arena 中,模型只有在接受文本输入并返回单文件 HTML/JS/CSS 代码文件时才能参加。各提供方的系统提示词保持一致以尽量减少偏差,因此每个模型都基于相同的指令工作。
排名采用 Bradley-Terry 模型计算,这是一种为两两比较数据设计的统计方法,结果以 Elo 式评分呈现。每个模型的估计强度按 Rating = 400 × log₁₀(strength) 换算。误差范围采用近似 95% 的 Wilson 得分置信区间。每一张两两投票权重相同,不做过滤或编辑调整。排行榜每两小时用实时结果更新一次,票数少于 50 的模型带有“new”(新)标签,提示其位置可能还会变动。
模型名单变动频繁,这也是 Design Arena 作为 AI 模型排行榜有用的部分原因。2026 年 9 月 22 日,更新日志记录新增了 claude-opus-5-5、gpt-6-sol 和 gpt-6-luna。移除会附上简短理由,例如某个模型在各类别中一直排名垫底。
它不面向 18 岁以下的任何人:条款只允许年满 18 岁、能够订立有约束力合同的人使用。
在所查看的页面中没有找到独立的定价页,/pricing 返回未找到(not found)。条款规定,除非另有说明,使用服务不收取费用,例如某些有限的附加功能另有规定。以下付费规则来自账户与计费界面的文字。
| 访问方式 | 涵盖内容 | 公布的费用 |
|---|---|---|
| 免费档 | 使用限额内的日常提示与投票 | 按条款不收费 |
| 预付积分 | 超出免费档的用量,外加 Pro 权益 | 充值 $5 至 $100 |
| Premium 模式 | 按 Elo 排名靠前的模型完成一次生成 | 按每次生成的实际成本 |
| 排行榜 API | 程序化获取的排名数据 | 免费,需注明出处 |
积分是一种预付余额,只有在超出免费档限额时才会扣除。每次充值金额从 $5 到 $100。免费用量在一个共享的每日限额之外还有按类别的上限,这些限额会随提示词复杂度变化,因此免费生成次数不是固定数字。Pro 权益之一是视频时长:最长 15 秒,而免费档为 5 秒。
Premium 模式会为该次生成按 Elo 挑选最好的模型,并按每次生成的实际成本收费。各类型价格在账户区域内加载,在所查看的页面上没有显示。
类别是否可用可能取决于积分。某个类别暂停时,会有消息说明它即将回归、现在添加积分即可使用,而幻灯片和网站仍可无限制使用。
排行榜 API 是另一条独立路线:其数据可免费用于个人和商业项目。
最接近的对照是一个以文本为主的竞技场。一篇独立新闻报道称 LM Arena 在文本回复上采用了类似做法。该服务现名 Arena,位于 arena.ai,也列出 WebDev 模型、文本模型、图像生成和视频生成的排行榜,因此两者在网页和图像任务上有重叠,但来历和侧重点不同。
Artificial Analysis 走的是另一条路:它发布针对 AI 模型和 API 提供方的独立基准,涵盖质量、价格、输出速度和延迟。它还运营 Image Arena 和 Video Arena 排行榜,因此当成本和速度与审美同样重要时,它更合适。
| 选项 | 主要信号 | 最适合 |
|---|---|---|
| Design Arena | 对视觉与交互输出的众包盲投 | 网站、UI、幻灯片、Logo、游戏 |
| Arena.ai | 众包投票,以文本为主,另有 WebDev 与媒体榜单 | 聊天与通用模型选择 |
| Artificial Analysis | 实测的质量、价格、速度、延迟 | 成本与性能取舍 |
Design Arena 自己的几处页面对排名规则的描述并不相同:
因此,排名反映的是这些规则下的众包偏好,而不是固定的测试套件,新加入的模型排名可能明显变动。
用户提示词通过调用 gemini-2.5-flash-lite-preview-09-2025 的 API 进行审核,方法说明称选择这个模型是出于成本考虑。公开的审核指令还要求它检查提示词中是否涉及任何政治内容、政治人物,或政治、宗教符号,因此时事类或竞选风格的设计需求可能被标记。
按条款,基础的提示和投票不收费,但限于免费用量,这些限额因类别和提示词复杂度而异。$5 至 $100 的预付积分用于超出这些限额的用量,Premium 模式按每次生成的实际成本收费。
来自盲测两两对决的投票输入 Bradley-Terry 模型,生成 Elo 式评分。排行榜每两小时刷新一次,票数少于 50 的模型标为新模型。
可以。申请获批后,Design Arena API 可免费用于个人和商业项目,但公开使用时必须注明 Design Arena 并链接到 designarena.ai。
提示词、输出和上传的媒体可能与第三方 AI 技术提供方共享,包括用于训练。Design Arena 会先采取措施移除用户名和邮箱地址,但写在内容本身里的个人信息仍可能被共享。
不是。Arena(前身为 LMArena 和 Chatbot Arena)是一个专注于评估大语言模型的独立平台,而来自 Arcada Labs Incorporated 的 Design Arena 则按视觉与交互设计输出为模型排名。