¿Has usado esta herramienta? Valórala
¿Has usado esta herramienta? Valórala
Design Arena es un benchmark de diseño con IA en la web: envías un prompt creativo, varios modelos de IA lo responden y tus votos a ciegas deciden qué resultado gana. Sus términos lo describen como una plataforma de benchmarking para evaluar y clasificar modelos de machine learning mediante diseños generados por IA, ofrecida por Arcada Labs Incorporated.
La misma sesión funciona también como herramienta de creación. Los usuarios describen lo que quieren hacer, desde un sitio web o un juego hasta una imagen, un video, una presentación o una app, y ven lado a lado cómo los mejores modelos plasman esa idea.
Las cifras de alcance provienen de dos fuentes distintas. La página de inicio afirma que millones de personas en más de 190 países usan Design Arena para descubrir y comparar modelos. Un reportaje periodístico independiente de agosto de 2026 habló de 5,3 millones de personas en todo el mundo.
El nombre se confunde fácilmente con Arena (antes LMArena y Chatbot Arena), una plataforma web pública que evalúa grandes modelos de lenguaje. Los propios términos de Design Arena nombran a Arcada Labs Incorporated como proveedor, y su foco está en los resultados visuales e interactivos, no en las respuestas de chat.
Cada sesión de votación toma cuatro modelos del grupo activo más uno de reserva, y todos reciben exactamente el mismo prompt. La identidad de los modelos permanece oculta durante toda la evaluación para evitar el sesgo de marca. Los resultados también se revelan a la vez para que los modelos más rápidos no ganen ventaja, una regla que, según las notas de metodología, podría cambiar más adelante.
La sesión se organiza como un pequeño cuadro de torneo y no como una única elección entre A y B. Primero se juzgan dos parejas, luego se enfrentan ganadores y perdedores, y cada uno de los cinco duelos genera un voto que alimenta tanto las tasas de victoria como el modelo de puntuación. El resultado es un orden completo del 1.º al 4.º a partir de un solo prompt.
En la Model Arena principal, un modelo solo puede participar si acepta una entrada de texto y devuelve un único archivo de código HTML/JS/CSS. Los prompts de sistema se mantienen iguales entre proveedores para minimizar el sesgo, de modo que todos los modelos trabajan con las mismas instrucciones.
Las clasificaciones se calculan con el modelo de Bradley-Terry, un método estadístico pensado para datos de comparación por pares, y se muestran como puntuaciones de tipo Elo. La fuerza estimada de cada modelo se convierte con Rating = 400 × log₁₀(strength). El margen de error usa un intervalo de confianza de Wilson de aproximadamente el 95 %. Cada voto por pares pesa lo mismo, sin filtrado ni ajuste editorial. La clasificación se actualiza con resultados en vivo cada dos horas, y los modelos con menos de 50 votos llevan la etiqueta «new» (nuevo) para indicar que su posición aún puede moverse.
La lista de modelos cambia a menudo, y eso forma parte de lo que hace útil a Design Arena como ranking de modelos de IA. El 22 de septiembre de 2026, el registro de cambios anotó la incorporación de claude-opus-5-5, gpt-6-sol y gpt-6-luna. Las bajas se acompañan de motivos breves, como un modelo que quedaba sistemáticamente último en todas las categorías.
No está pensado para menores de 18 años: los términos solo permiten su uso a personas de 18 años o más que puedan celebrar un contrato vinculante.
Entre las páginas revisadas no se encontró una página de precios propia, y /pricing devolvió «not found» (no encontrado). Los términos indican que no hay tarifas por usar los Servicios salvo que se establezca otra cosa, por ejemplo para ciertas funciones adicionales limitadas. Las reglas de pago siguientes proceden de los textos de la interfaz de cuenta y facturación.
| Vía de acceso | Qué cubre | Coste publicado |
|---|---|---|
| Nivel gratuito | Prompts y votos cotidianos dentro de los límites de uso | Sin tarifa según los términos |
| Créditos prepagados | Uso más allá del nivel gratuito, más ventajas Pro | Recargas de $5 a $100 |
| Modo Premium | Modelos mejor clasificados por Elo para una generación | Coste real por generación |
| API de clasificación | Datos de ranking programáticos | Gratis, con atribución |
Los créditos funcionan como un saldo prepagado y solo se descuentan cuando superas los límites del nivel gratuito. Las recargas van de $5 a $100 por compra. El uso gratuito tiene topes por categoría además de un límite diario compartido, y esos límites varían según la complejidad del prompt, así que el número de generaciones gratuitas no es una cifra fija. Una ventaja Pro es la duración del video: hasta 15 segundos frente a 5 segundos en el nivel gratuito.
El modo Premium elige los mejores modelos por Elo para esa generación y cobra el coste real por generación. Los precios por tipo se cargan dentro del área de cuenta y no se mostraban en las páginas revisadas.
La disponibilidad de una categoría puede depender de los créditos. Cuando una categoría está en pausa, un mensaje indica que volverá pronto y que puede usarse ya añadiendo créditos, mientras que las presentaciones y los sitios web siguen disponibles sin límites.
La API de clasificación es una vía aparte: sus datos son de uso gratuito para proyectos personales y comerciales.
La comparación más cercana es una arena centrada en texto. Un reportaje periodístico independiente describió LM Arena como un enfoque similar aplicado a respuestas de texto. Ese servicio, que ahora se llama Arena y está en arena.ai, también publica clasificaciones de modelos WebDev, modelos de texto, generación de imágenes y generación de video, así que ambos coinciden en tareas web y de imagen, aunque difieren en origen y énfasis.
Artificial Analysis toma otro camino: publica benchmarks independientes de modelos de IA y proveedores de API sobre calidad, precio, velocidad de salida y latencia. También mantiene las clasificaciones Image Arena y Video Arena, por lo que encaja mejor cuando el coste y la velocidad importan tanto como el gusto.
| Opción | Señal principal | Ideal para |
|---|---|---|
| Design Arena | Votos a ciegas del público sobre resultados visuales e interactivos | Sitios web, UI, diapositivas, logos, juegos |
| Arena.ai | Votos del público, prioridad al texto, con tablas WebDev y multimedia | Chat y elección de modelo general |
| Artificial Analysis | Calidad, precio, velocidad y latencia medidos | Equilibrio entre coste y rendimiento |
Las propias páginas de Design Arena no describen las reglas de clasificación de la misma forma:
Por tanto, las clasificaciones reflejan la preferencia colectiva bajo estas reglas, no una batería de pruebas fija, y un recién llegado puede moverse notablemente.
Los prompts de los usuarios se moderan mediante una llamada a la API de gemini-2.5-flash-lite-preview-09-2025, un modelo que, según las notas, se eligió por su coste. Las instrucciones de moderación publicadas también le piden revisar si los prompts contienen algo político, figuras políticas o símbolos políticos o religiosos, así que los encargos de diseño de actualidad o de estilo de campaña electoral pueden quedar marcados.
Los prompts y votos básicos no tienen tarifa según los términos, dentro de unos límites de uso gratuito que varían según la categoría y la complejidad del prompt. Los créditos prepagados de $5 a $100 cubren el uso por encima de esos límites, y el modo Premium cobra el coste real por generación.
Los votos de enfrentamientos directos a ciegas alimentan un modelo de Bradley-Terry, que produce puntuaciones de tipo Elo. La clasificación se actualiza cada dos horas, y los modelos con menos de 50 votos aparecen marcados como nuevos.
Sí. La API de Design Arena es gratuita para proyectos personales y comerciales una vez aprobada la solicitud, pero el uso público debe citar a Design Arena y enlazar a designarena.ai.
Los prompts, resultados y archivos multimedia subidos pueden compartirse con proveedores externos de tecnología de IA, incluido para entrenamiento. Design Arena toma medidas previas para eliminar nombres de usuario y direcciones de correo, pero los datos personales escritos dentro del propio contenido pueden compartirse igualmente.
No. Arena (antes LMArena y Chatbot Arena) es una plataforma distinta centrada en evaluar grandes modelos de lenguaje, mientras que Design Arena, de Arcada Labs Incorporated, clasifica modelos según resultados de diseño visuales e interactivos.