Toolso.AI
Toolso.AI
HerramientasCategoríasTendenciasNovedadesPreciosBlog
Toolso.AI
Toolso.AI

💌Suscríbete a AI Tools Weekly

Selección semanal curada de las últimas y más populares herramientas de IA y tendencias, entregadas en tu bandeja de entrada Suscribirse

Toolso.AI
Toolso.AI

Descubre las mejores herramientas de IA para aumentar tu productividad

GitHubGitHubTwitterX (Twitter)YouTubeYouTubeTikTokEmail

Categorías populares

  • Escritura con IA
  • Imágenes con IA
  • Video con IA
  • Programación con IA
  • Más categorías

Explorar

  • Herramientas más recientes
  • Herramientas populares
  • Más herramientas
  • Enviar herramienta
  • Precios

Acerca de

  • Acerca de nosotros
  • Contacto
  • Blog
  • Registro de cambios

Legal

  • Política de cookies
  • Política de privacidad
  • Términos de servicio
  • Política de reembolso
© 2026 Toolso.AI Todos los derechos reservados
Oferta limitadaOferta por tiempo limitadoListado destacadoRevisión en 24 h · Sin backlink · 30 días destacado$29.90luego $59.90Sube a $59.90 después del 31 octTermina en--:--:--Enviar ahora
  1. Inicio
  2. Todas las herramientas
  3. Analítica
  4. Alpha Arena
Vista previa de la interfaz de Alpha Arena
Logotipo de Alpha Arena

Alpha Arena

Alpha Arena es un banco de pruebas público del laboratorio de investigación Nof1 en el que modelos punteros de OpenAI, Anthropic, Google, xAI, DeepSeek y Alibaba gestionan de forma autónoma 10.000 dólares reales cada uno, con las indicaciones, los razonamientos y las decisiones publicados en abierto.

AnalíticaInvestigaciónHerramientas de prueba#Autónomo#LLM#Agente de IA
Probar gratis
Guardados
Visitas
Vistas
Precio
Freemium
Publicado
22 ago 2026
Dominio
nof1.ai
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Información del producto Alpha Arena

Probar gratis
Información de la herramienta
Guardados
Visitas
Vistas
Precio
Freemium
Publicado
22 ago 2026
Dominio
nof1.ai
Valoración de usuarios

¿Has usado esta herramienta? Valórala

Valorar esta herramienta

Herramientas destacadas

Herramientas relacionadas

Probar gratis

¿Qué es Alpha Arena?

Alpha Arena es un banco de pruebas público y en directo en el que modelos de lenguaje punteros reciben dinero real y operan por su cuenta en mercados reales, sin intervención humana alguna, y en el que cada indicación, cada razonamiento y cada decisión de negociación se publican para que cualquiera pueda leerlos. El sitio se resume en seis palabras: «AI trading in real markets» (IA operando en mercados reales).

Lo gestiona Nof1, que no es una empresa de software sino un laboratorio de investigación en IA. La distinción importa para quien llegue esperando un producto al que suscribirse. Lo que Nof1 plantea en su página «Acerca de» es explícitamente una tesis de investigación: «Hace una década, DeepMind revolucionó la investigación en IA. Su intuición clave fue que elegir el entorno adecuado —los juegos— conduciría a un progreso rápido en la IA de frontera. En Nof1 creemos que los mercados financieros son el mejor entorno de entrenamiento para la próxima era de la IA. Son el motor definitivo de modelado del mundo y el único banco de pruebas que se vuelve más difícil a medida que la IA se vuelve más inteligente».

La ambición que declara esa página va mucho más allá de mantener una tabla de clasificación. Nof1 afirma estar «usando los mercados para entrenar nuevos modelos base que crean indefinidamente sus propios datos de entrenamiento», empleando «aprendizaje abierto y aprendizaje por refuerzo a gran escala para afrontar la complejidad de los mercados, el jefe final», y busca a quienes les entusiasme «construir AlphaZero para el mundo real». Dicho de otro modo, Alpha Arena es el experimento público adosado a un programa de investigación bastante mayor.

El periodismo independiente corrobora esa identidad y no solo su envoltorio. La publicación especializada FinSMEs describió a la compañía en mayo de 2026 como «un laboratorio remoto de investigación en IA que entrena modelos punteros centrados en los mercados financieros», e informó de una ronda de 15 millones de dólares codirigida por SUI Group —cotizada en el Nasdaq— y el fondo de cobertura Karatage Opportunities. El fundador es Jay Azhang, que anunció públicamente el lanzamiento del proyecto el 17 de octubre de 2025 y a quien tanto Protos como el medio ucraniano de criptomonedas Incrypted identifican como fundador de Nof1 en coberturas independientes.

Lo que hace inusual a este banco de pruebas no es la idea de examinar la IA en los mercados —eso lleva años haciéndose en simulación— sino la negativa a simular. Capital real, ejecución real, deslizamiento real y comisiones reales. Como escribió Azhang en el lanzamiento: «6 modelos de IA operando 10 000 dólares cada uno, con plena autonomía: dinero real, mercados reales, banco de pruebas real».

Y el resultado honesto, a lo largo de dos temporadas, es que los modelos perdieron en su mayoría. Eso es lo más interesante de este proyecto, y Nof1 lo publica en lugar de ocultarlo.

Funciones principales

Un banco de pruebas en directo funcionando con capital real. Cada modelo participante recibe 10 000 dólares de dinero efectivo y opera de forma autónoma. La cobertura del lanzamiento de Incrypted cita al laboratorio describiendo modelos que «funcionan de manera completamente autónoma, realizando operaciones reales en los mercados de criptomonedas en vivo: bitcoin, Ethereum, Solana, Binance Coin, Dogecoin y XRP. Sin intervención humana. Sin más restricciones que las que los propios modelos decidan aplicar en la gestión del riesgo».

Condiciones idénticas entre proveedores. El núcleo metodológico es que cada modelo recibe las mismas entradas y el mismo armazón de ejecución. El blog de investigación de Nof1 expone el diseño sin rodeos: «Dimos 10 000 dólares a seis LLM líderes para operar de forma autónoma en mercados reales usando únicamente datos numéricos de mercado como entrada y el mismo prompt y armazón». Sin esa restricción, la comparación carecería de sentido; con ella, las diferencias de resultado son atribuibles a los modelos y no a su andamiaje.

Cuatro pistas de competición paralelas. La Season 1.5 reparte los mismos modelos en cuatro regímenes —denominados 1: New Baseline, 2: Monk Mode, 3: Situational Awareness y 4: Max Leverage— con una vista Aggregate Index que los recorre. Así, las diferencias de indicación y de postura ante el riesgo se convierten en variables controladas en lugar de factores de confusión, y por eso un mismo modelo puede aparecer varias veces en una clasificación con resultados radicalmente distintos.

Transparencia total del razonamiento. Es la función que carece de equivalente real en otros sitios. Cada decisión del flujo en directo lleva el nombre del modelo, su pista, una marca de tiempo y un resumen en lenguaje llano, y se despliega en tres campos en bruto: USER_PROMPT, CHAIN_OF_THOUGHT y TRADING_DECISIONS. Se lee exactamente qué se le indicó al modelo, cómo razonó y qué hizo. Para quien estudie el comportamiento de los modelos bajo presión, ese archivo es el producto.

Una clasificación con métricas de riesgo reales, no solo rentabilidades. La clasificación muestra valor de la cuenta, rentabilidad porcentual, P&L total, comisiones, tasa de acierto, mayor ganancia, mayor pérdida, ratio de Sharpe y número de operaciones, con filtro por pista o vista agregada. Colocar comisiones y Sharpe junto a la rentabilidad bruta es lo que lo distingue de un simple marcador de resultados y, a la vista de los datos, ahí es precisamente donde está la historia.

Modelos punteros de laboratorios rivales, uno junto a otro. La clasificación observada incluye GROK-4.20, GROK-4, GPT-5.1, CLAUDE-SONNET-4-5, GEMINI-3-PRO, DEEPSEEK-CHAT-V3.1, QWEN3-MAX y KIMI-K2-THINKING. Pocos escenarios públicos sitúan modelos de OpenAI, Anthropic, Google, xAI, DeepSeek, Alibaba y Moonshot en condiciones idénticas al mismo tiempo.

Clases de activos que cambiaron entre temporadas. La temporada 1 operó perpetuos de criptomonedas. La Season 1.5 pasó a acciones e índices estadounidenses: el flujo en directo y la cinta de cotizaciones cubren TSLA, NDX, NVDA, MSFT, AMZN, GOOGL y PLTR. Ese giro es en sí mismo revelador: una estrategia que funcionaba en un régimen no se traslada automáticamente.

Casos de uso

Calibrar las expectativas sobre lo que los LLM realmente hacen. Es el valor principal, y rebaja las expectativas de forma útil. Si le han contado que basta apuntar modelos punteros a los mercados para obtener rentabilidad, el registro publicado es la corrección más barata disponible: entre la temporada 1 y la Season 1.5, los modelos terminaron en beneficio solo seis veces de 32 conjuntos de resultados.

Estudiar el comportamiento y la «personalidad» de los modelos en igualdad de condiciones. El hallazgo temprano de Nof1 fue que los modelos exhiben «diferencias de comportamiento reales (riesgo, dimensionamiento, tiempo de permanencia)». Azhang lo describió como «sesgos consistentes» que equivalen a «algo así como una 'personalidad' inversora». Al leer el archivo de razonamientos se ve a un modelo justificando la paciencia mientras otro racionaliza el apalancamiento sobre el mismo instrumento y a la misma hora.

Investigación sobre sensibilidad a las indicaciones. El blog informa de «una sensibilidad a pequeños cambios de indicación», y la estructura de cuatro pistas lo vuelve medible en lugar de anecdótico. Si construye sistemas con agentes, la brecha visible entre New Baseline y Max Leverage en un mismo modelo es una lección concreta sobre cuánto del comportamiento de un agente reside en sus instrucciones y no en sus pesos.

Enseñar y comentar las promesas de capacidad en IA. La combinación de un marcador severo y de razonamientos íntegramente publicados produce un material didáctico poco común: el razonamiento suele sonar más autorizado justo en los pasajes donde el resultado salió mal.

Entender por qué los costes de negociación dominan las estrategias de agentes ingenuas. El propio balance de Nof1 señala que «el P&L estuvo dominado por los costes de negociación en las primeras ejecuciones, ya que los agentes operaron en exceso y tomaron ganancias rápidas y minúsculas que las comisiones borraron». Quien diseñe un agente automatizado que actúe con frecuencia en un entorno con comisiones debería leer esa frase dos veces.

Evaluación comparativa más allá de los bancos de pruebas estáticos. Para investigadores hartos de que los cuestionarios saturados ya no distingan entre modelos punteros, un mercado real es un banco de pruebas que resiste la memorización y que, según Nof1, se vuelve más difícil a medida que los modelos mejoran.

Para qué no sirve. No es un producto de inversión, ni una herramienta de trading, ni un servicio de señales, ni una estrategia que deba copiarse. No ofrece a los usuarios cartera, ejecución, controles de riesgo ni asesoramiento.

Cómo usar Alpha Arena

Paso 1: empiece por la clasificación, no por el flujo en directo. El flujo resulta atractivo pero es anecdótico. La clasificación aporta la distribución: qué modelos, en qué pistas, acabaron dónde y a qué coste en comisiones.

Paso 2: lea la columna de Sharpe antes que la de rentabilidad. La rentabilidad dice qué ocurrió; el Sharpe dice si se ganó o simplemente se sobrevivió. En la clasificación observada, los valores de Sharpe se agrupan cerca de cero y pasan a negativo, incluso en modelos bien situados por rentabilidad.

Paso 3: compare un mismo modelo en las cuatro pistas. Es el ejercicio individual más instructivo del sitio. Elija un modelo presente en New Baseline, Monk Mode, Situational Awareness y Max Leverage y observe la dispersión. Los datos observados muestran a GROK-4.20 terminando en 13 459 dólares en una pista mientras GROK-4 acababa en 385,02 dólares en otra: la indicación y el régimen de riesgo movieron el resultado más que la elección de modelo.

Paso 4: despliegue el razonamiento de una operación perdedora. Abra USER_PROMPT, CHAIN_OF_THOUGHT y TRADING_DECISIONS en una decisión que salió mal. Leer un razonamiento seguro pegado a un mal resultado es el remedio más rápido contra el exceso de confianza en una salida fluida de un modelo.

Paso 5: contraste la columna de comisiones con la de P&L. En varios modelos, las comisiones pagadas suponen una fracción considerable del P&L absoluto, o lo superan. Es la forma concreta del problema de sobreoperación documentado por el laboratorio.

Paso 6: mire las fechas antes de sacar conclusiones. El sitio incluye un aviso explícito: «La competición oficial ha terminado el 3 de diciembre de 2025 a las 17:00 EST. Los modelos ya no están funcionando». Salvo que desde entonces haya comenzado una temporada nueva, lo que consulta es el archivo de una temporada concluida.

Paso 7: lea el blog de investigación por la metodología, no solo por los resultados. La entrada explica qué se les dio a los modelos y qué no, contexto imprescindible antes de tratar cualquier cifra como un veredicto sobre la capacidad general de un modelo.

Paso 8: trate con cautela el resultado del «Mystery Model». El ganador de la Season 1.5 se publica como «Mystery Model», con un 12,11 % de rentabilidad agregada en dos semanas y 4 844 dólares obtenidos en el conjunto de competiciones. Al ser anónimo el ganador, ese resultado no puede atribuirse a ningún proveedor.

Consejos y buenas prácticas

Dé más peso al agregado que a cualquier pista aislada. Una pista durante dos semanas es una muestra muy pequeña. El Aggregate Index existe precisamente porque los resultados de un solo régimen son ruidosos, y hasta el agregado cubre una ventana corta.

Recuerde de qué se privó a los modelos. Azhang fue explícito en que el montaje era deliberadamente difícil: «Los LLM no manejan demasiado bien los datos numéricos de series temporales, pero eso es todo el contexto que les dimos», y a los modelos se les asignó «un universo de activos restringido y un espacio de acción bastante limitado». Los malos resultados aquí son prueba sobre esta configuración, no demostración de que los LLM nunca puedan operar.

No lea una rentabilidad de dos semanas como pericia. Con tasas de acierto agrupadas entre el 25 % y el 30 % en la temporada 1, las diferencias de resultado en quince días están muy influidas por la suerte. El Sharpe, el número de operaciones y la carga de comisiones aportan más información que la posición.

Vigile la dispersión en el número de operaciones. En la temporada 1, Gemini realizó 238 operaciones frente a las 38 de Claude Sonnet. La frecuencia es una firma de comportamiento que interactúa directamente con las comisiones y a menudo predice el resultado mejor que el acierto direccional.

Use la ronda de prueba como aviso sobre la varianza. Antes de la temporada pública, el equipo hizo un ensayo el 11 de octubre de 2025 con 200 dólares por modelo, en el que Grok-4 registró un 500 % de rentabilidad el primer día. Esa cifra carece de sentido como señal de capacidad e ilustra bien por qué las ventanas cortas y las apuestas pequeñas inducen a error.

No extrapole entre clases de activos. La temporada 1 fueron perpetuos de criptomonedas; la Season 1.5, acciones estadounidenses. Los resultados de un régimen dicen poco del otro.

Trate el razonamiento publicado como datos, no como consejo. El archivo de cadenas de razonamiento tiene un valor investigador genuino. No es un repertorio de ideas de inversión, y los modelos que lo produjeron perdieron dinero más veces de las que lo ganaron.

Compruebe si hay temporada en curso antes de dar por actuales las cifras. El sitio es honesto sobre el estado de la competición; los lectores que llegan desde un artículo de hace meses a menudo no lo son.

¿Para quién es Alpha Arena?

Investigadores de IA y especialistas en evaluación. Si su trabajo implica medir capacidades de modelos, este es un ejemplo raro de banco de pruebas con un entorno genuinamente adverso, consecuencias reales y transparencia completa del razonamiento.

Ingenieros que construyen sistemas con agentes. La brecha visible entre pistas es una lección práctica sobre sensibilidad a indicaciones y andamiaje, y la relación entre comisiones y P&L es una advertencia directa sobre agentes que actúan con demasiada frecuencia.

Operadores cuantitativos y sistemáticos. No como fuente de estrategias, sino como evidencia sobre si los modelos de lenguaje generalistas suponen hoy una amenaza para los enfoques sistemáticos o les ofrecen palanca. Los ratios de Sharpe publicados son la respuesta pertinente.

Periodistas, docentes y analistas que cubren las promesas de la IA. El conjunto de datos es público, la metodología está declarada y los resultados contradicen el marketing más inflado del sector. Esa combinación no abunda.

Observadores informados del sector de la IA. Si quiere saber si los modelos punteros pueden actuar con competencia en un entorno abierto e implacable, esta es la evidencia pública más directa disponible.

Quién debería mantenerse al margen. Inversores minoristas que busquen señales que copiar; quien quiera una herramienta de trading, gestión de cartera o asesoramiento; y quien tomara una clasificación de dos semanas como base para asignar su propio dinero. Nof1 no publica ninguna cláusula de exención en materia de inversión en su sitio, pero los resultados hablan por sí solos: la mayoría de los participantes perdió.

Plataformas compatibles

Alpha Arena es un producto exclusivamente web al que se accede en nof1.ai. Todo el sitio consta de cinco destinos de navegación —LIVE, LEADERBOARD, BLOG, MODELS y ABOUT— y no hay aplicación de escritorio, aplicación móvil, extensión de navegador ni documentación pública de API. Todo lo que el proyecto ofrece al público se lee en un navegador y sin cuenta.

La infraestructura de ejecución difiere de la capa de presentación. Las operaciones de la temporada 1 se ejecutaron en Hyperliquid, un mercado descentralizado de futuros perpetuos. Según Incrypted, el rendimiento de los modelos también se seguía mediante una hoja de cálculo de acceso público que medía ratios de Sharpe y valor total de la cartera. Terceros construyeron capacidad de seguimiento sobre los datos públicos: Incrypted señala que los usuarios podían «seguir los éxitos de los modelos, así como copiar su estrategia, por ejemplo a través de la plataforma Coinpilot». Esa vía de copy-trading la proporciona una plataforma externa y no Nof1, lo que determina dónde recaen el riesgo y la responsabilidad.

Los anuncios y las actualizaciones de temporada se distribuyen por la cuenta oficial de X @the_nof1 y por la cuenta personal del fundador Jay Azhang, donde se anunció por primera vez el lanzamiento el 17 de octubre de 2025.

Una nota práctica sobre el acceso: el sitio se encuentra tras el punto de control de seguridad de Vercel y puede devolver un HTTP 429 a las solicitudes automatizadas. El acceso desde un navegador normal no se ve afectado.

Precios y planes

Alpha Arena se consulta íntegramente gratis, y no existe ningún nivel de pago.

En ninguna parte del sitio hay página de precios, sistema de cuentas, inicio de sesión, suscripción ni proceso de pago. Todo el panel público —el flujo de decisiones en directo, la clasificación con todas sus métricas, los gráficos agregados y el blog de investigación— es accesible sin registro. La única acción de conversión presente es una invitación a «Join the Waitlist», y la única llamada a la acción de la página «Acerca de» es de contratación: «estamos contratando: ingenieros, investigadores, fundadores, pensadores originales», seguida de un enlace de contacto.

Esto es coherente con la naturaleza de la organización. Nof1 se financia como laboratorio de investigación, no a través de sus usuarios. FinSMEs informó en mayo de 2026 de la ronda de 15 millones de dólares codirigida por SUI Group y Karatage Opportunities, con fondos destinados «a ampliar las operaciones y los esfuerzos de desarrollo».

Hay un producto comercial previsto, pero todavía no existe. Según el mismo artículo, tras la temporada 2 «Nof1 tiene intención de lanzar una plataforma de consumo con los primeros agentes de programación del mundo dedicados a los mercados», construida sobre los propios modelos punteros del laboratorio. La temporada 2 se describe como una incorporación de búsqueda web, tiempo de razonamiento ampliado y ejecución en varios pasos, además del desarrollo de modelos propios de Nof1 en lugar de limitarse a probar los ajenos. Todo ello debe tratarse como una hoja de ruta anunciada y no como funcionalidad entregada: nada de eso está disponible hoy.

La implicación práctica para quien evalúe esta ficha: no hay nada que comprar, nada que probar y ningún compromiso que asumir. Tampoco hay relación de soporte, ni acuerdo de nivel de servicio, ni garantía de que se celebre una temporada concreta.

Alternativas

  • Bancos de pruebas estáticos de LLM (suites tipo MMLU, evaluaciones de código y razonamiento) — mucho más reproducibles y comparables en el tiempo, pero cada vez más saturados y vulnerables a la contaminación de datos de entrenamiento. Miden conocimiento y razonamiento en forma cerrada; Alpha Arena mide la toma de decisiones bajo incertidumbre y con consecuencias.
  • Marcos de backtesting y plataformas de investigación cuantitativa — la forma convencional de evaluar una estrategia, con muestras muchísimo mayores y sin capital en riesgo. No capturan el deslizamiento, la liquidez real ni el lastre de las comisiones como aquí, pero producen resultados estadísticamente significativos, algo que una ejecución real de dos semanas no puede.
  • Bancos de pruebas de agentes en entornos simulados — reproducibles, baratos y repetibles, a cambio de que los supuestos del simulador se conviertan en aquello que se está evaluando.
  • Arenas de modelos basadas en votación por preferencia humana — buenas para captar calidad subjetiva en muchas tareas; miden qué prefiere la gente, no si una decisión fue correcta frente a una realidad exterior.
  • Informes de capacidad publicados por los proveedores — de primera mano y más detallados en cuanto a método, pero sujetos al evidente conflicto de intereses que un banco de pruebas de terceros evita.

La comparación honesta es que la fortaleza de Alpha Arena es exactamente su debilidad. Los mercados reales lo hacen infalsificable e insaturable; también lo hacen escaso en muestra, costoso y ruidoso. Complementa a los bancos de pruebas estadísticos más que sustituirlos.

Limitaciones y advertencias

El resultado principal es que los modelos perdieron mayoritariamente, y ese contexto debería enmarcar todo lo demás. Protos, en una cobertura independiente titulada «Un concurso de trading cripto con LLM concluye que los LLM no saben operar con cripto», informó de que «cuatro de los seis grandes modelos de lenguaje enfrentados en la competición de trading cripto 'Alpha Arena' terminaron en números rojos, con el ChatGPT de OpenAI encabezando las pérdidas tras perder el 63 % de sus fondos».

Las pérdidas por modelo fueron sustanciales. Cifras de Protos para la temporada 1: ChatGPT perdió 6 267 dólares, Gemini 5 671, Grok 4 531 y Claude Sonnet 3 081. Solo dos terminaron por delante: DeepSeek con +489 dólares y QWEN3 MAX con +2 232.

El patrón se mantuvo entre temporadas. FinSMEs informa de que en la temporada 1 y la Season 1.5 combinadas, con ocho modelos recibiendo 10 000 dólares cada uno, «en 32 conjuntos de resultados los modelos terminaron en beneficio solo seis veces». Eso supone en torno a un 81 % de fracasos a nivel de modelo y pista.

Las tasas de acierto fueron pobres y homogéneas. Los seis modelos de la temporada 1 se situaron entre el 25 % y el 30 %. La frecuencia de negociación varió enormemente —238 operaciones de Gemini frente a 38 de Claude Sonnet—, lo que significa que se comparan estrategias de comportamiento bastante distintas y no solo calidades de juicio.

Las comisiones se comieron la ventaja. Nof1 reconoció que «el P&L estuvo dominado por los costes de negociación en las primeras ejecuciones, ya que los agentes operaron en exceso y tomaron ganancias rápidas y minúsculas que las comisiones borraron». QWEN3 MAX fue quien más pagó en comisiones, 1 654 dólares; Gemini pagó 1 331 mientras perdía con fuerza.

El rendimiento ajustado al riesgo fue débil incluso entre los ganadores. La clasificación observada muestra ratios de Sharpe agrupados cerca de cero: 0,019158 para el modelo con mayor valor de cuenta, 0,009537 y 0,000667 para los dos siguientes, con valores negativos como -0,010358 y -0,038861 más abajo. Rentabilidades positivas con un Sharpe casi nulo en dos semanas no acreditan pericia.

La dispersión dentro de un mismo modelo socava las conclusiones a nivel de modelo. GROK-4.20 terminó una pista en 13 459 dólares (+34,59 %) mientras GROK-4 acababa otra en 385,02 dólares, prácticamente una pérdida total. Cuando los modelos de un mismo proveedor ocupan ambos extremos, la clasificación dice más del régimen y la suerte que de la capacidad.

La muestra es demasiado pequeña para afirmaciones estadísticas, y el laboratorio coincide. Protos informa de que Nof1 «dice que habrá otra competición con mejores indicaciones y 'rigor estadístico'», un reconocimiento implícito de que las temporadas actuales carecen de él. Dos semanas, un puñado de modelos y unas decenas de conjuntos de resultados no sostienen inferencias fuertes.

El armazón restringe a los modelos, algo que el laboratorio documenta abiertamente. El balance de Nof1 afirma: «Hemos trabajado para dar a los modelos una oportunidad justa, pero el armazón impone restricciones reales. Cada agente debe analizar características de mercado ruidosas, relacionarlas con el estado actual de la cuenta, razonar bajo reglas estrictas y devolver una acción estructurada, todo ello dentro de una ventana de contexto limitada». Azhang añadió que a los modelos se les dio «un universo de activos restringido y un espacio de acción bastante limitado» y solo series temporales numéricas, un formato que los LLM manejan mal. Los malos resultados son, por tanto, evidencia sobre esta configuración concreta.

La competición no está en marcha actualmente. El sitio lo dice sin rodeos: «La competición oficial ha terminado el 3 de diciembre de 2025 a las 17:00 EST. Los modelos ya no están funcionando». Quien llegue esperando actividad en directo puede encontrarse solo un archivo.

El ganador de la Season 1.5 no es atribuible. La entrada ganadora se publica como «Mystery Model»: 12,11 % de rentabilidad agregada en dos semanas y 4 844 dólares en el conjunto de competiciones. Un ganador anónimo no puede acreditarse a ningún proveedor, lo que limita el alcance de ese titular.

No hay divulgación legal ni de gobernanza en el sitio. La página «Acerca de» no nombra entidad jurídica registrada, ni jurisdicción de constitución, ni dirección, ni plantilla. En la portada, en «Acerca de» y en la clasificación no hay enlace a política de privacidad, condiciones del servicio ni política de cookies. La identidad de la empresa la corrobora la prensa financiera de terceros y no el propio sitio.

No hay cláusula de exención en materia de inversión ni estatus regulatorio declarado. El sitio no indica que los resultados no constituyan asesoramiento de inversión, y Nof1 no divulga ninguna licencia financiera ni autorización regulatoria. Se trata de una demostración de investigación y no de un servicio financiero regulado; las operaciones publicadas no deben leerse como recomendaciones.

El copy-trading ocurre fuera del perímetro de Nof1. Dado que plataformas de terceros permiten replicar las estrategias de los modelos, quien lo haga asume riesgo de capital y exposición normativa en un lugar que Nof1 ni opera ni supervisa.

Las indicaciones y razonamientos publicados no llevan licencia declarada. Los registros completos de USER_PROMPT y CHAIN_OF_THOUGHT son consultables en abierto, pero el sitio no fija condiciones explícitas para su reutilización, lo que deja indefinida la postura sobre republicación o uso como conjunto de datos.

Preguntas frecuentes (FAQ)

Q1. ¿Alpha Arena es gratuito?

Por completo. El flujo de decisiones en directo, la clasificación con todas las métricas, los gráficos agregados y el blog de investigación pueden consultarse sin cuenta, y no existe página de precios, suscripción ni proceso de pago en ningún sitio. Los únicos datos que puede enviar son un correo electrónico para la lista de espera o un mensaje mediante el formulario de contacto.

Q2. ¿Los modelos de IA operan de verdad con dinero real?

Sí. A cada modelo participante se le asignaron 10 000 dólares de capital real y operó de forma autónoma sin intervención humana. La temporada 1 ejecutó perpetuos de criptomonedas en el mercado descentralizado Hyperliquid; la Season 1.5 operó acciones e índices estadounidenses, entre ellos TSLA, NVDA, MSFT, AMZN, GOOGL, PLTR y el índice NDX.

Q3. ¿Qué modelos participan?

Modelos punteros de laboratorios rivales funcionan uno junto a otro en condiciones idénticas. La clasificación observada incluye GROK-4.20, GROK-4, GPT-5.1, CLAUDE-SONNET-4-5, GEMINI-3-PRO, DEEPSEEK-CHAT-V3.1, QWEN3-MAX y KIMI-K2-THINKING, abarcando OpenAI, Anthropic, Google, xAI, DeepSeek, Alibaba y Moonshot.

Q4. ¿Los modelos de IA ganaron dinero realmente?

En su mayoría no, y ese es el hallazgo central. Cuatro de seis modelos terminaron la temporada 1 en rojo, y ChatGPT perdió el 63 % de sus fondos. Entre la temporada 1 y la Season 1.5, los modelos terminaron en beneficio solo seis veces de 32 conjuntos de resultados. Incluso en las ejecuciones rentables, los ratios de Sharpe rondaban el cero.

Q5. ¿Puedo copiar las operaciones de los modelos?

Nof1 no ofrece ninguna función de copy-trading. Plataformas de terceros como Coinpilot construyeron sobre los datos públicos la posibilidad de replicar estrategias, pero eso queda fuera del control de Nof1 y, dado que la mayoría de los modelos perdió dinero en las temporadas publicadas, hacerlo sería poco aconsejable.

Q6. ¿Alpha Arena sigue en marcha?

El sitio indica que la competición oficial terminó el 3 de diciembre de 2025 a las 17:00 EST y que los modelos ya no funcionan. Salvo que desde entonces se haya iniciado una temporada nueva, lo que se muestra es el archivo de una temporada concluida. Nof1 ha dicho que planea otra competición con mejores indicaciones y mayor rigor estadístico.

Q7. ¿Quién está detrás de Nof1?

Nof1 es un laboratorio de investigación en IA fundado por Jay Azhang, descrito por FinSMEs como «un laboratorio remoto de investigación en IA que entrena modelos punteros centrados en los mercados financieros». Levantó 15 millones de dólares en mayo de 2026 en una ronda codirigida por SUI Group, cotizada en el Nasdaq, y el fondo Karatage Opportunities. El propio sitio web no publica nombre de entidad jurídica registrada, dirección ni plantilla.

Q8. ¿Por qué los modelos rinden tan distinto según la pista?

La Season 1.5 ejecutó cuatro regímenes —New Baseline, Monk Mode, Situational Awareness y Max Leverage— que varían las instrucciones y la postura ante el riesgo dadas a los mismos modelos. El blog de investigación de Nof1 informa de «una sensibilidad a pequeños cambios de indicación», y la clasificación lo confirma: los modelos de un mismo proveedor ocupan tanto la cima como el fondo de la tabla observada.

Q9. ¿Alpha Arena da asesoramiento de inversión?

No. Es un banco de pruebas de investigación, no un servicio financiero. El sitio no publica cláusula de exención en materia de inversión y Nof1 no divulga licencia financiera ni autorización regulatoria, de modo que nada de lo mostrado debe leerse como recomendación. El propio registro público que muestra que la mayoría de los modelos perdió dinero es el argumento más sólido contra usarlo como guía.

Q10. ¿Por qué fiarse de resultados de solo dos semanas de operativa?

No debería considerarlos estadísticamente sólidos, y Nof1 tampoco lo pretende: ha anunciado que las competiciones futuras añadirán «rigor estadístico», concediendo implícitamente que a las actuales les falta. El valor está en la transparencia y en la dirección del hallazgo, no en su precisión: una muestra pequeña sigue siendo informativa cuando la tasa de fracaso ronda el 81 % y el razonamiento tras cada operación se publica y puede inspeccionarse.

¿Conoces una herramienta similar?
Si conoces otras grandes herramientas de IA, no dudes en enviárnoslas