Alpha Arena는 프런티어 대규모 언어 모델에게 실제 자금을 맡기고 사람의 개입 없이 실제 시장에서 스스로 거래하게 하는 공개 실시간 벤치마크입니다. 그리고 모든 프롬프트와 모든 사고 과정, 모든 매매 결정이 누구나 읽을 수 있도록 공개됩니다. 사이트는 스스로를 한 문장으로 소개합니다. "AI trading in real markets"(실제 시장에서 거래하는 AI).
운영 주체는 Nof1이며, 소프트웨어 업체가 아니라 AI 연구소입니다. 가입할 제품을 기대하고 방문한 사람에게 이 구분은 중요합니다. About 페이지에 적힌 Nof1의 표현은 명백히 연구 명제입니다. "10년 전 DeepMind는 AI 연구를 혁신했습니다. 그들의 핵심 통찰은 올바른 환경, 즉 게임을 선택하면 프런티어 AI가 빠르게 발전한다는 것이었습니다. Nof1은 금융시장이 다음 시대 AI를 위한 최고의 훈련 환경이라고 믿습니다. 시장은 궁극의 세계 모델링 엔진이며, AI가 똑똑해질수록 더 어려워지는 유일한 벤치마크입니다."
이 페이지가 밝히는 포부는 순위표 운영에 그치지 않습니다. Nof1은 "시장을 이용해 스스로 훈련 데이터를 무한히 만들어내는 새로운 기반 모델을 훈련한다"고 말하며, "개방형 학습과 대규모 강화학습으로 최종 보스인 시장의 복잡성을 다룬다"고 설명하고, "현실 세계를 위한 AlphaZero를 만들고 싶은" 사람을 채용합니다. 다시 말해 Alpha Arena는 훨씬 큰 연구 프로그램에 딸린 공개 실험입니다.
독립 보도는 이 홍보 문구가 아니라 그 정체성 자체를 확인해 줍니다. 벤처 전문 매체 FinSMEs는 2026년 5월 이 회사를 "금융시장에 초점을 맞춘 프런티어 모델을 훈련하는 원격 AI 연구소"로 소개하며, 나스닥 상장사 SUI Group과 헤지펀드 Karatage Opportunities가 공동 주도한 1500만 달러 투자 유치를 보도했습니다. 창업자는 Jay Azhang으로, 2025년 10월 17일 프로젝트 출범을 공개적으로 알렸으며 Protos와 우크라이나 암호화폐 매체 Incrypted의 독립 보도가 모두 그를 Nof1 창업자로 지목합니다.
이 벤치마크가 특별한 이유는 시장으로 AI를 시험한다는 발상 자체가 아니라 — 시뮬레이션 기반의 시도는 수년간 있었습니다 — 시뮬레이션을 거부했다는 데 있습니다. 실제 자금, 실제 체결, 실제 슬리피지, 실제 수수료입니다. Azhang이 출범 당시 적었듯 "6개 AI 모델이 각각 1만 달러를 완전 자율로 거래한다 — 진짜 돈, 진짜 시장, 진짜 벤치마크"입니다.
그리고 두 시즌에 걸친 정직한 결론은, 모델들이 대체로 손실을 봤다는 것입니다. 이것이 이 프로젝트에서 가장 흥미로운 지점이며, Nof1은 그것을 감추지 않고 공개합니다.
실제 자금으로 돌아가는 실시간 벤치마크. 참가 모델마다 1만 달러의 실제 자금을 받아 자율적으로 거래합니다. 출범을 다룬 Incrypted 보도는 연구소의 설명을 인용합니다. 모델은 "완전히 자율적으로 작동하며 비트코인, 이더리움, 솔라나, 바이낸스코인, 도지코인, 리플의 라이브 암호화폐 시장에서 실제 거래를 합니다. 사람의 개입은 없습니다. 모델 스스로 리스크 관리를 위해 정하는 것 외에는 어떤 제약도 없습니다."
공급사를 가로지르는 동일 조건. 방법론의 핵심은 모든 모델이 같은 입력과 같은 실행 프레임을 받는다는 점입니다. Nof1의 연구 블로그는 설계를 직설적으로 밝힙니다. "우리는 여섯 개 선도 LLM에 각각 1만 달러를 주고, 오직 수치화된 시장 데이터만 입력으로 삼아 동일한 프롬프트와 하니스로 실제 시장에서 자율 거래하게 했습니다." 이 제약이 없으면 비교는 무의미해지고, 이 제약이 있어야 결과 차이를 발판이 아닌 모델 자체로 귀속할 수 있습니다.
네 개의 병렬 트랙. Season 1.5는 같은 모델들을 네 가지 경기 방식으로 나눕니다. 1: New Baseline, 2: Monk Mode, 3: Situational Awareness, 4: Max Leverage이며, 이를 가로지르는 Aggregate Index 집계 화면도 제공합니다. 덕분에 프롬프트와 리스크 성향의 차이가 교란 변수가 아니라 통제 변수가 되고, 같은 모델이 하나의 순위표에 여러 번 등장하면서 성적이 크게 갈리는 이유도 여기에 있습니다.
완전한 추론 투명성. 다른 곳에서는 사실상 대응물을 찾기 어려운 기능입니다. 실시간 피드의 각 결정에는 모델명, 소속 트랙, 타임스탬프, 자연어 요약이 붙고, USER_PROMPT와 CHAIN_OF_THOUGHT, TRADING_DECISIONS라는 세 원본 필드로 펼쳐집니다. 모델이 무엇을 지시받았고 어떻게 추론했으며 결국 무엇을 했는지 그대로 읽을 수 있습니다. 압박 상황에서의 모델 행동을 연구하는 사람에게는 이 기록 자체가 제품입니다.
수익률만이 아니라 실제 리스크 지표까지 담은 순위표. 순위표는 계좌 가치, 수익률, 총손익, 수수료, 승률, 최대 이익과 손실, 샤프 비율, 거래 횟수를 제공하며 트랙별 필터와 집계 보기가 가능합니다. 수수료와 샤프를 원수익률과 나란히 두는 것이 단순 수익률 전광판과의 차이이고, 결과를 보면 이야기는 바로 그 두 열에 있습니다.
경쟁 연구소들의 프런티어 모델이 한자리에. 실측 순위표에는 GROK-4.20, GROK-4, GPT-5.1, CLAUDE-SONNET-4-5, GEMINI-3-PRO, DEEPSEEK-CHAT-V3.1, QWEN3-MAX, KIMI-K2-THINKING이 포함됩니다. OpenAI와 Anthropic, 구글, xAI, DeepSeek, 알리바바, 문샷의 모델을 같은 시점 같은 조건에 놓는 공개 무대는 드뭅니다.
시즌 사이에 바뀐 자산군. 시즌 1은 암호화폐 무기한 계약을, Season 1.5는 미국 주식과 지수를 다뤘습니다. 실시간 피드와 시세 표시는 TSLA, NDX, NVDA, MSFT, AMZN, GOOGL, PLTR을 포함합니다. 이 전환 자체가 정보입니다. 한 국면에서 통한 전략이 다른 국면으로 자동 이전되지는 않습니다.
LLM이 실제로 무엇을 할 수 있는지 기대치를 조정하기. 이것이 가장 큰 가치이며, 유용한 방향으로 기대를 낮춰 줍니다. 프런티어 모델을 시장에 붙이면 수익이 난다는 말을 들었다면, 공개된 기록이 가장 값싼 교정 자료입니다. 시즌 1과 Season 1.5를 합쳐 모델이 이익으로 마감한 경우는 32개 결과 집합 중 단 6번입니다.
동일 조건에서 모델의 행동과 '성격' 연구하기. Nof1의 초기 발견은 모델들이 "리스크와 포지션 크기, 보유 기간에서 실제 행동 차이"를 보인다는 것이었습니다. Azhang은 이를 "일관된 편향", 즉 "일종의 투자 '성격'"이라고 표현했습니다. 사고 과정 기록을 읽으면 같은 시각 같은 종목에서 한 모델은 인내를 정당화하고 다른 모델은 레버리지를 합리화하는 장면을 볼 수 있습니다.
프롬프트 민감도 연구. 블로그는 "작은 프롬프트 변화에 대한 민감성"을 보고하며, 네 트랙 구조는 이를 일화가 아닌 측정 가능한 대상으로 만듭니다. 에이전트 시스템을 만드는 사람이라면, 같은 모델의 New Baseline과 Max Leverage 사이 격차는 에이전트 행동이 가중치보다 지시문에 얼마나 많이 담기는지 보여주는 구체적 교훈입니다.
AI 능력 주장에 대한 교육과 논평. 가혹하고 봐주지 않는 점수판에 완전히 공개된 추론이 더해져 보기 드문 교육 자료가 됩니다. 결과가 가장 나빴던 대목에서 추론은 오히려 가장 권위 있게 들리곤 합니다.
왜 거래 비용이 순진한 에이전트 전략을 지배하는지 이해하기. Nof1의 정리는 "초기 실행에서 손익은 거래 비용에 지배되었고, 에이전트가 과도하게 거래하며 얻은 작고 빠른 이익은 수수료에 잠식되었다"고 밝힙니다. 수수료가 발생하는 환경에서 자주 행동하는 에이전트를 설계하는 사람이라면 이 문장을 두 번 읽어야 합니다.
정적 벤치마크를 넘어선 비교 평가. 포화된 객관식 벤치마크가 더 이상 프런티어 모델을 변별하지 못한다고 느끼는 연구자에게, 실제 시장은 암기가 통하지 않는 벤치마크이며 Nof1의 주장대로라면 모델이 좋아질수록 더 어려워집니다.
적합하지 않은 용도. 투자 상품도, 매매 도구도, 시그널 서비스도, 따라 해야 할 전략도 아닙니다. 사용자에게 포트폴리오나 체결, 리스크 통제, 자문을 제공하지 않습니다.
1단계 — 실시간 피드가 아니라 순위표부터 보세요. 실시간 피드는 흥미롭지만 일화적입니다. 순위표는 분포를 보여줍니다. 어떤 모델이 어느 트랙에서 어디에 도달했고 수수료를 얼마나 치렀는지가 담깁니다.
2단계 — 수익률보다 샤프 열을 먼저 보세요. 수익률은 무슨 일이 있었는지 알려주고, 샤프는 그것이 실력으로 얻은 것인지 버텨서 남은 것인지 알려줍니다. 실측 순위표에서 샤프 값은 0 근처에 몰려 있고 음수로도 내려갑니다. 수익률 상위 모델도 예외가 아닙니다.
3단계 — 한 모델을 네 트랙에 걸쳐 비교하세요. 사이트에서 가장 배울 것이 많은 단일 연습입니다. New Baseline과 Monk Mode, Situational Awareness, Max Leverage에 모두 등장하는 모델을 골라 편차를 보세요. 실측 데이터에서 GROK-4.20은 한 트랙에서 13,459달러로 마감했고, GROK-4는 다른 트랙에서 385.02달러만 남았습니다. 프롬프트와 리스크 방식이 모델 선택보다 결과를 더 크게 움직였습니다.
4단계 — 손실 거래의 사고 과정을 펼쳐 보세요. 결과가 나빴던 결정에서 USER_PROMPT와 CHAIN_OF_THOUGHT, TRADING_DECISIONS를 열어 보세요. 자신감 넘치는 추론이 나쁜 결과에 붙어 있는 장면을 읽는 것은 유창한 모델 출력을 과신하는 습관을 고치는 가장 빠른 방법입니다.
5단계 — 수수료 열과 손익 열을 나란히 놓고 보세요. 몇몇 모델은 지불한 수수료가 손익 절댓값의 상당 부분을 차지하거나 이를 넘어섭니다. 연구소가 기록한 과잉 거래 문제의 구체적 형태입니다.
6단계 — 결론을 내리기 전에 날짜를 확인하세요. 사이트에는 명확한 공지가 있습니다. "공식 대회는 2025년 12월 3일 미국 동부시간 오후 5시로 종료되었습니다. 모델은 더 이상 실행되지 않습니다." 이후 새 시즌이 시작되지 않았다면 보고 있는 것은 종료된 시즌의 기록입니다.
7단계 — 연구 블로그는 결과가 아니라 방법론을 위해 읽으세요. 블로그 항목은 모델에게 무엇이 주어졌고 무엇이 주어지지 않았는지 설명합니다. 어떤 수치를 모델의 일반 능력에 대한 판결로 다루기 전에 반드시 필요한 맥락입니다.
8단계 — 'Mystery Model' 결과는 조심해서 다루세요. Season 1.5 우승자는 "Mystery Model"로 공개되며 2주간 집계 수익률 12.11%, 대회 전반에서 4,844달러를 벌었습니다. 우승자가 익명이므로 이 결과는 어떤 공급사에도 귀속할 수 없습니다.
단일 트랙보다 집계 지표에 무게를 두세요. 한 트랙의 2주는 매우 작은 표본입니다. Aggregate Index가 존재하는 이유가 바로 단일 방식 결과의 잡음이 크기 때문이며, 집계조차 짧은 구간을 다룹니다.
모델이 무엇을 박탈당했는지 기억하세요. Azhang은 설정이 의도적으로 어렵다고 분명히 밝혔습니다. "LLM은 수치 시계열 데이터를 그리 잘 다루지 못하는데, 우리가 준 맥락은 그것뿐이었다"고 했고, 모델에게는 "좁혀진 자산 범위와 상당히 제한된 행동 공간"이 주어졌습니다. 여기서의 부진은 이 구성에 관한 증거이지 LLM이 결코 거래할 수 없다는 증명이 아닙니다.
2주 수익률을 실력으로 읽지 마세요. 시즌 1의 승률이 25~30%에 몰려 있는 상황에서 2주간의 성적 차이에는 운의 비중이 큽니다. 샤프와 거래 횟수, 수수료 부담이 순위보다 더 많은 정보를 담습니다.
거래 횟수의 편차를 보세요. 시즌 1에서 Gemini는 238회, Claude Sonnet은 38회 거래했습니다. 빈도는 수수료와 직접 상호작용하는 행동 서명이며, 방향 적중률보다 결과를 더 잘 예측하는 경우가 많습니다.
테스트 라운드를 변동성 경고 사례로 활용하세요. 공개 시즌에 앞서 팀은 2025년 10월 11일 모델당 200달러로 시험 운영을 했고, 그중 Grok-4는 첫날 500% 수익률을 기록했습니다. 이 숫자는 능력 신호로는 무의미하며, 짧은 구간과 작은 자금이 왜 오해를 부르는지 잘 보여줍니다.
자산군을 넘어 외삽하지 마세요. 시즌 1은 암호화폐 무기한 계약, Season 1.5는 미국 주식이었습니다. 한 국면의 결과가 다른 국면에 대해 말해 주는 바는 거의 없습니다.
공개된 추론은 조언이 아니라 데이터로 다루세요. 사고 과정 기록은 연구에 분명한 가치가 있습니다. 매매 아이디어 모음이 아니며, 그것을 만들어낸 모델들은 이익보다 손실이 잦았습니다.
수치가 최신이라고 단정하기 전에 시즌이 진행 중인지 확인하세요. 사이트는 대회 상태에 대해 정직하지만, 몇 달 전 기사에서 넘어온 독자는 그렇지 않은 경우가 많습니다.
AI 연구자와 평가 전문가. 모델 능력 측정을 다루는 일이라면, 진정으로 적대적인 환경과 실제 결과, 완전한 추론 투명성을 갖춘 드문 사례입니다.
에이전트 시스템을 만드는 엔지니어. 트랙 간 격차는 프롬프트와 발판 민감도에 대한 실전 교훈이고, 수수료와 손익의 관계는 너무 자주 행동하는 에이전트에 대한 직접적인 경고입니다.
퀀트와 시스템 트레이더. 전략의 출처가 아니라, 범용 언어 모델이 현재 시스템적 접근에 위협인지 지렛대인지에 관한 증거로서 유용합니다. 공개된 샤프 수치가 그 답입니다.
AI 주장을 다루는 기자와 교육자, 분석가. 데이터가 공개되어 있고 방법론이 명시되어 있으며, 결과는 업계의 가장 부풀려진 마케팅과 정면으로 배치됩니다. 이런 조합은 찾기 어렵습니다.
AI 산업을 지켜보는 정보에 밝은 관찰자. 프런티어 모델이 봐주지 않는 개방형 환경에서 유능하게 행동할 수 있는지 알고 싶다면, 지금 구할 수 있는 가장 직접적인 공개 증거입니다.
멀리해야 할 사람. 따라 할 시그널을 찾는 개인 투자자, 매매 도구나 포트폴리오 관리, 자문 서비스를 원하는 사람, 2주짜리 순위표를 자기 자금 배분의 근거로 삼을 사람입니다. Nof1은 사이트에 투자 관련 면책 문구를 두지 않았지만, 결과 자체가 답을 말해 줍니다. 참가자 대다수가 손실을 봤습니다.
Alpha Arena는 nof1.ai에서 접속하는 웹 전용 제품입니다. 사이트 전체가 LIVE, LEADERBOARD, BLOG, MODELS, ABOUT이라는 다섯 개 이동 지점으로 이뤄져 있으며 데스크톱 앱도, 모바일 앱도, 브라우저 확장도, 공개 API 문서도 없습니다. 이 프로젝트가 대중에게 제공하는 모든 것은 계정 없이 브라우저에서 읽을 수 있습니다.
체결 인프라는 표현 계층과 다릅니다. 시즌 1의 거래는 탈중앙화 무기한 선물 거래소 Hyperliquid에서 실행되었습니다. Incrypted 보도에 따르면 모델 성과는 샤프 비율과 포트폴리오 총가치를 측정하는 공개 스프레드시트로도 추적되었습니다. 제3자는 공개 데이터 위에 따라가기 기능을 만들었는데, Incrypted는 사용자가 "모델의 성과를 따라가고 전략을 복제할 수 있으며 예컨대 Coinpilot 플랫폼을 통해 가능하다"고 전합니다. 이 카피 트레이딩 경로는 Nof1이 아니라 외부 플랫폼이 제공하며, 이는 위험과 책임이 어디에 놓이는지를 좌우합니다.
공지와 시즌 소식은 공식 X 계정 @the_nof1과 창업자 Jay Azhang의 개인 계정으로 배포되며, 2025년 10월 17일 출범 소식도 여기서 처음 발표되었습니다.
접속에 관한 실무 참고 사항이 하나 있습니다. 사이트는 Vercel의 보안 검문 뒤에 있어 자동화 요청에는 HTTP 429를 반환할 수 있습니다. 일반 브라우저 접속에는 영향이 없습니다.
Alpha Arena는 전체를 무료로 볼 수 있으며, 어떤 종류의 유료 등급도 없습니다.
사이트 어디에도 가격 페이지나 계정 체계, 로그인, 구독, 결제 절차가 없습니다. 실시간 결정 피드와 모든 성과 지표를 담은 순위표, 집계 차트, 연구 블로그로 이뤄진 공개 대시보드 전체를 등록 없이 이용할 수 있습니다. 사이트에 존재하는 유일한 전환 동작은 "Join the Waitlist"이며, About 페이지의 유일한 행동 유도는 채용입니다. "우리는 채용 중입니다. 엔지니어, 연구자, 창업자, 독창적인 사고를 하는 사람"이라는 문구 뒤에 연락처가 이어집니다.
이는 이 조직의 성격과 일치합니다. Nof1의 재원은 사용자가 아니라 연구소 투자에서 나옵니다. FinSMEs는 2026년 5월 SUI Group과 Karatage Opportunities가 공동 주도한 1500만 달러 라운드를 보도하며, 자금 용도가 "운영 확장과 개발 노력"이라고 전했습니다.
상업 제품은 계획되어 있으나 아직 존재하지 않습니다. 같은 보도에 따르면 시즌 2 이후 "Nof1은 시장을 위한 세계 최초의 코딩 에이전트를 갖춘 소비자 플랫폼을 출시할 계획"이며 연구소 자체 프런티어 모델 위에 구축됩니다. 시즌 2 자체는 웹 검색과 확장된 추론 시간, 다단계 실행을 더하고 남의 모델을 시험하는 데 그치지 않고 Nof1 자체 모델을 개발하는 것으로 설명됩니다. 이 모두는 공개된 로드맵일 뿐 출시된 기능이 아니며, 오늘 사용할 수 있는 것은 하나도 없습니다.
이 소개를 검토하는 독자에게 실질적 함의는 이렇습니다. 살 것도, 체험할 것도, 약정할 것도 없습니다. 동시에 지원 관계도, 서비스 수준 협약도 없고, 특정 시즌이 반드시 열린다는 보장도 없습니다.
정직한 비교는 이렇습니다. Alpha Arena의 강점이 곧 약점입니다. 실제 시장은 이를 조작 불가능하고 포화되지 않게 만들지만, 동시에 표본이 작고 비용이 크며 잡음이 많게 만듭니다. 통계형 벤치마크를 대체하기보다 보완합니다.
핵심 결과는 모델들이 대체로 손실을 봤다는 것이며, 이 맥락이 나머지 전부를 규정해야 합니다. Protos는 "LLM 암호화폐 거래 대회, LLM은 암호화폐를 거래할 수 없다는 결론"이라는 제목의 독립 보도에서 이렇게 전했습니다. "'Alpha Arena' 암호화폐 거래 대회에서 맞붙은 여섯 개 대규모 언어 모델 중 넷이 손실로 마감했으며, OpenAI의 ChatGPT가 자금의 63%를 잃어 손실 폭이 가장 컸다."
모델별 손실 규모는 상당했습니다. Protos가 제시한 시즌 1 수치는 ChatGPT 6,267달러 손실, Gemini 5,671달러 손실, Grok 4,531달러 손실, Claude Sonnet 3,081달러 손실입니다. 앞선 것은 둘뿐으로 DeepSeek이 489달러, QWEN3 MAX가 2,232달러의 이익을 냈습니다.
이 양상은 시즌을 가로질러 유지되었습니다. FinSMEs는 시즌 1과 Season 1.5를 합쳐 여덟 개 모델이 각각 1만 달러를 받은 상황에서 "32개 결과 집합 가운데 모델이 이익으로 마감한 것은 단 여섯 번"이라고 보도했습니다. 모델-트랙 단위로 보면 실패율이 약 81%입니다.
승률은 낮고 일정했습니다. 시즌 1의 여섯 모델 모두 승률이 25~30% 사이였습니다. 거래 빈도는 크게 갈렸습니다. Gemini 238회 대 Claude Sonnet 38회로, 이는 단순한 판단력 우열이 아니라 상당히 다른 행동 전략 사이의 비교라는 뜻입니다.
수수료가 우위를 잠식했습니다. Nof1 스스로 "초기 실행에서 손익은 거래 비용에 지배되었고, 에이전트가 과도하게 거래하며 얻은 작고 빠른 이익은 수수료에 지워졌다"고 인정했습니다. QWEN3 MAX가 1,654달러로 수수료를 가장 많이 냈고, Gemini는 크게 잃으면서도 1,331달러를 냈습니다.
승자조차 위험조정 성과는 약했습니다. 실측 순위표의 샤프 비율은 0 근처에 몰려 있습니다. 계좌 가치 1위 모델이 0.019158, 다음 둘이 0.009537과 0.000667이며 아래로는 -0.010358, -0.038861 같은 음수도 나옵니다. 2주 동안 0에 가까운 샤프로 낸 플러스 수익은 실력의 증거가 아닙니다.
같은 모델 내부의 편차가 모델 단위 결론을 무너뜨립니다. GROK-4.20은 한 트랙에서 13,459달러(+34.59%)로 마감했고 GROK-4는 다른 트랙에서 385.02달러, 사실상 전액에 가까운 손실로 끝났습니다. 같은 공급사의 모델이 양극단을 차지할 때 순위가 말해 주는 것은 능력보다 방식과 운입니다.
표본은 통계적 주장을 지탱하기에 턱없이 작고, 연구소도 이에 동의합니다. Protos는 Nof1이 "더 나은 프롬프트와 '통계적 엄밀성'을 갖춘 또 다른 대회가 있을 것이라고 말한다"고 전했는데, 이는 기존 시즌에 그것이 없었다는 사실상의 인정입니다. 2주, 소수의 모델, 수십 개 결과 집합으로는 강한 추론을 뒷받침할 수 없습니다.
하니스가 모델을 제약한다는 점은 연구소가 공개적으로 기록해 두었습니다. Nof1의 정리는 이렇습니다. "우리는 모델에게 공정한 기회를 주려 애썼지만 하니스는 실제 제약을 부과합니다. 각 에이전트는 잡음이 많은 시장 특징을 해석하고 현재 계좌 상태와 연결하며 엄격한 규칙 아래 추론하고 구조화된 행동을 반환해야 하는데, 이 모두가 제한된 컨텍스트 창 안에서 이뤄집니다." Azhang은 모델에게 "좁혀진 자산 범위와 상당히 제한된 행동 공간"이 주어졌고 LLM이 잘 다루지 못하는 수치 시계열만 입력되었다고 덧붙였습니다. 따라서 부진한 결과는 이 특정 구성에 대한 증거입니다.
대회는 현재 진행 중이 아닙니다. 사이트는 분명히 밝힙니다. "공식 대회는 2025년 12월 3일 미국 동부시간 오후 5시로 종료되었습니다. 모델은 더 이상 실행되지 않습니다." 실시간 경쟁을 기대하고 방문한 사람은 기록만 보게 될 수 있습니다.
Season 1.5 우승자는 귀속이 불가능합니다. 우승 항목은 "Mystery Model"로 공개되며 2주 집계 수익률 12.11%, 대회 전반 4,844달러입니다. 익명 우승자는 어떤 공급사의 공로로도 기록할 수 없어 이 결과가 확립하는 바에는 한계가 있습니다.
사이트에는 법무나 지배구조 관련 공시가 전혀 없습니다. About 페이지에는 등록 법인명도, 설립 관할도, 주소도, 팀 명단도 없습니다. 홈과 About, 순위표 세 페이지 어디에도 개인정보 처리방침이나 이용약관, 쿠키 정책 링크가 없습니다. 회사의 정체성은 사이트 자체가 아니라 제3자 금융 매체를 통해 확인됩니다.
투자 관련 면책 문구도, 규제 지위 표기도 없습니다. 사이트는 결과가 투자 조언이 아니라는 문구를 두지 않았고, Nof1은 어떤 금융 라이선스나 규제 인가도 공개하지 않습니다. 이는 규제받는 금융 서비스가 아니라 연구 시연이며, 공개된 거래를 추천으로 받아들여서는 안 됩니다.
카피 트레이딩은 Nof1의 경계 밖에서 일어납니다. 제3자 플랫폼이 모델 전략을 그대로 따라가게 해 주는 만큼, 그렇게 하는 사람의 자금 위험과 규제 노출은 Nof1이 운영하지도 감독하지도 않는 장소에서 발생합니다.
공개된 프롬프트와 추론에는 명시된 라이선스가 없습니다. USER_PROMPT와 CHAIN_OF_THOUGHT 기록 전체를 공개적으로 볼 수 있지만, 사이트는 이 자료의 재사용에 관한 명시적 조건을 두지 않아 재배포나 데이터셋 활용에 관한 입장이 정의되지 않은 상태입니다.
전부 무료입니다. 실시간 결정 피드와 모든 성과 지표를 담은 순위표, 집계 차트, 연구 블로그를 계정 없이 볼 수 있고, 사이트에는 가격 페이지나 구독, 결제 절차가 없습니다. 제출할 수 있는 데이터는 대기자 명단용 이메일이나 문의 양식 메시지뿐입니다.
그렇습니다. 참가 모델마다 1만 달러의 실제 자금을 배정받아 사람의 개입 없이 자율 거래했습니다. 시즌 1은 탈중앙화 거래소 Hyperliquid에서 암호화폐 무기한 계약을, Season 1.5는 TSLA와 NVDA, MSFT, AMZN, GOOGL, PLTR, NDX 지수를 포함한 미국 주식과 지수를 다뤘습니다.
경쟁 관계인 연구소들의 프런티어 모델이 동일 조건에서 나란히 돌아갑니다. 실측 순위표에는 GROK-4.20, GROK-4, GPT-5.1, CLAUDE-SONNET-4-5, GEMINI-3-PRO, DEEPSEEK-CHAT-V3.1, QWEN3-MAX, KIMI-K2-THINKING이 포함되며 OpenAI와 Anthropic, 구글, xAI, DeepSeek, 알리바바, 문샷을 아우릅니다.
대체로 아니며, 이것이 핵심 발견입니다. 시즌 1에서 여섯 모델 중 넷이 손실로 마감했고 ChatGPT는 자금의 63%를 잃었습니다. 시즌 1과 Season 1.5를 합치면 모델이 이익을 낸 것은 32개 결과 집합 중 여섯 번뿐이며, 이익을 낸 경우조차 샤프 비율은 0 근처였습니다.
Nof1은 어떤 카피 트레이딩 기능도 제공하지 않습니다. Coinpilot 같은 제3자 플랫폼이 공개 데이터 위에 모델 전략을 복제하는 기능을 만들었지만 이는 Nof1의 통제 밖이며, 공개된 시즌에서 대다수 모델이 손실을 본 점을 고려하면 권하기 어렵습니다.
사이트는 공식 대회가 2025년 12월 3일 미국 동부시간 오후 5시에 종료되었고 모델이 더 이상 실행되지 않는다고 밝힙니다. 이후 새 시즌이 시작되지 않았다면 보고 있는 것은 종료된 시즌의 기록입니다. Nof1은 더 나은 프롬프트와 높은 통계적 엄밀성을 갖춘 후속 대회를 계획한다고 밝혔습니다.
Nof1은 Jay Azhang이 설립한 AI 연구소로, FinSMEs는 "금융시장에 초점을 맞춘 프런티어 모델을 훈련하는 원격 AI 연구소"라고 소개했습니다. 2026년 5월 나스닥 상장사 SUI Group과 헤지펀드 Karatage Opportunities가 공동 주도한 1500만 달러를 유치했습니다. 웹사이트 자체는 등록 법인명이나 주소, 팀 명단을 공개하지 않습니다.
Season 1.5는 New Baseline과 Monk Mode, Situational Awareness, Max Leverage라는 네 방식을 운영하며 같은 모델에게 주는 지시와 리스크 성향을 달리했습니다. Nof1의 연구 블로그는 "작은 프롬프트 변화에 대한 민감성"을 보고했고, 순위표가 이를 뒷받침합니다. 같은 공급사의 모델이 실측 표의 최상단과 최하단을 동시에 차지합니다.
아닙니다. 금융 서비스가 아니라 연구 벤치마크입니다. 사이트는 투자 면책 문구를 두지 않았고 Nof1은 금융 라이선스나 규제 인가를 공개하지 않으므로, 표시되는 어떤 것도 추천으로 읽어서는 안 됩니다. 대다수 모델이 손실을 봤다는 공개 기록 자체가 이를 지침으로 삼지 말아야 할 가장 강력한 근거입니다.
통계적으로 강한 결론으로 다뤄서는 안 되며, Nof1도 그렇게 주장하지 않습니다. 향후 대회에 "통계적 엄밀성"을 더하겠다고 밝힌 것 자체가 현재 시즌에 그것이 부족함을 인정한 셈입니다. 가치는 정밀도가 아니라 투명성과 결론의 방향에 있습니다. 실패율이 약 81%에 이르고 모든 거래의 추론이 검증 가능하게 공개되어 있다면, 작은 표본이라도 정보를 담습니다.