알리바바 가 월요일 Qwen3.8-Max를 출시했다고 밝히며, 다음 주 모델의 가중치를 공개해 이를 다운로드하려는 누구에게나 자사의 가장 강력한 AI 시스템 내부를 개방하겠다고 말했다. Qwen3.8-Max는 2.4조 개의 파라미터로 구동되며, 이는 모델이 학습 중 조정하는 값이자 업계에서 사용하는 거친 규모 지표다. 다만 실제로 모델이 어떤 단어를 생성할 때 활성화되는 것은 그중 약 950억 개뿐이다. 한 번의 질의에서 최대 100만 토큰을 받을 수 있다.
투자자들은 이를 호재로 받아들였다. 홍콩 증시에 상장된 Alibaba 주식은 HK$125.20에 7% 상승 마감했다, 미국 상장 주식도 개장 전 거래에서 4.2% 올랐다. Citi 애널리스트들은 이러한 움직임의 일부를 새 모델의 벤치마크 결과와 연결지었다.
그 반응은 모델 자체보다 Alibaba가 그것으로 무엇을 하려는지에 더 가깝다. 회사는 올해 상당 기간 가장 강력한 모델들을 비공개 독점 형태로 유지해왔고, 월요일의 최상위급 출시작의 오픈소스 복귀 는 이를 뒤집는 것이다.
Alibaba의 설명은 직설적이다. 팀은 "Qwen-Max급 모델의 가중치를 오픈소스로 공개하는 것은 이번이 처음"이라고 썼고, 관련 파일은 다음 주 Hugging Face와 ModelScope에 올라올 예정이다. 지금까지 Alibaba의 가장 강력한 모델을 쓰려는 기업은 데이터를 Alibaba 서버로 보내고 사용량에 따라 비용을 지불해야 했다. 다음 주부터는 같은 모델을 내려받아 자체적으로 통제하는 하드웨어에서 실행할 수 있다. 미국의 주요 AI 연구소들은 자사 최전선 모델의 가중치를 전혀 공개하지 않는다.
Alibaba는 또한 이미 자국 경쟁사들이 만들어 놓은 흐름에 합류하고 있다. Moonshot AI는 2.8조 파라미터 Kimi K3의 가중치를 공개했다 7월 27일에, 그리고 독립 추적 기관들은 이를 Claude Fable 5와 GPT-5.6 Sol Max 다음으로 평가했다. DeepSeek는 7월 31일 저가형 V4-Flash 모델을 재학습시켰고, 공개한 9개의 코딩 벤치마크 모두에서 Claude Opus 4.8에 뒤졌지만 토큰 비용은 약 54분의 1 수준이었다. 최전선에 근접하고, 다운로드 가능하며, 저렴한 것이 이제 중국 업체들의 표준 제안이 됐고, 이는 그 세 가지 조건 중 어느 것도 충족하지 않는 미국 모델들과 가격 경쟁을 벌인다.
단일 답변이 아닌, 며칠씩 걸리는 작업
Alibaba는 기발한 답변보다 장기 작업에 초점을 맞춰 출시를 구성했다. 이 회사는 모델을 10일이 넘는 기간 동안 하나의 소프트웨어 프로젝트에 투입했고, 7월 30일 기준 해당 저장소에는 인간의 개입 없이 약 16일 동안 265개의 커밋, 127개의 풀 리퀘스트, 151개의 이슈가 누적됐다.
또 다른 테스트에서는 학습 데이터 선택에 관한 연구 논문과 GPU 세트만 제공하고 시작용 코드는 주지 않았다. 약 125시간에 걸쳐 모델은 약 7,600줄의 코드를 작성하고, 33차례 학습을 실행해, 논문의 6가지 결과를 재현한 뒤, 자체적으로 18개의 아이디어를 시험했고, 결국 대회 수준 수학 벤치마크에서 논문보다 2.7점 높은 성능을 내는 방법을 찾아냈다.
또한 Alibaba의 Tianchi 플랫폼에서 526개 인간 팀과 경쟁하는 실시간 머신러닝 대회에도 참가했다. 24시간 제한 아래 단독으로 작업하며 45번 제출했고, 그중 458개 팀보다 앞섰다. 별도의 칩 설계 실행에서는 암호 회로를 8,298개의 로직 게이트에서 678개로 줄였고, 물리적 레이아웃도 81% 축소했다.
1년간의 시뮬레이션 전자상거래 사업은 개인투자자들이 가장 이해하기 쉬운 사례일 수 있다. ¥100,000으로 시작해 모델은 ¥416,252로 마무리했으며, 이는 2위 GLM 5.2보다 38% 앞선 수치이자 Alibaba의 이전 플래그십 Qwen3.7-Max보다 152% 높은 수준이다.
일부 벤치마크에서는 앞서고, 다른 곳에서는 뒤처져
공개된 비교표는 승리 선언이라기보다 혼재된 결과에 가깝다. Qwen3.8-Max는 Terminal Bench 2.1에서 86.6점을 기록해 84.6점의 Claude Opus 4.8과 Claude Fable 5를 앞섰지만, 88.8점의 GPT-5.6 Sol에는 뒤졌다. 연구 논문 재현을 평가하는 테스트인 PaperBench에서는 93.0점으로 표 1위를 차지했다.
다른 테스트들에서는 분명히 뒤처진다. Claude Fable 5는 SWE-bench Pro에서 Qwen3.8-Max의 67.7점 대비 80.0점을 기록했고, 광범위한 추론 테스트인 Humanity's Last Exam에서도 43.6점 대비 53.3점을 기록했다. Bloomberg는 이 모델이 여러 벤치마크에서 Kimi K3보다 높은 순위를 기록한다고 보도했는데, 이는 중국 내에서 가장 무게가 실리는 비교다.
숫자가 결론 내리지 못하는 것
많은 증거는 Alibaba 자체에서 나온 것이다. 표에 포함된 여러 벤치마크는 사내에서 구축됐고, 자율 코딩 및 칩 설계 결과도 Alibaba 자체의 외부 감사 없는 실행에서 나왔으며, 각주에는 Claude Fable 5 점수가 대체 경로를 포함할 수 있다고 경고돼 있다. 독립 추적 기관들은 아직 공개된 모델을 평가하지 않았다.
오픈 가중치가 곧바로 사용 가능한 가중치를 뜻하는 것도 아니다. 2.4조 파라미터 파일을 돌리려면 데이터센터급 GPU 랙이 필요하며, 이는 지난주 Kimi K3도 부딪힌 같은 장벽이다. Alibaba는 어떤 라이선스가 이번 공개를 규율할지 아직 밝히지 않았다.
다음 주 공개가 Alibaba에 안겨주는 것은 매출보다 배포다. Qwen3.8-Max를 다운로드하는 모든 기업은 OpenAI나 Anthropic과 계약하지 않은 기업이 되고, 그 위에서 구축하는 모든 기업은 나중에 다른 곳으로 옮기기 더 어려워진다. 가중치는 다음 주 공개된다. 라이선스는 Alibaba가 이 베팅에 실제로 얼마나 큰 뜻을 두고 있는지 보여줄 것이다.
