중국 AI 개발사 MiniMax가 금요일 H3라는 비디오 생성 모델을 공개했고, 홍콩 증시에 상장된 회사 주가는 장 초반 17.4% 상승한 HK$230.0을 기록했다. 이 모델은 소리를 영상과 함께 생성하면서 최대 15초 길이의 2K 해상도 클립을 만들 수 있으며, 또한 기존 영상 편집과 클립 간 동작 복사도 다른 형식의 참고 자료가 주어지면 수행할 수 있다.
이번 주가 급등 폭은 모델만큼이나 종목 자체를 말해준다. MiniMax는 1월 홍콩에 HK$165로 상장해 첫날 두 배로 뛰었고, 3월에는 HK$1,330까지 닿았다. 이후 하락했다. 7월 9일 보호예수 해제로 약 49%의 주식이 한꺼번에 거래 가능해졌고 JPMorgan은 1주일 사이 목표주가를 두 차례 낮췄으며, 주가는 7월 20일 HK$193.1에 마감했다. 금요일 급등 이후에도 3월 고점보다 80% 넘게 낮은 수준이다.
따라서 H3는 MiniMax가 주식 물량이 아니라 제품으로 자사 주가를 움직일 수 있다는 점을 수개월 만에 처음 보여주는 증거다. 다만 진입하는 시장은 이미 다른 업체들이 앞서 있다. 비디오 모델을 블라인드 방식의 나란한 시청자 투표로 순위 매기는 Artificial Analysis에서 ByteDance의 Seedance 2.0은 오디오 포함 텍스트-투-비디오 부문 1,214 Elo로 1위이며, Kuaishou의 Kling 3.0과 Google의 Veo 3.1을 앞선다.
전문 모델 여러 개 대신 하나의 모델
지금까지 AI로 비디오를 생성하려면 분야별 전문 모델을 골라야 했다. 어떤 모델은 텍스트를 비디오로 바꾸고, 다른 모델은 정지 이미지를 움직이게 하며, 또 다른 모델은 완성된 장면에서 캐릭터를 바꾼다. 음성, 효과음, 음악도 각각 별도 시스템에서 나온다. 15초짜리 광고 하나를 만들려면 파일을 네다섯 개 도구 사이에서 옮기며 캐릭터 얼굴이 그 과정에서 망가지지 않기를 바라는 식이었다.
MiniMax는 H3가 이를 하나로 줄인다고 말한다. 회사는 “H3 개발을 이끈 첫 번째 원칙은 작업 전반의 통합과 일반화였다”고 설명하는데, 이는 이미지·클립·오디오의 어떤 조합이든 참고 자료로 받아들여 이를 어떻게 처리할지 평이한 자연어 문장만으로 판단하는 단일 모델을 뜻한다. 회사가 제시한 예시에서는 한 비디오의 카메라 움직임을 가져와 이미지 속 얼굴에 적용하고, 오디오 파일의 목소리로 노래하게 해달라고 모델에 요청한다.
이 분야 밖의 독자들이 판단해야 할 주장은 화질이 아니다. 핵심은 제작 파이프라인에서 필요한 도구 수가 5개에서 1개로 줄어드느냐는 점이며, 이는 MiniMax가 영화 제작자보다 광고주와 온라인 소매업체에 판매하는 가치다.
가격 주장과 오픈 웨이트 약속
MiniMax는 H3의 2K 비디오 비용이 초당 주류 경쟁사 요금의 3분의 1 미만이며, 768p 출력 비용은 경쟁사의 720p 요금의 절반 미만이라고 말한다. 이는 회사 수치일 뿐 독립적인 테스트 결과는 아니다.
더 큰 약속은 배포 방식이다. MiniMax는 법과 규제를 전제로 며칠 내 H3의 웨이트를 공개하겠다고 밝혔다. 웨이트는 모델을 작동하게 하는 학습된 수치이므로 이를 공개하면 누구나 H3를 내려받아 접속 비용을 내지 않고 자체 하드웨어에서 실행할 수 있다. 중국 연구소들이 텍스트 모델을 개방하는 동안 비디오 모델은 대체로 폐쇄적으로 유지돼 왔다. MiniMax는 또한 H3가 여러 중국산 칩에서 실행되도록 설계됐다고 말한다.
이는 더 넓은 시장을 재편해 온 흐름과 맞아떨어진다. DeepSeek는 가격 기준 저가 구간을 받치고 있고, Alibaba의 Qwen 계열은 가장 넓은 개발자 기반을 확보했으며, Moonshot은 7월 17일 2.8조 파라미터 규모의 Kimi K3를 공개했고 웨이트도 뒤이어 공개할 예정이다. MiniMax 역시 이미 M3 언어 모델의 웨이트를 공개하고 있다. 미국 연구소들에 미치는 영향은 벤치마크보다 라우팅 데이터에서 드러난다. 중국 모델의 미국 기업이 전송한 토큰 점유율은 OpenRouter 마켓플레이스를 기준으로 2026년 중반 46%까지 치솟았고, 이는 그 전 1년 평균 11%와 비교된다. 또한 개방형 중국 모델은 선도적인 OpenAI 및 Anthropic 시스템보다 60%에서 90% 저렴하게 운영된다. 물량이 곧 매출은 아니며, 폐쇄형 미국 모델은 여전히 프리미엄 작업에서 토큰당 훨씬 더 많은 수익을 낸다. 그러나 가격 하한선은 중국에서 형성되고 있으며, H3는 그 흐름을 텍스트에서 비디오로 확장한다.
아직 공개되지 않은 것들
H3의 규모는 공개되지 않았다. 파라미터 수가 없기 때문에, 회사를 제외한 누구도 내려받은 H3가 워크스테이션에서 돌아가는지 아니면 가속기 랙이 필요한지 말할 수 없고, 이는 오픈 웨이트 약속이 실제로 얼마나 의미가 있는지를 좌우한다. 상업적 결과물에 대한 가격, 사용량 제한, 라이선스 조건도 공개되지 않았다.
독립적인 품질 수치도 없다. 금요일 기준 H3는 Artificial Analysis 비디오 리더보드에 올라 있지 않았기 때문에, 현재 가능한 나란한 비교는 MiniMax가 직접 고른 MiniMax의 데모 클립뿐이다. 초기 테스터들은 이 모델의 강점이 고속 카메라 워크보다는 비용과 오디오에 있으며, 그 분야에서는 여전히 경쟁사들이 앞선다고 본다.
MiniMax는 전체 기술 보고서를 약속했고, 다음 단계로 자사 언어 모델을 통합할 계획이라고 밝혔다. 금요일 상승세에 베팅한 투자자들은 웨이트가 일정대로 공개되고, 더 저렴하면서 더 범용적인 모델이 물량을 가져갈 것이라는 데 걸고 있다. 회사에겐 이를 입증할 며칠의 시간이 있다.
