샤오미 MiMo-V2.6-Pro: 300만 달러로 만든 최강 오픈 웨이트 모델, 설치부터 벤치마크까지
중국 스마트폰 제조사 샤오미가 300만 달러 예산으로 훈련시킨 MiMo-V2.6-Pro가 인공지능 분석 지능 지수 46점으로 오픈 웨이트 모델 1위를 차지했습니다. 네이티브 옴니모달 지원과 20배 빠른 울트라스피드 버전까지 공개되며, 기존 강자들을 위협하는 새로운 프론티어 랩으로 떠올랐습니다. 이 자료는 모델 스펙 비교부터 RL 훈련 레시피 공개 범위, 로컬 실행 시 고려사항까지 실무자가 바로 판단할 수 있게 정리합니다.
샤오미가 '중국의 애플'에서 프론티어 AI 랩으로 변신하며 MiMo-V2.6-Pro를 공개했습니다. 1조 토큰, 420억 파라미터 규모에 300만 달러라는 파격적 비용으로 오픈 웨이트 모델 지능 순위 1위를 찍고, 훈련 환경과 리워드 코드까지 오픈소스로 풀었습니다. 폐쇄형 모델 대비 어느 지점까지 따라잡았는지, 내 GPU에서 돌려볼 만인지 현장 관점에서 짚어봅니다.
MiMo-V2.6-Pro란 무엇인가
두 가지 변종: Pro vs UltraSpeed
| 구분 | MiMo-V2.6-Pro | MiMo-V2.6-Pro-UltraSpeed |
|---|---|---|
| 위치づけ | 가장 강력한 범용 모델 | 속도·비용 균형 최적화 |
| 생성 속도 | 기준 | 최대 20배 빠름(동일 품질) |
| 추천 용도 | 최고 지능 필요 작업 | 실시간·대량 추론 환경 |
공식 발표에 따르면 Pro는 "우리가 지금까지 만든 가장 능력 있는 모델"이며, UltraSpeed는 "지능·효율·비용의 최적 균형"을 겨냥합니다. UltraSpeed는 동일한 품질에서 출력 속도를 최대 20배까지 끌어올려, 실시간 스트리밍이나 대량 배치 추론이 중요한 서비스에 적합합니다.
라이선스 및 허깅페이스 접근
- 오픈 웨이트(Open Weights) 형태로 공개 — 상업적 이용 가능 여부는 모델 카드 라이선스 파일 확인 필요
- 허깅페이스(Hugging Face) 레포지토리에서 가중치·토크나이저·설정 파일 일괄 다운로드 제공
- 모델 카드에 학습 레시피·데이터셋 로더·보상 함수 등 툴링 일부도 함께 오픈 소스로 배포 예정
왜 주목받는가 — 세 가지 포인트
- 비용 대비 성능: Intelligence Index 46점, 태스크당 $0.13으로 파레토 프론티어에 진입
- 옴니모달 네이티브: 별도 인코더·어댑터 없이 멀티모달 입력을 단일 트랜스포머로 처리
- 중국 프론티어 랩의 새 기준: 딥시크 출신 엔지니어 주도로 RL 스케일링 3축(배치·태스크·보상)을 모두 공개하며 투명성 확보
이번 릴리스는 샤오미가 '중국의 애플'에서 '중국의 프론티어 AI 랩'으로 변신했음을 알리는 신호탄입니다. 이어지는 섹션에서는 실제 설치·양자화·벤치마크 재현 방법을 단계별로 다룹니다.
왜 지금 주목해야 하는가
샤오미 MiMo-V2.6-Pro는 인공지능 분석(Artificial Analysis) 인텔리전스 인덱스 46점으로 오픈 웨이트 모델 1위에 올랐습니다. 인덱스는 추론·코딩·멀티모달 등 종합 능력을 측정하는데, 폐쇄형 최상위 모델들과 격차를 크게 좁힌 첫 사례로 기록됩니다.
중국 랩들의 릴리즈 속도가 시장 신호를 바꾸고 있습니다. Kimi K3, Qwen3.8-Max, DeepSeek V4-Pro, GLM-5.3, Hy4 Preview, Atria Dawn 등이 분기 단위로 연이어 등장하며, 오픈 웨이트 생태계가 폐쇄형 독점 구도를 실질적으로 위협하는 단계에 진입했습니다. 블룸버그 소식통에 따르면 스타트업들도 점점 오픈 모델 기반으로 전환 중입니다.
| 지표 | MiMo-V2.6-Pro | 비고 |
|---|---|---|
| Intelligence Index | 46 | 오픈 웨이트 1위 |
| Task Cost | $0.13 | 파레토 최전선 |
| 훈련비 | $3M | 공개 수치 |
| 아키텍처 | 1T-A42B | MiMo-V2.6 시리즈 |
폐쇄형 모델과의 격차 현황
- 코딩·에이전트·사이버·비전 등 멀티태스크 RL로 단일 모델이 전 영역 커버
- 자체 평가에서 GPT-4o/Claude 3.5 Sonnet급과 동등 이상 구간 다수
- API 종속성 없이 자체 인프라에서 풀 파인튜닝·배포 가능
로컬 실행·클라우드 배포 단계별 가이드
MiMo-V2.6-Pro 모델은 GGUF/QUANT 형식으로 배포됩니다. 로컬에서 실행하기 위해서는 먼저 해당 형식의 파일을 다운로드한 뒤, vLLM, SGLang 또는 올라마와 같은 런타임 환경을 설정해야 합니다. 이 과정에서는 모델을 로드하고 추론을 수행하는 명령어가 필요하지만, 구체적인 명령어는 공식 문서를 참고하시기 바랍니다.
42B 파라미터 모델의 VRAM 요구량은 FP16, BF16, 4bit 세 가지 정밀도에 따라 다릅니다. 각 정밀도별 VRAM 필요량은 모델이 제공하는 사양표에 명시되어 있으므로, 사용 환경에 맞춰 적절한 정밀도를 선택하면 됩니다.
벤치마크·비용·속도 한눈에 보기
MiMo‑V2.6‑Pro는 Artificial Analysis Intelligence Index에서 46점을 받아 현재 공개 가중치 모델 중 최고 점수를 기록했습니다. 비용은 작업당 0.13 달러로, 인텔리전스 대비 비용 효율이 가장 높은 Pareto 프론티어에 위치합니다. 이 수치는 코딩·에이전트·비전·사이버 등 4가지 주요 태스크에 모두 적용된 점수이며, 각 태스크에서 균형 잡힌 성능을 보여줍니다.
특히 UltraSpeed 버전은 동일 품질을 유지하면서 출력 속도가 최대 20배 빨라졌습니다. 토큰당 출력 속도는 기존 모델 대비 크게 향상돼, 실시간 응용 프로그램이나 대용량 생성 작업에 적합합니다.
- 코딩 (coding)
- 일반 에이전트 (general agents)
- 비전 (visual)
- 사이버 (cyber)
| 모델 | 출력 속도 |
|---|---|
| MiMo‑V2.6‑Pro (기본) | 표준 속도 |
| MiMo‑V2.6‑Pro UltraSpeed | 20× 빠른 속도 |
비용 대비 효율은 왜 중요한가요?
작업당 0.13 달러라는 낮은 비용은 대규모 배포 시 전체 비용을 크게 절감합니다. 동시에 높은 인덱스 점수는 성능 저하 없이 효율성을 유지한다는 뜻이므로, 기업·연구자 모두에게 매력적인 옵션이 됩니다.
훈련 레시피와 오픈소스 공개 범위
MiMo-V2.6-Pro의 핵심은 RL(강화학습) 3축 스케일링입니다. 샤오미는 배치 크기·태스크 다양성·리워드 정밀도 세 축을 동시에 키워 성능을 끌어올렸습니다. 한 번 업데이트에 1,568개 샘플을 쓰는 완전 비동기 아키텍처로, 단계당 3.5~3.7B 토큰을 처리하며 최대 1M 컨텍스트까지 학습합니다. 이 구조 덕분에 더 큰 배치와 높은 처리량을 안정적으로 확보했습니다.
태스크 측면에서는 코딩·일반 에이전트·시각·사이버 보안 등 멀티 태스크 스위트를 여러 하네스로 묶어, 한 능력의 향상이 다른 능력에도 전이되도록 설계했습니다. 리워드는 그룹 내 상대 비교 방식을 써서 장거리 과제의 신호를 더 정밀하고 다양하게 만듭니다. 이 루프가 모델을 더 짧은 경로·적은 토큰으로 과제를 풀게 유도합니다.
공개된 환경·레시피·도구
샤오미는 학습에 쓴 환경 코드와 훈련 레시피 전부를 오픈소스로 공개한다고 밝혔습니다. 현재 공개 대상이 명시된 항목은 다음과 같습니다.
- ARVO 환경 코드와 훈련 레시피
- 사이버/취약점 재현 환경·도구·레시피
- 일반 에이전트 환경·도구·훈련 레시피
- 웹 개발 환경과 채점(grading) 스크립트
- 데이터 준비 파이프라인과 음악 스코어러
이 덕분에 연구자나 엔지니어는 동일한 환경·리워드·데이터 로더로 MiMo-V2.6-Pro의 RL 과정을 재현하거나, 자기 도메인에 맞춰 커스텀 파인튜닝을 바로 시작할 수 있습니다. 진입장벽은 '환경 구축·리워드 설계·데이터 파이프라인' 세 가지가 모두 제공되므로 크게 낮아졌습니다.
주의할 점과 실무 체크리스트
MiMo‑V2.6‑Pro‑UltraSpeed는 기존 Pro 모델 대비 최대 20배 빠른 출력 속도를 제공하지만, 자료에 따르면 “같은 품질”을 유지한다는 점을 확인했습니다. 초고속 출력이 반드시 필요한 워크플로에만 사용하고, 품질 민감도가 높은 응답에서는 일반 Pro 모드를 선택하는 것이 안전합니다.
모델은 1M 컨텍스트 길이까지 학습되었으며, 이는 대용량 프롬프트 처리에 강점을 주지만 실제 추론 시 메모리·GPU 요구량이 크게 증가합니다. 따라서 1M 컨텍스트를 실사용에 적용하려면 하드웨어 사양을 충분히 검증해야 합니다.
훈련 단계에서는 1,568 샘플을 한 번에 업데이트하는 대규모 배치를 사용했으며, 비동기 아키텍처 위에서 1M 컨텍스트 길이, 3.5~3.7 B 토큰·스텝 규모로 학습되었습니다. 또한 코딩·일반 에이전트·시각·사이버 등 여러 환경을 아우르는 멀티태스크 스위트가 적용돼 각 능력이 서로 강화되는 구조를 갖추고 있습니다.
- UltraSpeed 사용 시 속도‑품질 트레이드오프를 확인하고, 품질이 중요한 작업에는 일반 Pro 모드 선택
- 1M 컨텍스트 사용 시 메모리·GPU 요구량을 사전 검증
- 대규모 배치(1,568 샘플/업데이트)와 비동기 아키텍처 적용 여부 점검
- 멀티태스크·멀티환경 학습이 포함된 RL 스케일링 특성을 이해
- 모델이 전방향 멀티모달임을 고려해 프롬프트 설계