DeepSeek는 목요일 V4.1-Flash 모델을 출시하며, 입력에 8B, 출력에 16B의 활성 파라미터를 사용하는 552B 파라미터 Mixture-of-Experts 아키텍처를 선보였다.
이 모델은 새로운 Causal Encoder-Decoder 아키텍처를 사용하며 시각적 이해를 포함한 네이티브 멀티모달 입력을 지원한다고 성명에서 밝혔다. DeepSeek는 V4.1-Flash가 새로운 아키텍처 제품군 중 가장 작은 모델이라고 말했다.
회사는 모델의 KV 캐시 용량이 줄어든 것이 핵심적인 변화라며, V4.1-Flash는 이전 세대가 사용한 HBM의 4분의 1과 SSD 저장 공간의 8분의 1만 필요로 한다고 덧붙였다.
회사에 따르면 더 작은 캐시는 에이전트형 워크로드의 저장 공간 요구량을 줄인다. 이러한 워크로드에서는 캐시 적중 비용이 전체 사용 비용에서 상당한 비중을 차지할 수 있다.
V4.1-Flash는 현재 DeepSeek의 API를 통해 이용할 수 있으며, 기존 V4-Flash와 V4-Flash-Vision-Exp 모델은 중단됐다. 호환성을 위해 해당 모델의 API 이름으로 전송된 요청은 일시적으로 V4.1-Flash로 라우팅된다.
특히 V4.1-Flash는 여러 기관의 테스트에서 성능, 비용, 속도, 총 실행 시간 부문에서 V4-Pro를 앞섰으며, 이에 따라 회사는 후자를 단계적으로 폐지하고 있다.
다음 주 Sept. 14 04:00 UTC부터 DeepSeek는 V4 Pro로 전송되는 모든 요청을 V4.1-Flash로 라우팅하고 최신 모델 요금으로 청구한다. 성명에 따르면 이 조치는 DeepSeek가 V4.1-Pro를 출시할 때까지 유지된다.
회사는 V4.1-Flash API 가격을 조정했으며, 비혼잡 시간대 요금은 혼잡 시간대 가격의 절반으로 책정됐다. 새로운 가격은 Sept. 10 04:00 UTC부터 적용됐다. Tencent의 WorkBuddy와 CodeBuddy, 그리고 OpenCode가 이제 해당 모델을 지원한다.
