AI 모델 벤치마킹 기업 Artificial Analysis는 DeepSeek의 최신 경량 V4-Flash 모델 버전에 대한 점수를 이번 주 공개했다. 이 모델은 금요일에 공개 베타에 들어간 뒤였다. 놀랍게도 중국 개발사의 가장 저렴한 모델은 이 플랫폼의 Intelligence Index에서 50점을 받아 플래그십 모델인 DeepSeek V4 Pro-Preview보다 6점 높은 점수를 기록했다.

DeepSeek는 여전히 미국의 주요 모델보다 훨씬 저렴하다. 미국의 경쟁사들은 최근 몇 달 동안 이 격차를 좁히기 위한 조치를 취해 왔으며, 그중에서도 OpenAI는 출시 불과 며칠 만에 자체 저가 모델의 비용을 80% 인하했다. 그럼에도 DeepSeek 모델은 입력 토큰 100만 개당 0.14달러, 출력 토큰 100만 개당 0.28달러로 여전히 GPT-Luna보다 60% 저렴하다.

Flash가 지능 측면에서 Pro-Preview를 앞선 이유

DeepSeek가 공개한 업데이트 로그에 따르면 Flash의 최신 버전은 올해 4월에 출시된 이전 버전과 기본 아키텍처 및 규모가 동일하다.

변경된 부분은 학습 후 개선 과정이었다. 플래그십 V4-Pro-Preview API는 그대로인 반면, Flash API는 대대적인 개편을 거쳤다. 그 결과 "에이전트 기능이 크게 향상됐으며, 벤치마크 결과가 V4-Pro-Preview를 크게 뛰어넘었다."

에이전트 기능은 AI 모델에서 점점 더 중요한 벤치마크가 되고 있으며, 이는 기본적인 챗봇 기능을 훨씬 넘어선 모델의 확장된 능력을 반영한다. 에이전트 기능은 코드 작성 및 테스트와 같은 복잡한 다단계 작업을 처리하는 모델의 능력을 의미한다.

AI 벤치마킹 기업 Artificial Analysis는 최신 모델에 대한 DeepSeek의 결과를 뒷받침했다. 독립 테스트에서 Flash는 명령줄을 얼마나 잘 작동하는지 측정하는 테스트인 Terminal-Bench 2.1에서 이전 버전보다 17 포인트 상승했다.

금융, 엔지니어링, 의료 등 여러 분야의 실제 업무를 평가하는 Artificial Analysis의 테스트 GDPval-AA v2에서 모델 점수는 1,189에서 1,559로 상승했다.

이 결과는 V4-Flash의 에이전트 기능이 실제로 크게 향상됐음을 시사한다.

DeepSeek V4-Flash가 여전히 부족한 부분

DeepSeek 모델이 눈에 띄는 개선을 이뤘지만, 여전히 시장 선두와는 거리가 멀다. Anthropic의 Claude Opus 4.8은 DeepSeek가 직접 공개한 모든 벤치마크에서 여전히 앞서고 있으며, 또 다른 중국 개발사 Moonshot은 Kimi K3 모델로 오픈 웨이트 모델 부문에서 여전히 선두를 달리고 있다.

Artificial Analysis의 보고서에는 V4-Flash가 정답이 아닌 응답 중 84%에 달하는 높은 환각률을 보인다는 경고도 포함됐다. 이는 정답을 제공할 수 없는 경우 V4-Flash가 대체로 답변을 거부하기보다 틀린 답변을 하는 쪽을 선호한다는 의미다. 벤치마킹 업체는 최신 버전이 이전 버전보다 추측에 기반한 답변을 만들어내는 비율이 낮아졌지만, 그 비율은 여전히 높은 수준이라고 지적했다.

또 다른 잠재적 단점은 모델의 장황한 특성이다. 테스트 중 Intelligence Index 전체 테스트 시리즈에서 약 2억 600만 개의 출력 토큰을 생성한 것으로 알려졌다. 이는 중앙값의 두 배를 넘는 수치로, 실제 모델 사용 비용이 표시된 요금보다 높아질 수 있음을 의미한다.