DeepSeek 시각 모델 다중 모달 에이전트 능력이 Opus 4.8에 근접하여 4개 항목이 2:2로 타결되었습니다
DeepSeek가 V4-Flash-Vision-Exp 첫 번째 에이전트 점수를 발표했습니다. 4개의 다중 모달 에이전트 평가에서 Opus 4.8과 2승 2패를 기록했습니다: Agents' Last Exam 27.3 대 25.7, ZeroBench 35.0 대 34.0; ApexBench 36.5 대 39.4, Chartography 64.3 대 65.0.
순수 텍스트 버전 V4-Flash-0731과 비교할 때, 시각 버전은 ApexBench에서 26.2에서 36.5로 상승했으며, Agents' Last Exam은 25.2에서 27.3으로 상승했습니다. 공식적으로 순수 텍스트 버전은 다중 모달 콘텐츠를 무시한다고 명시되어 있어, 주로 시각 입력 후의 능력을 반영합니다. 시각을 추가한 후 텍스트 에이전트의 능력은 크게 감소하지 않았으며, 7개의 텍스트 평가 중 6개가 V4-Flash-0731보다 높았습니다. 예를 들어 DeepSWE는 54.4에서 59.3으로 상승했으며 (Opus 4.8의 58.0을 초과), Toolathlon은 75.9로 Opus 4.8의 76.2에 거의 근접했습니다.
이 결과는 DeepSeek 공식 자가 측정에서 나온 것이며, 제3자 독립 목록이 아닙니다; 공개된 Code Agent 텍스트 작업은 DeepSeek Harness의 극소형 모드에서 수행되었으며, 추론 단계는 max입니다.







