DeepSeek多模态模型对峙Opus 4.8:胜负难分但亮点频现

据ChainCatcher报道,DeepSeek最新发布的V4-Flash-Vision-Exp模型在多模态Agent任务中与Anthropic的Opus 4.8展开激烈较量,最终以2:2的战绩形成平局。该模型在Agents' Last Exam(27.3比25.7)和ZeroBench(35.0比34.0)两项关键指标中占据优势,展现出更强的综合推理与跨模态理解能力。

视觉增强版性能跃升,关键任务表现亮眼

相较于仅支持文本的V4-Flash-0731版本,集成视觉处理能力的V4-Flash-Vision-Exp在多项测试中实现显著进步。其中,ApexBench得分从26.2提升至36.5,Agents' Last Exam则由25.2攀升至27.3,反映出视觉信息融合对复杂任务决策的重要增益。

文本型Agent仍具压倒性优势,六项测试胜出

尽管在图表解析类任务中略显劣势——于ApexBench(36.5比39.4)与Chartography(64.3比65.0)落后于对手,但基于纯文本的Agent能力依旧强劲。在七项文本基准测试中,其六项超越前代版本,尤其在DeepSWE测试中取得59.3分,反超Opus 4.8的58.0,彰显其在语言理解与逻辑推演上的深厚积累。