DeepSeek多模态模型对峙Opus 4.8:胜负难分但亮点频现
据ChainCatcher报道,DeepSeek最新发布的V4-Flash-Vision-Exp模型在多模态Agent任务中与Anthropic的Opus 4.8展开激烈较量,最终以2:2的战绩形成平局。该模型在Agents' Last Exam(27.3比25.7)和ZeroBench(35.0比34.0)两项关键指标中占据优势,展现出更强的综合推理与跨模态理解能力。
视觉增强版性能跃升,关键任务表现亮眼
相较于仅支持文本的V4-Flash-0731版本,集成视觉处理能力的V4-Flash-Vision-Exp在多项测试中实现显著进步。其中,ApexBench得分从26.2提升至36.5,Agents' Last Exam则由25.2攀升至27.3,反映出视觉信息融合对复杂任务决策的重要增益。
文本型Agent仍具压倒性优势,六项测试胜出
尽管在图表解析类任务中略显劣势——于ApexBench(36.5比39.4)与Chartography(64.3比65.0)落后于对手,但基于纯文本的Agent能力依旧强劲。在七项文本基准测试中,其六项超越前代版本,尤其在DeepSWE测试中取得59.3分,反超Opus 4.8的58.0,彰显其在语言理解与逻辑推演上的深厚积累。
声明:本站所有文章内容,均为采集网络资源,不代表本站观点及立场,不构成任何投资建议!如若内容侵犯了原著者的合法权益,可联系本站删除。
币安 Binance
币安交易所是全球加密货币交易所,注册奖励 500 U
