DeepSeek的视觉模型V4-Flash-Vision-Exp在四项多模态代理评估中表现优于Opus 4.8的两个项目。在Agents' Last Exam中,V4-Flash-Vision-Exp获得27.3分,超过了Opus 4.8的25.7分,而在ZeroBench中也以35.0分领先于Opus 4.8的34.0分。然而,在ApexBench中,V4-Flash-Vision-Exp以36.5分未能达到Opus 4.8的39.4分,在Chartography中也以64.3分低于Opus 4.8的65.0分。与之前的文本模型V4-Flash-0731相比,V4-Flash-Vision-Exp在ApexBench的得分从26.2分上升至36.5分,Agents' Last Exam的得分也从25.2分增加到27.3分。DeepSeek解释称,V4-Flash忽视了多模态内容,得分的提升被解读为能够处理图像输入的效果。在七项文本评估中,V4-Flash-Vision-Exp在六项中得分高于V4-Flash-0731,DeepSWE的得分从54.4分上升至59.3分。在Toolathlon中,V4-Flash-Vision-Exp获得75.9分,与Opus 4.8的76.2分相差0.3分。这次基准测试是DeepSeek的自我测量,开发者的多模态模型选择范围得到了扩大。目前确认的公开数据表明,DeepSeek视觉模型在四项多模态代理评估中与Opus 4.8的战绩为2胜2负。
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

















