多模态 Agent 协同流:如何设计一套能自我纠错的任务拆解方案图文混合输入最容易让 Agent“看起来会做,实际做错”。一张财报截图里,数字可能因为分辨率、表格线或单位标注而被误读;配套文字又可能限定了统计口径、时间范围或对比对象。若系统把识别、计算、判断和生成...AI智能# 图像识别# 多模态2个月前510
大模型基准分数很高,为什么日常视觉小任务仍可能出错评估大模型能力时,绝大多数人首先会去看基准测试排行榜。一个模型在各类榜单上拿到高分,给人的第一印象就是“视觉能力强”。但当你真的把它接入一个简单的识别任务——比如从一堆零件中挑出特定形状、判断一张照片...AI智能# 多模态# 多模态大模型# 大模型2个月前470