
Qzone
微博
微信
2026 年 7 月 17 日至 20 日,世界人工智能大会(WAIC 2026)在上海举行。作为人工智能领域最具影响力的国际盛会之一,WAIC 2026 汇聚了全球顶尖 AI 企业与研究机构。
视觉智能公司 Chance AI在大会期间正式发布Chance Vision 1.5——新一代视觉推理智能模型。该模型在高难度多模态理解与推理基准MMMU-Pro的官方公开榜单中取得86.9% 的综合准确率,位列全球第一,达到该基准的SOTA(State of the Art,当前最佳水平)。
这一成绩超越了人类专家(85.4%)、GPT-5.4 Thinking w/ tools(82.1%)以及 Gemini 3.0 Pro(81.0%),标志着视觉推理领域的重要突破。
图1|Chance AI 亮相 WAIC 2026,将视觉推理能力带入真实展会环境
与此同时,Chance AI 将模型能力直接嵌入 WAIC 2026 的高密度真实展会场景,让现场观众通过一张照片即可完成展商识别、信息理解、要点提炼与结构化笔记整理,将视觉推理技术从实验室带入了可交互的现实世界。
图2|巴西人工智能协会(ABRIA)代表到访 Chance AI 展位
在 WAIC,把一次拍摄变成对现场信息的理解
上千家展商、密集的产品演示和专业术语同时出现,观众往往拍了大量照片,离开展位后却很难想起“这家公司是谁、产品解决什么问题、为什么值得关注”。传统搜索还要求用户先看清名称、组织关键词,再跳转到多个页面寻找答案。
Chance AI 在 WAIC 现场把这条路径压缩到一次拍摄。会前,用户可以根据 Agent、硬科技、机器人和初创项目等方向选择路线;进入展馆后,只需拍下展位、展板或设备,Chance AI 就会从画面中识别展商与产品,补全团队、技术和产品背景,提炼值得关注的要点,并整理成可以继续追问、收藏与分享的结构化笔记。
例如,当观众对准一台陌生机器人时,Chance AI 不只给出“这是一台人形机器人”的标签,还会继续理解现场展板、设备形态与上下文,说明它由谁开发、正在展示什么能力、与同类产品相比有哪些关注点。用户不必先知道应该问什么,摄像头本身就是理解现场的入口。
图3|观众使用 Chance AI 识别现场信息,并生成可以继续探索的结果
86.9% 登顶 MMMU-Pro,Chance Vision 1.5 达到 SOTA
Chance Vision 1.5是支撑上述现场体验的技术底座。MMMU-Pro并非普通的拍照识物测试,它覆盖工程图、地图、图表、化学结构等专业视觉材料,并通过删除不依赖图片即可作答的问题、增加干扰选项、引入Vision-only设置等严苛手段,重点考察模型能否真正结合视觉信息、专业知识与复杂推理完成任务。
Chance Vision 1.5以86.9%的综合准确率登顶该榜单,意味着其不仅在通用图像识别上表现优异,更能处理结构复杂、信息密集且需专业知识参与的视觉推理问题。WAIC现场的交互展示则进一步证明,这套高难度视觉推理能力完全可以转化为普通用户可直接体验的产品——无需预先组织问题,只需将摄像头对准眼前事物,AI就能从画面和上下文出发进行理解。
图4|Chance Vision 1.5 在 MMMU-Pro 视觉推理评测中取得 86.9% 综合准确率
从“看懂”到“行动”,Chance AI 公布 Visual Agent 的记忆
Chance AI 在发布 Chance Vision 1.5 的同时,公开论文《Memory-Conditioned Tool Calling for Camera-First Visual Agents》,首次系统披露个人记忆如何参与 Visual Agent 的工具选择与行动决策。研究发现,记忆并非在答案生成后附加一句“根据你的喜好”,而是会提前影响 Agent 调用什么工具、使用什么查询词、检索到什么深度,以及何时停止。
研究团队使用 800 张真实场景图片与受控构造的个人记忆,在视觉输入、基础模型和可用工具保持一致的条件下进行对照实验。移除三层个人记忆后,工具查询相关性从 4.21 降至 3.74,相对下降 11.2%;端到端任务效用从 0.842 降至 0.760,相对下降 9.7%。实验表明,即使面对同一张图片,不同用户真正需要的信息和下一步行动也可能完全不同。
例如,面对同一台机器人,行业从业者可能关注技术路线与供应链,投资人关注团队和商业化进展,普通观众则更想知道它能做什么。个人记忆的作用,是让 Visual Agent 不只识别眼前的对象,还能判断哪些信息与当前用户真正相关。
Chance AI 联合创始人兼 CTO 吴晓凡表示:“榜单验证的是 AI 能不能看懂复杂画面,真正的产品问题是,看懂之后它该查什么、为什么查,以及如何帮助用户完成下一步。视觉让 AI 看见世界,记忆让它理解眼前的人。”
图5|现场展示 Visual Agent 从视觉感知、实时推理到场景理解的多层能力
下一代方向:让摄像头成为 AI 理解现实世界的入口
从 Chance Vision 1.5 到个人视觉记忆,再到工具调用与多步执行,Chance AI 正在搭建一套完整的 Camera-First Visual Agent 技术路径:视觉模型负责理解复杂画面,记忆系统判断什么与用户相关,Agent 则将理解转化为查询、判断与行动。
目前,Chance AI App 是这套技术面向生活场景的第一阶段载体,覆盖旅行、消费、收藏、审美与生活问答等需求。截至目前,产品总用户数达 30 万,近 30 天 MAU 约 9 万,月安装量约 3.5 万;美国及 Tier 1 市场用户约占 MAU 的 40%—46%。
下一阶段,Chance AI 将把复杂视觉理解、行业知识推理和 Agent 流程编排能力延伸至视觉信息密集的生产力工具与垂直行业,让商品图片、设备照片、工程图、表单、视频和现场画面直接进入理解、查询、判断与后续工作流。长期来看,这套能力还将进入机器人、智能眼镜、可穿戴设备及其他智能硬件,使 AI 能够通过摄像头感知现实世界、理解人的意图,并在获得授权后参与真实行动。