tech
AI 最大的瓶颈,不是不会做事,而是不会记得你
- 技术
- 观点
你让 AI 订机票,它查了。
你让它再订一次酒店,它忘了你刚才说自己恐飞,推荐的全是跨城特价航班套餐。
这不是一个比喻。美团 LongCat 团队刚刚放出了一份基准测试,他们给 56 个”虚拟人”每人配了一个 AI 助理,拉长到平均 4.3 年、最长超过 8 年的互动周期。但这个结论和直觉相反。
模型接上记忆之后,不少场景得分不升反降。而当需要主动问一句”我还缺什么信息”时,Claude 家族的平均分从 46.0 直接跌到 27.4。
说白了,现在最强的 AI 模型,你让它用工具、做推理、写代码——它都能干。但你让它记住一个会变的人,它不会。

四年。819 个任务。一个”你是不是真的认识我”的考试
这份基准叫 VitaBench 2.0。它不是问 AI “今天北京天气怎么样”那种一问一答,而是模拟了 56 个真实特征的用户,每个人有自己的职业、家庭结构、消费习惯和说不出口的偏好——比如”带孩子出门时倾向于选有儿童餐的餐厅”或者”上次出差被噪音吵到之后开始只订高层房间”。
这些偏好不是一次性写死在用户档案里的。它们被埋在对话记录、浏览历史、下单行为里,像真实生活一样碎片化。平均每个用户的偏好会发生超过 48 次动态变化——旧习惯消失、新习惯出现、原本爱吃辣的突然开始养胃。
总共 819 个可执行任务,跨送餐、到店消费和在线差旅三个真实场景。每个用户平均有 2093 个交互事件。时间跨度平均 1580 天,最长的一个用户轨迹拉到 2974 天——超过 8 年。
你不需要知道底层评测框架是什么。你只需要知道:这是一场”AI 能不能在四年的碎片信息里,搞清楚你是个什么人”的考试。
记忆,不是装上去就管用的
一个最违反直觉的发现是:记忆系统装上去之后,在很多场景下,模型表现反而更差了。
VitaBench 2.0 设了三组对比——不给记忆,直接读全量历史(Full Context);让 AI 自己决定记什么忘什么(Agentic Memory);用一个外部搜索引擎检索历史片段(RAG Memory)。结果:
Claude-Opus-4.6,Full Context 模式下平均得分 0.503。接上 Agentic Memory,掉到 0.454。换成 RAG Memory,再掉到 0.430。
GPT-5 同理:0.441 → 0.421 → 0.410。
这不是一两个模型的个例。全文 17 个模型,大部分在接上记忆模块后得分都比”直接读全历史”低。
为什么会这样?因为记忆系统引入了两个新问题。一是记错了——Agentic Memory 在更新用户画像时会扭曲或丢失信息,累积久了偏差越来越大。二是检索不到——RAG Memory 靠相似度匹配返回历史片段,但相似度不等于相关性,经常召回一堆表面相关、实际对当前决策没用的内容。
说白了,你给 AI 装了个”记笔记”的功能,结果它记的东西要么是错的,要么翻出来也用不上。
这不是记忆本身没用。而是现在的记忆机制还不够好。

一个更大的问题:AI 不会主动问
记不住还能补。不会问,就永远补不上。
VitaBench 2.0 专门设计了一类”主动性任务”——场景里故意缺关键信息,模型必须意识到”我不知道”才能做出正确决策。比如用户说”帮我订个酒店”,但没说预算、没说日期、没说几个人。这时候 AI 需要停下来问一句,而不是直接猜。
结果:全部模型家族在这类任务上得分断崖式下跌。Claude 家族从 46.0 降到 27.4。其他家族模式一致:主动提问能力远落后于偏好理解能力。
Anthropic 自己在今年 3 月发过一篇工程博客,讲他们给 Claude 加了一个叫”think”的工具——专门在复杂的工具调用链里制造一个停顿,让模型停下来检查”我缺什么信息”。用了之后在客服场景里提升了超过 50% 的策略遵循能力。
这说明一件事:连 Anthropic 自己都知道”停下来想一想我是不是漏了什么”是当前模型的一个系统性短板。VitaBench 2.0 只是用数据证实了这个判断:不是某一个模型的问题,而是这一代模型在架构层面就不擅长”意识到自己不知道”。
工具学会了,人才是问题
DeepSeek 家族的数据里藏着一个更深刻的信号。
研究团队把模型的失败拆成两类:A 类(工具使用错误——选错 API、填错参数)和 B 类(偏好理解错误——没抓到用户想要什么、用了用户已经不再用的旧偏好)。
从 DeepSeek-R1 升级到 DeepSeek-V4-Pro 之后,A 类错误显著减少,B 类错误占比反而上升,变成了主要失败原因。
这不是退步。这是瓶颈转移。模型越来越会用工具了,但”理解一个正在变化的人”的能力没跟上。工具调用能力提升得越猛,个性化的短板就暴露得越彻底。
还有一组数据印证了这个结论。研究人员直接把用户的真实偏好喂给模型——不需要它自己从历史里提取,偏好直接写在 prompt 里。结果呢?多数模型仍然失败。
问题不在”知不知道你喜欢什么”,而在”知道了之后能不能用对”。
你告诉它你恐飞。它记住了。但它不知道”恐飞”意味着订酒店的时候应该避开机场旁边。它不知道”恐飞”在你的旅行决策里的优先级高于”价格最低”。它不知道这是一个持续偏好还是一个临时状态。
研究团队在论文里把这种困境精确地拆成了三个环节:提取偏好、利用偏好、更新偏好。现在最强的模型在第一环节已经不算太差——你给足上下文,它能猜个七八成。但在第二和第三环节,也就是”猜对了之后怎么用”和”用户变了之后怎么跟着变”,差距还很远。
这就解释了为什么即使把真实偏好直接喂给模型,分数也提不上去。就像你给一个新人看了你过去四年的所有消费记录和聊天记录——他”知道”你喜欢什么,但他不知道在”今天下午五点、外面下着雨、你刚开完一个让人烦躁的会”这个具体场景下,你真正想吃什么。
这就是当前 AI 和”一个真正了解你的人”之间的差距。
10 分钟后 vs 10 个月后 vs 10 年后
10 分钟后,你打开 ChatGPT 问一个问题,它不会记得你上一轮说了什么——除非你自己提。
10 个月后,也许你的 AI 助理能记住你喜欢的餐厅类型,但它大概率记不住你这十个月里口味变了三次,也记不住”不吃香菜”这个偏好的优先级高于”推荐评分高的餐厅”。
10 年后,如果这个问题没解决,我们拥有的将是一个工具使用能力登峰造极、但对人的理解仍然停留在”问答匹配”层面的 AI——它会帮你写代码、做表格、分析财报,但当你说”帮我想想办法”的时候,它给的建议和给任何一个陌生人的建议没有区别。
LongCat 团队在博客最后写了一句话:“从单点任务到长期陪伴,从被动执行到主动沟通。“前八个字说的是过去五年 AI 在做的事——越来越会执行。后八个字说的是未来五年 AI 必须学会的事——从”会做”到”会懂”。
下一轮 Agent 竞争,比的不是”会不会调用工具”,而是”能不能持续理解一个会变化的人”。
如果你正在关注 AI 行业,这是最值得盯的一个赛道。不是模型能力提升——那个天花板还远。是连接方式和持续理解——这个差距就在眼前,而且有基准测试、有数据、有可验证的短板。
幸知 / 2026-07-24 / 信源:美团 LongCat VitaBench 2.0(tech.meituan.com + arxiv 2605.27141 + vitabench2.github.io);Anthropic “think” tool Engineering Blog。
如果你觉得这篇文章值得转给在做 AI 产品或关注智能体方向的朋友,欢迎转发。每次看到真正有数据支撑的反直觉结论,都值得被更多人看见。