← 返回文章归档

AI 深度解读 2026.03.13

【深度解读】2026-03-13|Agent 时代,为什么检索层反而更重要了

大模型上下文越来越长之后,行业里流行过一个很顺耳的判断:既然模型都能塞进百万 token 了,向量数据库和检索层迟早会变成过渡方案。

这个说法听起来非常像技术演进故事里常见的那种爽文桥段:旧基础设施终将被更强的新范式一脚踢开。可问题是,真实世界的系统往往没这么配合剧情。

Qdrant 本周宣布完成 5000 万美元 B 轮融资,同时发布 1.17 版本。单看融资,这只是又一家 AI 基础设施公司拿到了钱;但如果把 VentureBeat 那篇报道认真读完,会发现它击中的不是“向量数据库热不热”,而是另一个更底层的问题:当 Agent 真开始跑,检索问题没有消失,反而变得更难了。

人和 Agent,根本不是同一种查询负载

Qdrant CEO Andre Zayarni 在文里说了一句很值得记住的话:人类用户每几分钟只会发起几次查询,而 Agent 为了做决策,可能每秒发起数百甚至数千次查询。

这句话的重要性在于,它直接把很多讨论从“模型能力”拉回了“系统负载”。

在传统 RAG 场景里,一次检索做不好,往往意味着回答差一点、慢一点,用户可能只是觉得结果不够聪明。但在 Agent 场景里,检索不再是给回答垫个脚,它本身就是行动链的一部分。Agent 会把一个任务拆成多个子问题,发起并行查询,做多轮重排,再把结果拼回去形成下一步动作。这个过程中,只要某一轮召回有明显缺口,错误就会被层层放大。

所以,长上下文确实重要,但它解决的主要是“模型能在一次会话里记住多少东西”,而不是“模型能不能稳定地在海量、持续变化的数据里找到它真正需要的那几条信息”。这两件事,看上去相邻,其实不是一回事。

为什么“记忆”替代不了检索

很多 AI 产品喜欢把自己的新能力叫作 memory,好像只要记忆够长、够聪明,就能把检索层慢慢吃掉。可从工程角度看,所谓记忆往往还是要落回向量存储、索引、召回、重排这些老问题上。

VentureBeat 那篇文章里,Qdrant 提出的三个典型失败模式很有代表性。

第一是召回失败不再只是体验问题,而是决策质量问题。在 Agent 任务里,漏掉一个关键文档,后果不是回答少一句,而是整个任务路径可能从一开始就偏了。

第二是写入压力和新鲜数据问题。很多企业数据在持续变化,新的文档、新的工单、新的状态会不断进来。如果索引更新不够快,Agent 用的就不是“过时一点的信息”,而是在关键时刻直接缺失重要信息。

第三是分布式系统中的延迟传导。人类用户可以忍受某一次工具调用慢两秒,但 Agent 在一轮操作里可能会并发打很多工具,只要一个副本明显变慢,整个回合都会被拖住。对自动执行系统来说,这不是“卡顿”,而是节奏断裂。

这就是为什么“更长的 context window”并不能直接终结检索层。它当然能减少一些简单场景下的外部检索需求,但到了真正做事的系统里,检索仍然是让 Agent 接触真实世界的入口。

[配图建议] 对比图:左侧是传统问答/RAG 模式,右侧是 Agent 模式中的并行查询、重排与工具调用链。图意说明:展示 Agent 为什么会把检索压力放大。

生产系统里,检索质量就是产品质量

文章里最有说服力的部分,不是概念,而是案例。

GlassDollar 的产品核心,是从数百万家公司里,为企业客户找出合适候选。它的做法不是“问一次、取一批、直接回答”,而是把一个自然语言请求拆成多个并行查询,从不同角度拉取候选,再组合、重排。这本质上就是典型的 agentic retrieval 模式。

迁移到 Qdrant 后,这家公司报告了两个非常硬的结果:基础设施成本下降约 40%,用户参与度提高 3 倍。这组数字当然依赖具体业务,不该被机械外推,但它足够说明一个现实:当搜索结果质量本身就是产品价值时,检索层根本不是可有可无的配角。

另一个例子来自专利诉讼领域的 &AI。它的系统要在横跨多年、多个司法辖区的海量文档中做语义搜索。对于这种场景,所谓“模型自己会总结”远远不够,因为律师最终需要的是可追溯、可引用、能落到真实文档上的结果。这里,检索不是生成前的装饰步骤,而是整个系统可信度的地基。

这轮基础设施竞争,拼的不是谁会说“Agent”

过去半年,“Agent”两个字已经被喊得有点廉价。谁都说自己在做 Agent,谁都说自己在做 autonomous workflow,好像只要把一层会调用工具的壳套在模型外面,新时代就已经到了。

但真正的分水岭,可能恰恰在这些不那么性感的底层环节:检索质量、索引更新、延迟控制、分布式观测、失败回退。也就是说,决定 Agent 能不能从 demo 变成生产力工具的,未必是它看起来有多聪明,而是它背后的检索层、执行层和状态层有多稳。

所以 Qdrant 这类公司的融资,不只是“资本还愿意投数据库”。更准确地说,资本正在重新押注一件事:当 AI 从对话走向执行,系统并不会变简单,只会更依赖那些过去被认为不够性感、却真正决定成败的基础设施。

长上下文没有杀死检索层。真正发生的事更残酷一点——它只是让大家更晚意识到,检索层其实还活得很好,而且责任更重了。