目录

Deep Research:大模型如何化身全栈 AI 科学家

随着 OpenAI 和 Google 先后推出 Deep Research(深度研究) 功能,大语言模型(LLM)的能力边界再次被大幅拓宽。Deep Research 不仅仅是一个“能上网搜资料的聊天机器人”,它是一个闭环的自主工作流(Closed-loop workflow)

它能够接收复杂的研究问题,自主规划查询、从海量异构数据源中获取并过滤证据、维护和修正工作记忆,最终合成带有明确引用的长篇研究报告。本文将带你系统性地拆解 Deep Research 的技术演进与四大核心组件,并深入解析背后的代表性前沿算法。


1. 什么是 Deep Research?

Deep Research 的演进可以分为三个阶段:

  1. Agentic Search(智能体搜索):专注于找到正确的来源并提取答案,进行最少的综合(如多跳问答 HotpotQA)。模型需要具备在互联网上持续浏览和辨别事实的能力。
  2. Integrated Research(综合研究):超越孤立的事实,通过迭代的“子问题规划-检索-综合”循环,生成连贯的结构化报告(如市场分析、复杂行程规划)。
  3. Full-stack AI Scientist(全栈 AI 科学家):超越信息聚合,能够提出假设、进行实验验证或消融实验、批判现有主张并提出新视角(如自动化论文评审、科学方程发现 LLM-SRBench)。

与传统 RAG(检索增强生成)的区别:

  • 灵活的数字世界交互:传统 RAG 依赖静态的预索引语料库,而 Deep Research 能主动与动态环境(搜索引擎、Web API、代码执行器)进行多步工具交互。
  • 长视距规划(Long-horizon Planning):能够自主规划、修正并优化工作流,管理复杂的任务上下文。
  • 可靠的语言接口:引入了可验证机制,将自然语言输出与底层证据对齐,极大减少了开放式任务中的幻觉。

2. 核心组件一:查询规划(Query Planning)

面对复杂问题,Deep Research 的第一步是查询规划:将逻辑复杂的问题分解为结构化的、可执行的子查询(Sub-queries)序列。

2.1 并行规划(Parallel Planning)

一次性将原始查询重写或分解为多个子问题,然后并行处理。优点是效率极高,缺点是缺乏迭代反馈机制,忽略了子查询之间的逻辑依赖。

  • Least-to-Most Prompting:通过 Few-shot 引导大模型将复杂任务分解为有序的、自包含的简单子问题。
  • Chain-of-Verification:先并行生成多个独立的子问题,再分别为每个子问题寻找可靠的证据进行交叉验证。
  • DeepRetrieval:摒弃传统的“检索-阅读”范式,训练一个小语言模型作为重写器(Rewriter),并通过强化学习(结合召回率、NDCG@k 等下游指标)对其进行优化。
  • MMOA-RAG:将查询重写、文档检索、选择和生成视为多智能体系统中的独立 Agent,利用多智能体强化学习(MAPPO)对齐全局奖励(如最终答案的准确率)。

2.2 顺序规划(Sequential Planning)

通过多轮迭代分解查询,每一轮的分解都建立在上一轮输出的基础之上。适合需要逐步消歧的复杂任务,但过长的推理链会导致极高的计算成本和错误累积。

  • LLatrieval:一个迭代式规划器。当检索到的文档无法通过验证时,要求 LLM 指出缺失的知识并生成新查询,直到积累的上下文足以支撑答案。
  • DRAGIN:基于注意力机制的动态检索。利用自注意力分数(Self-attention scores)从整个生成历史中挑选最相关的 Token,以此来构建精准的查询词。
  • RAISE:专为科学推理设计,逐步分解科学问题并生成具有逻辑感知的查询,检索特定步骤的知识来驱动规划。
  • Search-R1:结合思维链(CoT)动态决定何时搜索及如何搜索。采用“检索 Token 掩码”技术,避免模型因直接复制搜索结果而受到惩罚或奖励,专注于最终结果的准确性。

2.3 树状规划(Tree-Based Planning)

结合了并行与顺序的优势,将子查询构建为树(Tree)或有向无环图(DAG),并使用高级搜索算法进行探索和剪枝。

  • RAG-Star:利用蒙特卡洛树搜索(MCTS),通过 UCT 准则选择最有潜力的节点,利用奖励模型评估扩展质量并反向传播得分,逐步生长出一棵推理树。
  • DeepSieve:将复杂查询分解为 DAG,LLM 作为知识路由器(Router)为每条路径选择数据源,失败时触发重新路由或重新分解。
  • DeepRAG:将决策过程结构化为二叉树(检索 vs 内部推理)。引入“校准链(Chain of Calibration)”让模型评估自身推理的可靠性,当自我评估显示高度不确定时才触发检索。

3. 核心组件二:信息获取(Information Acquisition)

在明确了要查什么之后,下一步是如何获取并过滤信息。

3.1 检索工具(Retrieval Tools)

除了传统的词汇检索(BM25)、语义检索(Dense Retrieval)和商业网络搜索(如 WebGPT)外,多模态检索(Multimodal Retrieval) 正在成为前沿趋势:

  • LayoutLM / Donut(结合布局的文本检索):LayoutLM 结合了文本、布局边界框和 Faster R-CNN 视觉特征;Donut 则是无 OCR 的端到端框架,直接将文档图像映射为 JSON 结构。
  • CLIP / BLIP(图文相似度检索):CLIP 通过 4 亿对图文的对比学习实现零样本迁移;BLIP 引入了 CapFilt(字幕生成与过滤)机制,通过自举(Bootstrapping)提升预训练数据质量。
  • ChartFormer(结构化感知检索):采用端到端实例分割识别图表元素(柱状、折线、图例),并通过问题引导的可变形共注意力机制聚焦相关图表区域。

3.2 检索时机(Adaptive Retrieval)

每次检索都会带来计算开销,且低质量的文档会误导模型。**自适应检索(Adaptive Retrieval)**旨在让模型“知道自己不知道”,仅在知识不足时触发检索。

  • FLARE(概率策略):迭代生成临时句子,若包含低概率(低置信度)的 Token,则触发检索并重新生成。
  • Rowen(一致性策略):评估模型在不同语言或不同单次生成下的语义一致性,若出现分歧则触发外部检索以纠正幻觉。
  • CtrlA(内部状态探测):提取 LLM 内部状态中的“诚实(Honesty)”和“自信(Confidence)”特征方向,在推理时监控置信度水平以触发检索。
  • Self-RAG / Search-o1(显式声明策略):Self-RAG 通过师生蒸馏训练模型生成特定的反思 Token(如 [Retrieve], [IsSup]);Search-o1 则在检测到知识盲区时暂停,触发搜索并使用“文档内推理(Reason-in-Documents)”提炼事实。

3.3 信息过滤(Information Filtering)

互联网充满了噪音,未经清洗的内容极易引发大模型的幻觉。

  • 文档选择(Document Selection):对候选文档进行重排序(Re-rank),仅保留 Top-k 最有用的文档。
  • RECOMP / xRAG(内容压缩):RECOMP 将长文档压缩为文本摘要;xRAG 实现极端上下文压缩,将整个文档的 Dense Embedding 投影为一个“软 Token(Soft token)”直接输入 LLM,完全跳过长文本处理。
  • HtmlRAG(基于规则的清洗):剔除网页中无语义的 CSS 和 JS 代码,并结合双阶段块树剪枝(Block-tree pruning)保留结构化 HTML 供模型阅读。

4. 核心组件三:记忆管理(Memory Management)

在漫长的研究过程中(可能耗时数小时),Agent 必须维护连贯的上下文。这依赖于强大的记忆管理机制。

4.1 记忆巩固(Consolidation)与索引(Indexing)

  • MemoryBank(非结构化巩固):存储过去的对话、总结的事件和用户画像,打造类似 SiliconFriend 的 AI 伴侣。
  • HippoRAG(结构化巩固):受神经生物学启发,利用 LLM(新皮层)抽取知识图谱三元组,通过图上随机游走(海马体)实现模式补全(Pattern completion)。
  • A-Mem(图索引):采用图索引,Agent 自主链接相关的记忆节点,逐步生长出灵活的访问网络。

4.2 记忆更新(Updating)与遗忘(Forgetting)

  • Mem0(非参数化更新):通过显式的 Tool Call(如 DELETE, ADD)操作外部数据库,灵活性高。
  • Memory-R1(参数化更新):通过强化学习训练记忆管理器,用单一的 UPDATE 指令整合事实,避免了传统管理器容易导致的记忆碎片化问题。
  • MemGPT(被动遗忘):遗忘是过滤噪音的关键机制。MemGPT 采用 FIFO(先进先出)队列,模拟人类记忆的自然衰退,自动将最旧的对话消息从主上下文中移出至长期存储。

5. 总结

从简单的 Agentic Search 到能够自主提出假设并验证的 Full-stack AI Scientist,Deep Research 正在重新定义 AI 的生产力上限。

它通过查询规划拆解复杂问题,利用自适应的多模态检索精准获取信息,依靠动态的记忆管理维持长视距的思考,最终生成带有严谨引用的高质量报告。在未来,随着强化学习在搜索和推理中的进一步融合,Deep Research 必将成为科研工作者和专业人士不可或缺的超级数字大脑。