全面解析 Tool Agents 的核心架构:从 Toolken 词表注入与 CodeAct 代码执行,到 DocPrompting 与 Toolformer 的工具学习,再到视觉打标(Set-of-Mark)与智能体的自主环境探索。
从代码生成的基准测试(如 SWE-bench)、智能体框架(SWE-agent、Agentless)到代码大模型的训练与安全,全面解析 Coding Agents 的前沿进展。
从 Agent 与 Language Agent 的定义与三代演化讲起,分别展开记忆(情节/语义/程序、RAG、HippoRAG)、推理(ReAct 与行动交织)与规划(反应式、树搜索、世界模型与 WebDreamer),最后串联全景并呼应 Bitter Lesson。
从 CoT 与类比提示到 Self-Consistency、ORM/PRM 验证、思维树,再到多轮自反思与 token 预算分配,呼应 Bitter Lesson。
从 reward 设计、policy gradient、PPO 到 RLHF/RLVR,再讲推理阶段多采样与验证、Archon 架构搜索,以及何时用 RL 何时用 test-time scaling。
从预训练与算力、提示工程、微调到强化学习,概览大模型训练与使用的核心方法。