从视觉架构基础(ViT, CLIP)到大型多模态模型(LMMs),再到能够在真实网页中进行视觉定位与树搜索的 Multimodal Agents,全面解析多模态智能体的演进与挑战。
介绍 DeepSeek Native Sparse Attention(NSA)和 DeepSeek Sparse Attention(DSA)的设计动机、核心结构、硬件实现思路和二者差异。
从 Agentic Search 到全栈 AI 科学家,全面解析 Deep Research 的四大核心组件:查询规划(Query Planning)、信息获取(Information Acquisition)、记忆管理(Memory Management)与答案生成。详细拆解 RAG-Star、HippoRAG、Self-RAG 等前沿代表性方法。
CUDA Micro-benchmark 系列(下):建立可靠的 GPU 测量方法,测试计算吞吐与显存带宽,并用 Inline PTX、WGMMA 和 TMA 理解 Hopper 的异步执行流水线。
CUDA Micro-benchmark 系列(上):理解 CUDA 源码如何变成 PTX/SASS,建立 Warp 调度模型,并用 Nsight Compute 从高层瓶颈逐步定位到 Source 与机器指令。
全面解析数学大模型的前沿进展:从 SFT 与 GRPO 强化学习的当前配方,到形式化数学(Lean)的引入,深入拆解 AlphaProof 的工作流、符号推理剪枝(LIPS)与自动形式化(Autoformalization)的评估挑战。