前几周在刷 X/Twitter 的时候,看见李博杰在推自己的新书《AI Agents in Depth》。

本来不是特别想入坑,因为之前看过一些 Agent 研发相关的教程,觉得对于上下文工程、工具、Agent Loop 等都有一定的认识,现在还没有到复习功课的时候。但是,看了一眼目录以后还是被吸引了:除了常见的构建 Agent 的知识,章节里面还有 Agent 评估、多模态与实时交互、Agent 的持续进化等我自己比较感兴趣、还在研究的内容,也就不知不觉入坑看了起来,甚至还推荐给了同事。
今天看完了。书里的技术内容这里就不复述了,想看干货的可以直接去读原书;这篇只写几点感悟:这本书的作者是怎样一个人、它怎么让我对"动手"这件事有了新的理解,以及为什么我觉得你也该翻一翻。
这本书值得翻一翻 Link to heading
先回答一个问题:Agent 教程看了一堆,这本书还有什么可看的?
对我来说,一是它讲了教程很少覆盖的"下半场"。至少在我看过的资料里,大多止步于把上下文工程、工具、Agent Loop 讲清楚,而 Agent 评估、多模态与实时交互、Agent 的持续进化这些真正决定能不能产品化的内容,很少被系统地讲过——这几个恰好是我在折腾的课题,所以目录一眼就把我勾住了。
二是它是工程和研究双料的。书里不仅包含 Agent 构建工程方面的内容,还有大量关于 AI/LLM/Agent 的前沿研究内容,两者结合起来娓娓道来,读起来既知道怎么做,也知道为什么。
适合谁读呢?我觉得是像几周前的我这样,做过一点 Agent 开发、自觉"上下文工程、工具、Loop 都了解了"的人——这本书会告诉你,水位比你想的高。
天才是怎么炼成的 Link to heading
恕我孤陋寡闻,知道李博杰还是因为他在 Twitter/X 上炮轰 DeepSeek 的面试流程,后来就开始关注他的动态,直到读了这本书,我可能才对他为什么叫天才少年有了一定的感知。后来我了解到,他的专业其实主要是在网络系统而不是人工智能,半路出家还能快速达到这种水平,我只能表示 orz 了。
上一个能给我这种感觉的还是季逸超:做研究而不木讷,做技术还非常有产品思维……遂我一直有个疑问,他们到底是怎么做到的,一方面在领域内有深刻的认知,另外一方面仿佛半个圈子(夸张)都是他们的好友。所以我问了 Kimi,它给的答案比网上大部分"天才论"都有意思,概括起来是三点:
一是完整闭环的经验都在极早期就建立了。季逸超高中时一个人完成猛犸浏览器,后来又打造了Magi 知识图谱搜索引擎等;李博杰博士期间从问题定义到系统实现到论文写作全程自己扛。闭环经验让人对"一个东西从想法到落地"的每个环节有直觉——所谓横跨领域,本质是抽象能力在多个领域的复用。
二是理论永远被真实问题驱动。季逸超做搜索引擎才去啃信息检索和知识图谱;李博杰在华为做训练基础设施和灵衢 UB 互联架构,被逼着同时懂分布式系统、网络协议、编译器和硬件,知识体系是"垂直贯通"的:从应用层 Agent 到框架到互联协议到芯片,每一层都亲手做过。
三是逆共识下注,靠判断而非跟风。李博杰两次职业选择都是逆势:2025 年大家追预训练时他去做 Agent 应用,2026 年 Agent 最热时他转向基础模型。
读完最大的感受反而是:这根本不是"天才"叙事,而是一条普通人也能走的路,只是要走得更久——先在一个真实的、要交付的系统里把自己逼到认知边界,再主动挪到信息密度最高的位置去补课。
大模型来了以后,软件行业的同仁都非常焦虑会被 AI 替代掉,但是这两年虽然 LLM、Agent、Harness、Loop 的进一步增强,能做的事情更多更好了,我仍然能看到人在软件工程中输入的价值、做设计的价值、做 Harness/Loop 工程的价值等等。而且我想,光焦虑是没有用的:与其担心被替代,不如照着上面这条路加强自己的专业长板,不断加长到行业 top,除非行业没有了,否则永远有你的一席之地。
纸上得来终觉浅 Link to heading
刚好前两天跟同事聊天,聊到了关于技术认知深度的问题,我们不约而同地感慨:一方面还是要持续不断地学习,另一方面在学习的过程中不能只是了解个概念,还是要下手尝试才能有更深刻的认知。
我就是个先反面后正面的例子。大学转专业的时候,想先练习一点编程的技巧,就找了一本 C++ 教程来看。因为那时候周围没有同行,没人指点,每天苦哈哈学 C++ 的各种概念和写一点 CMD 程序,总是提不起兴趣。直到我了解到 Java 和 Web 前端,突然能直接而快速地感受到构建的快乐,才学了下去。也感谢当时那位在网上讲 Java 课的老师,除了编程语言、设计模式、外围的知识以外,还把 Hacker 文化带给了我,让我工作的时候还能充满快乐而不觉得枯燥。
今年读这本书,同样的感觉又来了一遍。年初到现在我一直在折腾 Vibe Coding 的一些小项目,之后其实也一直没有停,还折腾了几个自己做的记忆系统、语音输入法等。这些项目的代码都不是我写的,但是记忆系统中的记忆怎么分类、什么时机提取、怎么存储,语音输入法里的 VAD(怎么判断人是真的在说话),每一个我都遇到过、做过取舍。所以读到我感兴趣的那几个章节时,体验完全不是"学新知识",更像是"对答案":自己踩过的坑,书里给了更系统的说法;书里提的方案,我马上能联想到自己哪里做得不对。开头吸引我的那几个点里,持续进化和多模态实时交互都在自己的项目里先撞见过一遍——要是没有这些实践打底,这本书对我大概也就是一本"写得不错的教程"。
前几年一直在管理方面下功夫,感觉颇有收获。今年明显感觉在技术视野上有些力不从心,所以翻过头来继续做一些技术面的补充。虽说如此,一直以来我都避免太陷入技术底层,能做到产品规划/设计的时候够用即可,但是大模型和智能体这个领域的技术太新,如果对底层没有认知就去做,基本上就是撞运气。跌跌撞撞到现在,突然想起很早以前一位朋友说的:新技术还是要学的,哪怕不用!
写在最后 Link to heading
如果你也在做 Agent 相关的事情,这本书值得放进你的书单;如果暂时不做,把它当成一份当前 Agent 工程水位的快照翻一翻,也不亏。
对了,这本书里面提到的《图解大模型》也是一本理解大模型的好书,通过偏直白的方式让我这个门外汉理解了大模型的底层原理,在几个课题中都受益匪浅,可以当成前置或者搭配阅读。