讲清 Agent 追踪的数据模型、OpenTelemetry 语义约定的真实状态、观测工具的取舍,以及轨迹评测、pass^k、LLM 评审的正确用法与已知偏差。
流水线、主管-工人、交接与群聊、辩论四种协作模式的适用边界,配 Anthropic 公开的 token 代价与实测数据,以及七个 Python 框架的版本现状。
从短期状态与长期记忆的分层讲起,拆解 LangGraph、LangMem、Mem0、Zep、Letta 的存储与检索设计,附真实的基准数字与可运行的 Python 代码。
工具调用是 Agent 可靠性的主战场。本文讲清三件事:工具描述怎么写才能减少选错、参数校验与错误分流怎么落地、并行调用在不同 provider 下的语义差异,并附可直接复用的 Python 代码和一份检查清单。
2026 年 Python Agent 框架格局已重排:AutoGen 进入维护模式,LangGraph 与微软 Agent Framework 先后发布 1.0。本文用官方数据对比各方案定位与适用场景,附选型顺序。