News

智能体跑长任务为何"失忆跑题":AWS、Claude Code、Manus 们用四套框架机制给出答案 大模型在长任务里反复"失忆"、跑着跑着就忘了最初目标,这个困扰整个智能体行业的老毛病,根源可能不在模型本身,而在包裹模型的"执行框架"

1 min read
智能体跑长任务为何"失忆跑题":AWS、Claude Code、Manus 们用四套框架机制给出答案 大模型在长任务里反复"失忆"、跑着跑着就忘了最初目标,这个困扰整个智能体行业的老毛病,根源可能不在模型本身,而在包裹模型的"执行框架"。AWS 一份自主云编程智能体设计指南把问题点得很直白:浅层智能体在长周期里会遭遇上下文溢出、被干扰而跑题,并且无法维持状态。而修好这层的,是负责管理"除模型之外一切"的 harness。 一份盘点多家主流框架的新研究把这层外壳掀开了。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore 各自用四台"发动机"——上下文预算、压缩、待办状态、跨会话记忆——把浅层循环变成能扛住长任务的深智能体。 最反直觉的一点是,把上下文窗口做大并不解决问题。Chroma 的 Context Rot 报告评估了18款大模型,发现即便在简单检索任务上,输入越长模型越不可靠。Anthropic 给出的解释是:注意力机制对 n 个 token 会生成 n² 的两两关系,每多一个 token 都在消耗一笔有限的"注意力预算",上下文是边际递减的资源,不是个桶。Manus 还透露,一个典型任务要调约50次工具、输入输出比接近100:1,最初那条指令会慢慢漂向窗口中段——恰恰是回忆退化的位置。 第一台发动机是上下文预算与卸载。Deep Agents 出厂就写死了两条硬规则:工具返回超过20000token 就写进文件系统、只留路径加前10行预览;会话上下文超过窗口85% 时,旧编辑调用被截断成指针。Claude Code 把同样逻辑用在加载前,自动记忆限200行或25KB,MCP 工具模式默认只列名字、按需拉取。AWS AgentCore 的演示更彻底:协调器并行派生3个浏览器子智能体,各自待在独立 MicroVM 里,分析子智能体只收结构化结果,全程预期4到6分钟,串行则会慢最多3倍。 第二台是压缩。当卸载不够,框架就把接近上限的对话摘要后重启。Claude Co