<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>轨迹优化 on 张欣耕的个人博客</title><description>Recent content in 轨迹优化 on 张欣耕的个人博客</description><link>https://shanechang.com/zh-cn/tags/%E8%BD%A8%E8%BF%B9%E4%BC%98%E5%8C%96/</link><language>zh-cn</language><lastBuildDate>Mon, 29 Sep 2025 00:00:00 GMT</lastBuildDate><atom:link href="https://shanechang.com/zh-cn/tags/%E8%BD%A8%E8%BF%B9%E4%BC%98%E5%8C%96/index.xml" rel="self" type="application/rss+xml"/><item><title>让AI不再跑偏: 可检索的Agent成功轨迹, AI的聪明记忆法</title><link>https://shanechang.com/zh-cn/p/predictable-agent-trajectories/</link><guid isPermaLink="true">https://shanechang.com/zh-cn/p/predictable-agent-trajectories/</guid><description>&lt;img src=&quot;https://shanechang.com/_astro/cover.DPSAk3hG_Z1QBH3B.webp&quot; alt=&quot;Featured image of post 让AI不再跑偏: 可检索的Agent成功轨迹, AI的聪明记忆法&quot; /&gt;&lt;h3 id=&quot;前情摘要-tldr&quot;&gt;前情摘要 (TL;DR)&lt;/h3&gt;
&lt;p&gt;AI代理人总是”刚出门就迷路”, 问题根源在于它们记不住什么方法真正好用。与其花大价钱重训, 不如给它们配个聪明的记忆库, 能随时翻旧账、学经验。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;问题&lt;/strong&gt;: 代理人一开始还能按你说的办, 后面就”神游”了&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;解决思路&lt;/strong&gt;: 给它配个”成功案例库”, 遇事先查查”以前咋解决的”&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;核心魔法&lt;/strong&gt;: 无需再训练, 代理人也能越用越聪明&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;最终效果&lt;/strong&gt;: AI真的能”吃一堑, 长一智”, 持续进化&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&quot;关键词-放心-看懂没门槛&quot;&gt;关键词 (放心, 看懂没门槛)&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Agent Trajectories (代理轨迹)&lt;/strong&gt;: 就像是”成功案例复盘”——详细记录代理人如何一路闯关, 怎么决策、用啥工具, 最后赢了。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Trajectory Extraction (轨迹提炼)&lt;/strong&gt;: 把乱糟糟的真实对话, 变成清晰、可复用的”行动剧本”, 方便后来者借鉴。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;传统RL (强化学习) 方法&lt;/strong&gt;: 比如&lt;a href=&quot;https://github.com/volcengine/verl&quot;&gt;VERL&lt;/a&gt;, 每次想让AI更聪明就得”重启大脑”, 烧钱烧时间。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ATRC方案 (Agent Trajectories as Retrievable Context)&lt;/strong&gt;: 别做大脑手术了, 直接给AI配一个”万能图书馆”, 想学啥成功经验, 随时查!&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&quot;菜谱盒烦恼症&quot;&gt;”菜谱盒”烦恼症&lt;/h2&gt;
&lt;p&gt;想象一下, 你有个天赋爆棚但健忘的朋友。给他详细菜谱, 能做出米其林水准;可要是让他”随便整顿意大利餐”, 场面就精彩了: 先煮面, 做着做着开始揉披萨, 到最后居然用披萨面团煮了个”神秘烩饭”……你俩面面相觑, “意大利晚餐”变成”黑暗料理”。&lt;/p&gt;
&lt;p&gt;AI代理人现在的毛病也差不多。细致流程它们能干得漂漂亮亮, 一旦任务模糊或多步骤, 走着走着就跑题。本来要干A, 结果拐个弯干成了B, 最后你看着结果直挠头。&lt;/p&gt;
&lt;p&gt;如果能给AI配个”菜谱盒”, 里面装满了历次成功方案——不是死记硬背, 而是随用随查、举一反三, 岂不美哉?这正是**可检索的代理轨迹 (ATRC)**要做的事。&lt;/p&gt;
&lt;h2 id=&quot;真正的秘诀-聪明记忆--大脑重装&quot;&gt;真正的秘诀: 聪明记忆 &gt; 大脑重装&lt;/h2&gt;
&lt;p&gt;传统做法像&lt;a href=&quot;https://github.com/volcengine/verl&quot;&gt;VERL&lt;/a&gt;, 想让代理人升级, 每次都得”洗脑”——重新训练模型。你想提升厨艺, 难道每次都送朋友去意大利蓝带厨艺班?确实有效, 就是烧钱烧心, 效率低得让财务都想跑路。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;ATRC走的是人性化路线&lt;/strong&gt;。不重造大脑, 而是配个”聪明记忆库”。其实, 很多AI系统已经在悄悄收集”代理轨迹”——只是没人把它们当宝贝用。ATRC的精髓就是把这些轨迹像RAG (检索增强生成) 那样用起来, 每次遇到新问题, 动态检索最贴合、最靠谱的过往经验, 优先参考用户反馈最好的方案。&lt;/p&gt;
&lt;p&gt;换句话说, 别再每次炒砸锅就重学做饭, 而是有个智能菜谱盒: 找和当前食材、口味、时间都匹配的最佳菜谱, 推荐最近大家都点赞的爆款。&lt;/p&gt;
&lt;h2 id=&quot;atrc到底怎么玩&quot;&gt;ATRC到底怎么玩?&lt;/h2&gt;
&lt;h3 id=&quot;两大法宝&quot;&gt;两大法宝&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;1. 超会记笔记的小助手 (轨迹提炼)&lt;/strong&gt;&lt;br&gt;
想象有个靠谱助手, 盯着每次”打怪通关”, 把关键步骤总结成一张”菜谱卡”。无论是代理人顺利搞定任务, 还是你中途给了妙招, 这个助手都能把凌乱对话整理成条理清晰、可复用的经验卡片。&lt;/p&gt;
&lt;p&gt;就像”我折腾了三小时, 终于数据库迁移不炸锅”被浓缩成: “数据库迁移菜谱: 1) 先备份, 2) 映射表结构, 3) 小批量测试, 4) 全量迁移+回滚预案”。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;2. 拿手找资料的图书管理员 (检索模块)&lt;/strong&gt;&lt;br&gt;
这个像文档搜索, 但查的不是文件, 而是”成功轨迹”。每当新任务来临, 系统会根据以下四点智能检索:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;相关性&lt;/strong&gt;: 和当前需求像不像?&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;质量&lt;/strong&gt;: 用过的人到底满不满意?&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;新鲜度&lt;/strong&gt;: 是不是过时”老黄历”?&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多样性&lt;/strong&gt;: 能不能给几个不一样的思路?&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&quot;反馈闭环-让好经验越来越多&quot;&gt;反馈闭环, 让好经验越来越多&lt;/h3&gt;
&lt;p&gt;整个流程像这样:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;收集&lt;/strong&gt;: 任务完成后, 助手把经验整理成卡片&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;存库&lt;/strong&gt;: 卡片入库, 并打上用户满意度标签&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;检索&lt;/strong&gt;: 新问题来临, 图书管理员查找最贴合的方案&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;指导&lt;/strong&gt;: 代理人参考这些经验, 灵活应变&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;进化&lt;/strong&gt;: 用户反馈会影响哪些卡片更常被推荐&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这套机制最大的好处是, 真正让人满意的方案会越来越常被引用, 形成正向循环, 无需人工挑选, 系统自带”优胜劣汰”。&lt;/p&gt;
&lt;h2 id=&quot;多轮对话-现实比剧本更魔幻&quot;&gt;多轮对话: 现实比剧本更魔幻&lt;/h2&gt;
&lt;p&gt;理想世界是: 你发指令→AI规划→执行→收工。但真实情况嘛, 用户边用边变, 文件一会儿更新一会儿加新需求, 现实就是一锅炖, 变数不断。&lt;/p&gt;
&lt;p&gt;就像你给朋友发路线, 走到一半说”别去那家了, 换吃寿司, 顺便帮我取个快递”, 传统系统要么直接崩溃, 要么装作听不见。&lt;/p&gt;
&lt;h3 id=&quot;atrc怎么见招拆招&quot;&gt;ATRC怎么”见招拆招”&lt;/h3&gt;
&lt;p&gt;ATRC的三大招数:&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;1. 活的公文包&lt;/strong&gt;&lt;br&gt;
代理人随身带着”公文包”, 里面装着最新的需求、文件、约束。变动时不必推倒重来, 只需替换更新的内容。文件变了?换新版本。需求改了?目标同步。全程无缝切换。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;2. 实时笔记&lt;/strong&gt;&lt;br&gt;
你突然补充一句”还要能支持国际地址”, 助手立刻把这条变更写进新小计划, 塞进公文包, 代理人马上调整路线。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;3. 灵活修正&lt;/strong&gt;&lt;br&gt;
不用全盘重来, 只调整后续几步。就像导航遇到堵车, 只算后半程, 不让你绕回起点。&lt;/p&gt;
&lt;p&gt;最终, 代理人遇到变动不会”原地爆炸”, 而是有条不紊继续干活。&lt;/p&gt;
&lt;h2 id=&quot;实战案例-数据迁移从噩梦变美梦&quot;&gt;实战案例: 数据迁移从噩梦变美梦&lt;/h2&gt;
&lt;p&gt;举个老少咸宜的例子: 数据迁移。谁干谁头大, 出错就是大新闻。&lt;/p&gt;
&lt;h3 id=&quot;没有atrc时-每次迁移都像开盲盒&quot;&gt;没有ATRC时: 每次迁移都像开盲盒&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;每个工程师都各玩各的&lt;/li&gt;
&lt;li&gt;踩过的坑年年重演&lt;/li&gt;
&lt;li&gt;牛人发现的好办法没人留得住, 人一走经验归零&lt;/li&gt;
&lt;li&gt;中途出幺蛾子, 全组都要紧急”救火”&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&quot;搭载atrc-经验活起来&quot;&gt;搭载ATRC: 经验”活”起来&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;第一次胜利被记录&lt;/strong&gt;: 终于有人漂亮迁移全程——备份、测试、分批、回滚, 助手把这套流程整理成”保守但稳健”菜谱A。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;经验库逐渐丰富&lt;/strong&gt;: 很快有了三类打法:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;“保守派” (慢但稳)&lt;/li&gt;
&lt;li&gt;“激进派” (快但有风险)&lt;/li&gt;
&lt;li&gt;“混合派” (快稳兼得)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;智能检索上场&lt;/strong&gt;: 新项目着急迁移20万条数据, 时间紧、任务重。图书管理员自动查找类似历史案例, 按满意度排序, 推荐”混合派”——大项目时间紧的最优解。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;遇到突发问题&lt;/strong&gt;: 迁移一半发现数据有脏数据。传统方法要么慌了, 要么硬着头皮继续。&lt;/p&gt;
&lt;p&gt;ATRC?助手识别到”数据质量”问题, 秒查历史上处理过类似情况的”清洗+迁移”流程, 替换进当前方案, 继续推进。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;结局&lt;/strong&gt;: 数据迁移从”闯鬼门关”变成跟着攻略科学通关。&lt;/p&gt;
&lt;h2 id=&quot;会踩的坑-不是万金油&quot;&gt;会踩的坑: 不是万金油&lt;/h2&gt;
&lt;p&gt;任何靠谱的系统都不可能没有挑战, ATRC也有几个要注意的”地雷”:&lt;/p&gt;
&lt;h3 id=&quot;1-流行菜谱偏见&quot;&gt;1. 流行菜谱偏见&lt;/h3&gt;
&lt;p&gt;常用任务会把冷门但重要的方案淹没。就像你家菜谱盒里永远只剩家常面条, 冷门神作泰式咖喱永远排不上号。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;对策&lt;/strong&gt;: 把不同类型任务分门别类, 老方案定期”冷藏”, 防止旧经验误导新场景。&lt;/p&gt;
&lt;h3 id=&quot;2-过时背景坑&quot;&gt;2. 过时背景坑&lt;/h3&gt;
&lt;p&gt;文件、接口、需求说变就变。六个月前的完美方案, 今天可能因为掉个API直接扑街。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;对策&lt;/strong&gt;: “活的公文包”记得所有版本, 环境变了自动更新, 防止一不小心掉进历史的坑。&lt;/p&gt;
&lt;h3 id=&quot;3-被刷分怎么办&quot;&gt;3. 被”刷分”怎么办&lt;/h3&gt;
&lt;p&gt;有人发现反馈能影响推荐, 就会刷分拉票, 把自己喜欢的顶上天, 不喜欢的踩到底。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;对策&lt;/strong&gt;: 除用户满意度外, 还要看”客观成效” (到底成没成), 并识别人为刷分, 优先信赖靠谱反馈。&lt;/p&gt;
&lt;h2 id=&quot;atrc的用武之地&quot;&gt;ATRC的”用武之地”&lt;/h2&gt;
&lt;p&gt;ATRC在哪些场景真能一展拳脚?&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;重复性专家工作&lt;/strong&gt;: 需要专业知识但套路可复用的任务 (比如代码迁移、数据转换、系统配置), 最适合积累”高水平经验库”。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;高风险操作&lt;/strong&gt;: 出错成本高, 必须借鉴成功经验的领域 (金融、医疗、法务审核等), 绝不允许”试错”。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;团队经验沉淀&lt;/strong&gt;: 防止”牛人一走, 经验归零”, 让优秀方法留在团队, 为后来人铺路。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;快节奏新领域&lt;/strong&gt;: 最佳实践日新月异 (比如API对接、云部署), ATRC能自动捕捉最新有效经验, 淘汰过时做法。&lt;/p&gt;
&lt;h2 id=&quot;展望未来-让ai互相偷师学艺&quot;&gt;展望未来: 让AI互相”偷师学艺”&lt;/h2&gt;
&lt;p&gt;更美好的愿景是, 让AI代理人”群体智慧”互通有无。只要隐私把控得当, 成功经验能在团队、公司, 甚至行业间流动。数据迁移代理人能借鉴兄弟企业的最佳套路, 客服智能体能吸收隔壁行当的金点子。&lt;/p&gt;
&lt;p&gt;技术其实都现成了, 挑战在于如何建好系统、守好底线, 让隐私和质量双保险。&lt;/p&gt;
&lt;h2 id=&quot;怎么入门&quot;&gt;怎么入门?&lt;/h2&gt;
&lt;p&gt;想试试ATRC?推荐循序渐进:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;选定一个固定业务&lt;/strong&gt;: 别贪多, 先挑一个”代理人常做的事”&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;手动记录几次真正的成功流程&lt;/strong&gt;: 5-10次就够, 关键是提炼亮点&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;搭个简单检索匹配&lt;/strong&gt;: 文本相似+质量打分, 先跑起来&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;试试动态上下文更新&lt;/strong&gt;: 任务中途变更时, 能否智能替换?&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;认真量化效果&lt;/strong&gt;: 统计成功率, 看看代理人还会不会”跑偏”&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;目标不是完美, 而是让代理人真的能”越用越准”, 逐步养成”靠经验吃饭”的好习惯。&lt;/p&gt;
&lt;h2 id=&quot;菜谱盒革命&quot;&gt;“菜谱盒”革命&lt;/h2&gt;
&lt;p&gt;ATRC让我们对AI进化的想象彻底换了个角度——与其大动干戈每次都重训, 不如赋予代理人一套”聪明菜谱本”, 随时查阅成功经验, 灵活创新。&lt;/p&gt;
&lt;p&gt;这就像给每个代理人配一本”活的食谱”, 不是死板流程, 而是充满人性化的灵感库。真正的突破不是把模型本身变得多聪明, 而是让AI更懂得”借鉴集体智慧, 站在前人肩膀上”。&lt;/p&gt;
&lt;p&gt;AI代理人无需一开始就完美, 只要学会总结经验、灵活应变, 就能持续成长。ATRC带来的, 不是花哨的新技术, 而是把我们已经拥有的知识组织得更聪明、更实用。&lt;/p&gt;
&lt;p&gt;让代理人专注、让用户开心、让团队积累经验, 避免一错再错, 有时最好的创新, 就是把”人类社会的老办法”用到AI身上——简单, 实用, 管用!&lt;/p&gt;</description><pubDate>Mon, 29 Sep 2025 00:00:00 GMT</pubDate></item></channel></rss>