同一个大模型,换一套周围的基础设施,性能排名能跃升二十多位。腾讯研究院的这份报告提出了一个2026年必须理解的概念:驾驭工程(Harness Engineering)。它不是优化提示词,不是优化上下文,而是直接设计AI运行的环境——约束系统、反馈循环、验证机制、状态管理。
报告里给出了一个很形象的类比:你雇了一个极其聪明但完全不了解你们公司的新人。每次做完事你亲自检查,叫“人在环内”。你把规矩写下来、把自动检查跑起来、把“什么能做什么不能做”编成清单,叫“驾驭工程”。后者才是规模化的正确姿势。
具体怎么搭?四个象限。前馈×确定性:模板和规范。前馈×推理性:设计原则和价值观。反馈×确定性:linter、测试、pre-commit hook。反馈×推理性:AI互审和专家评审。大多数人只做了前馈,很少有人做反馈,更少人把反馈建立成系统。结果就是AI反复犯同一个错,直到你专门写一条规则去堵它。
记忆系统也是个被严重低估的组件。报告里提到一个叫FadeMem的研究项目,模仿艾宾浩斯遗忘曲线给AI记忆设了半衰期——长期记忆11天,短期记忆5天。反复访问的信息会加固,不重要的自然淡出。结果存储量砍了45%,关键事实保留了82%。但注意,这个82%在医疗、法律场景可能就是灾难。遗忘是有条件的功能,条件是被遗忘的信息不具有安全关键性。
技能(Skills)的膨胀是另一个坑。一个开源生态有5400多个技能,但报告里测下来,50个技能以上光是元数据层就成了上下文管理问题。新技能会干扰旧技能的触发,你什么都没改,原来好好工作的那个突然不触发了。成熟的技能应该越来越短——半年前需要20行指令才能可靠执行的任务,现在模型裸跑就行。最后留下的就三样:精准的描述、不可替代的领域知识、从失败中学到的踩坑记录。
对技术团队来说,最该做的不是下载一堆技能然后堆着,而是每周花几分钟审计一次:哪些指令模型已经自己会了?删掉。哪个边界情况反复出错?加一条踩坑记录。减法比加法难,但非做不可。
来源:腾讯研究院
完整版报告已上传至星球,扫下方优惠券加入即可下载所有报告