AI技能包,用得好是神器,用不好是灾难_焦点速讯

2026-09-17 21:27:37     来源:科技行者     编辑:    

你有没有想过一个问题:为什么有些AI助手用了一堆"技巧包""知识库"以后反而变笨了?


(资料图片)

这不是段子。2025年,Anthropic推出了一个叫"Skills"(技能)的功能,本质上就是给AI智能体准备一份说明书,告诉它遇到某类任务该怎么做、要注意什么坑、怎么验证结果对不对。这个想法听起来完美:与其让AI每次都从零摸索,不如把过去成功的经验打包成一份可复用的指南,直接喂给它。

各大厂商也确实这么干了,效果看起来也不错,跑分往上涨。但问题是,几乎所有人都只盯着一个数字:用了技能包之后,任务成功率是不是提高了。

没人问过更深的问题:技能包到底是怎么起作用的?它改变了AI执行任务时的哪个环节?为什么同一份技能对A任务是神助攻,对B任务却成了猪队友?

来自普林斯顿大学、斯坦福大学、加州大学圣地亚哥分校等机构的一组研究者,决定不满足于"跑分涨了就是好"这种粗糙结论。他们把AI执行任务的过程拆开来看,像医生做尸检一样,逐帧比对"有技能"和"没技能"两种情况下AI到底做了什么不同的事。这篇论文的名字很直白:《揭秘智能体技能:为什么有效,直到它失效》。

一个实验室级别的对照实验,是怎么设计出来的

要搞清楚技能包为什么有用,光看最终成功还是失败远远不够。这就好比你想知道一款新药到底靠什么起效,光记录病人是否痊愈是不够的,你得知道药物在体内经过了哪些代谢路径,作用在哪个受体上。

研究团队设计了一个三方对照实验。他们让AI智能体在同一个任务上分别用三种方式执行:第一种叫"Raw",什么先验经验都不给,纯裸跑;第二种叫"Workflow Memory"(工作流记忆),把过去执行这个任务时留下的原始轨迹稍加清理后直接塞给AI;第三种就是"Skill",把同样的原始轨迹提炼成一份标准化的说明文档,格式统一,叫SKILL.md。

关键的控制变量在这里:Workflow Memory和Skill用的是完全相同的原始素材,只是包装方式不一样。这样一来,如果两种方式效果不同,那差异就只能归因于"怎么呈现经验"这件事本身,而不是"给了多少经验"。

打个比方,这就像两个厨师拿到同一批食材,一个把食材原封不动堆在案板上让你自己看着办,另一个则把这些食材提炼成一份写清楚步骤、火候和注意事项的菜谱。食材是一样的,但呈现方式天差地别,做出来的菜能一样吗?

研究者还设计了一个"配方网格":他们把每个任务收集到的成功案例和失败案例按不同比例混合,从全是成功案例(5个成功0个失败,记作5s0f)一路调到全是失败案例(0s5f),一共六档。这样就能看出,当你喂给技能生成器的原始素材质量参差不齐时,最后炼出来的技能会不会跟着变差。

实验覆盖了三个基准测试平台:Terminal-Bench 2.0(终端命令行任务)、SkillsBench(专门测试技能复用能力的任务集)和Terminal-Bench-Pro(更大规模的公开任务集)。用的AI组合是Codex配GPT-5.3-Codex,以及Gemini CLI配Gemini-3.1-Pro-Preview。

Skill*:一份标准化的procedural knowledge(程序性知识)文档,通常命名为SKILL.md,里面写明什么时候该用这个技能、前置条件是什么、具体步骤、常见的失败模式以及怎么验证结果正确。

Workflow Memory*:把AI过去执行任务留下的原始轨迹稍作清理后直接作为参考资料提供给AI,保留了较多执行细节和过程噪音。

技能包能带来多少提升,数字说话

先看最硬核的结果。研究者把每个任务在三种条件下的"最优表现"(oracle-status success rate,即取多次尝试里最好的一次结果)做了统计。

Skill组的成功率是61.9%,Raw组是59.1%,Workflow Memory组反而是55.9%,比裸跑还低。

这个结果乍一看有点反直觉:给了先验经验的Workflow Memory居然比什么都不给的Raw还差。但更关键的对比不是Skill对Raw,而是Skill对Workflow Memory:两者相差6.06个百分点,95%置信区间是[0.76, 11.36],意味着这个差距在统计上是站得住脚的。

**这个对比之所以关键,是因为Skill和Workflow Memory用的是完全一样的原始素材,差异只能来自呈现方式本身。**

换句话说,多给AI一些过去的执行记录,不见得有用,甚至可能有害。但把这些记录提炼成一份干净的操作指南,效果就完全不同了。

具体在哪个环节起作用?研究者用一套12类的行为分类体系去标注每一条执行轨迹,看看AI在成功或失败时到底表现出什么样的行为模式。结果显示,procedural_anchor(程序锚定)这个机制占了技能生效原因的65.7%,而knowledge_injection(知识注入)只占4.5%。

procedural_anchor(程序锚定)*:技能包提供的是一套可执行的步骤、检查清单或工具调用顺序,帮助AI稳定地按照正确路径走完流程,而不是给它补充它本来不知道的事实性知识。

这个数字说明了一件很多人可能没想到的事:技能包起作用,主要不是因为它告诉AI一些新知识,而是因为它稳定了AI的行为路径。

这就好比你带一个新手去修一台不熟悉的机器,你给他的不是一本《机械原理教科书》,而是一张写着"第一步拧这颗螺丝,第二步检查这个指示灯,第三步千万别碰红色按钮"的操作卡片。新手缺的往往不是知识,而是一个靠谱的执行顺序。如果你不给这张卡片,他可能知道原理,但还是会在第三步忘了检查指示灯,或者在设置环境变量时漏掉一个字符,最后卡在一个跟"理解机器"完全无关的低级失误上。

技能包到底修好了哪些坑

研究团队进一步把失败原因拆解成三大类:SC1是"成功类"(自主成功、技能引导成功、工作流引导成功),SC2是"执行层与验证失败"(环境配置错误、输出格式不匹配、后台服务生命周期故障、shell代码损坏、算法逻辑错误、静态验证缺乏运行时校验),SC3是"调用与边界失败"(超时耗尽预算、技能指导被误用或忽略、能力或安全限制)。

数据显示,SC2这一类执行层失败在Raw组里占37.3%,Workflow Memory组占33.3%,但在Skill组只占23.5%。

具体到某个失败模式更明显:environment_infrastructure_failure(环境基础设施故障)在Raw组里出现频率是5.3%,Workflow Memory组降到1.7%,Skill组直接降到0.2%。output_format_schema_mismatch(输出格式不匹配)从Raw组的7.4%降到Skill组的3.2%。background_service_lifecycle_failure(后台服务生命周期故障)从2.7%降到0.8%。

这些数字告诉我们一件事:环境配置、格式规范、服务管理这类"操作纪律"型问题,特别适合被写进技能包里彻底解决。一旦有人踩过坑,把正确的设置流程写下来,后来者就不用再踩一次。

但技能包不是万能药。algorithmic_logic_error(算法逻辑错误)在三组里分别是8.3%、11.0%、7.4%,static_verification_without_runtime(静态验证缺乏运行时校验)分别是12.5%、12.5%、11.7%,这两类问题在Skill组几乎没怎么改善。

**这说明技能包能稳定"怎么做",但没法替AI把算法想对,也没法强迫它做更严格的运行时验证。**

这就好比一份详细的装修施工手册能保证工人不会漏做防水、不会忘记验收水电,但如果原始设计图纸本身画错了承重墙的位置,再详细的施工手册也救不回来。手册解决的是执行纪律问题,不是设计正确性问题。

技能包也会带来新麻烦

这里有个有意思的反转。技能包虽然堵住了很多执行层的坑,却打开了一个新的失败口子:skill_guidance_misapplied_or_ignored(技能指导被误用或忽略),这个模式在Skill组占了10.0%,而在Raw组只有0.8%,Workflow Memory组只有0.4%。

问题出在哪?技能不是自动执行的机器人,AI必须自己判断这份技能到底适不适合当前情况,要遵循到什么程度,什么时候该抛开技能自己来。很多失败案例不是技能内容有问题,而是AI机械地套用了技能里的某个步骤,却忽略了当前任务的一个特殊前提已经不成立了。

Workflow Memory则表现出另一种失败方式:timeout_budget_exhaustion(超时耗尽预算)在这一组占10.6%,远高于Raw组的1.7%和Skill组的4.4%。原始轨迹里塞满了各种探索路径、失败的尝试和调试细节,AI读这些东西会消耗大量注意力,导致真正该做的事没时间做完。

**一个失败的技能运行不一定是技能内容差,一个成功的技能运行也不一定是技能起了作用。**技能的效果取决于一整条链路:先验经验要被提炼到合适的抽象层级,要能匹配当前的执行环境,要被AI正确调用,还要在执行过程中根据实际情况做适当调整。

这就像给你一份GPS导航,导航路线本身可能没问题,但如果你开到一半发现前面正在修路,你还死板地按照导航走,那出问题的不是导航系统,是你没有根据实际路况做调整的能力。如果导航系统压根不给你路线选项,你反而会更谨慎地边走边看路况,未必比死板执行导航更差。

换个平台,技能还灵不灵

技能包是不是只能在生成它的那个AI框架里用?研究者专门做了一次跨框架迁移实验:先在Codex加GPT-5.3-Codex这套组合上收集轨迹,构建出技能和工作流记忆,然后把这些成品原封不动地搬到Gemini CLI配Gemini-3.1-Pro-Preview这套完全不同的组合上跑。

结果相当亮眼。Gemini CLI在没有任何先验经验时的基线成功率是56%。用了从Codex迁移过来的Skill之后,各个配方档位下的成功率分别是60%、62%、76%、76%、76%、84%,相比基线最多提升了30个百分点。

这个结果值得琢磨。**技能之所以能跨平台迁移,恰恰是因为它已经被提炼成了与具体框架无关的操作逻辑,而不是绑定在某个特定的提示词风格或工具调用接口上。**

打个比方,一份写清楚"先把水烧开,再下面条,煮三分钟捞出"的菜谱,无论你用的是燃气灶还是电磁炉,都能照着做。但如果你只给别人看你炒菜时手忙脚乱的整个视频,别人得先花时间搞清楚哪些操作是必要的、哪些只是你个人的惯动作,甚至可能照抄了你按错的那个按钮。技能之所以能跨平台复用,正是因为提炼过程本身就把"框架特有的操作细节"给筛掉了。

技能库越大越好用吗?答案可能让你意外

现实中,AI不太可能只面对一个技能,而是要从一个技能库里挑出合适的那个。这就带来一个新问题:当技能库规模变大,混进了很多相似但不完全对的干扰项时,AI还能不能准确找到该用的那个技能?

研究团队设计了三组独立实验来回答这个问题。第一组叫Arm 1,用一个叫Qwen3-Embedding-0.6B的文本嵌入模型,纯靠语义相似度给任务和候选技能打分排名,完全不涉及实际执行;第二组叫Arm 2,直接让AI看着候选技能列表,自己选出它觉得有用的技能,同样不实际执行任务;第三组叫Arm 3,把整个候选池摆在AI的执行环境里,让它真刀真枪跑任务,跑完之后分析它到底调用了哪些技能。

Embedding*:一种把文字转换成一串数字向量的技术,语义相近的文字对应的向量在空间中距离也相近,因此可以用来计算两段文本有多"像"。

三组实验的候选池大小从5个技能一路加到100个,干扰项分为三种:随机的、语义上很相似但不对的、以及完全不相关的。

先看离线诊断的结果。Arm 1的Top-1精确率(排名第一的技能就是正确答案的比例)从5个候选时的88.3%降到100个候选时的76.9%,Arm 2的显式选择精确率从70.0%降到63.7%。降幅看起来不算特别恐怖。

但真正让人吃惊的是Arm 3的结果。Codex在候选池只有5个技能时,实际调用的技能里有42.3%是正确的(也就是精确率),但候选池扩大到100个时,这个数字暴跌到只剩5.9%。Gemini的情况更极端,从16.9%一路跌到0.7%。

平均下来,随着候选池从5个扩到100个,实际调用精确率从29.6%跌到3.3%,跌幅接近九成。

但更反直觉的事情发生在下游任务成功率上:即便实际调用精确率跌成这样,最终任务成功率几乎没怎么变,只是从36.4%微降到39.3%(甚至还略有上升)。

这说明什么?**精确匹配到那个标注为"正确答案"的技能,既不是任务成功的充分条件,也不是必要条件。**AI在面对一堆候选技能时,往往会同时调用好几个,有些不是标准答案但同样能提供有用的程序性支持。

这就好比你去图书馆找一本讲"如何修自行车"的书,图书馆员没有精确地把那本"标准答案"书递给你,而是一次性抱来了五本相关的书,里面有讲摩托车维修的、有讲通用机械原理的,你翻了翻这五本书拼凑出了修车的方法,最后车确实修好了。你没有精确命中那本"标准答案"书,但目的照样达成了。如果图书馆员非要你等到找到那本唯一正确的书才能动手,你可能永远都修不好车,因为那本书可能根本没被摆在容易发现的位置。

进一步拆解干扰项类型可以发现,语义相似的干扰项才是真正的麻烦制造者。Arm 1在语义相似的候选池里,Top-1精确率从5个候选时的70.5%掉到100个候选时的53.4%,而在完全随机或完全不相关的候选池里,即便扩到100个候选,精确率依然能维持在84%以上。

也就是说,候选池变大本身不是最大的问题,真正难缠的是那些"看起来很像但其实不对"的干扰项。这跟人在生活里挑选商品或者做单选题时的困境很像:如果给你一百个完全不搭边的选项,你反而很容易一眼排除掉;但如果混进几个和正确答案高度相似的选项,判断难度会指数级上升。

有没有成功和失败的标签,重要吗

技能是在有明确标注哪些轨迹成功、哪些失败的情况下构建的,还是不知道结果好坏也能构建出同样好的技能?研究团队做了一个"隐藏标签"(no-hint)对照实验:同样的原始轨迹,一种情况下技能生成器能看到每条轨迹的成功失败标注,另一种情况下这个标注被抹掉。

结果显示,当素材池里全是成功案例时,有没有标签几乎没差别。但一旦素材池里混入了失败案例,差距就迅速拉开。

以Gemini在Terminal-Bench-2上、素材比例是3个成功2个失败(3s2f)的情况为例,看得到标签时构建出的技能能达到74.62%的成功率,看不到标签时只有40.00%,相差超过34个百分点。

这个结果其实挺符合直觉,但数字之大还是有点出乎意料:**如果技能生成器不知道哪些经验是"踩坑教训"、哪些是"成功范例",它没办法从混杂的素材里提炼出真正有用的操作规范,反而可能把错误做法当成正确经验写进技能文档里。**

这就好比一个厨师从一堆没有标注对错的做菜视频里学做菜,如果他不知道哪个视频里那道菜最后被顾客投诉难吃、哪个视频里的做法广受好评,他很可能把某道被投诉的菜的错误步骤当成标准流程学了下去。标签的存在本质上是在帮技能生成器分清"哪些是该学的,哪些是该避的"。

研究者是怎么给行为贴标签的

这篇论文最下功夫的地方,是它没有满足于让一个AI裁判随便打标签就完事,而是搭了一套相当严谨的验证流程。

研究团队先把8135条试验记录归一化整理,其中7837条带有完整的AI操作轨迹。然后从中抽样240条轨迹做开放式编码,也就是先不预设分类框架,让AI裁判用自己的话总结每条轨迹里到底发生了什么,最后保留238条有效的独立标签,再通过两轮批量归纳把这些五花八门的描述合并成一套12类的标准分类体系。

为了确保这套标注不是AI裁判在自说自话,研究者请了人工标注员做独立复核。对238条有效标签中的每一条,人工标注员都去查看了三条支撑轨迹,一共714次人工核查,结果全部标签都得到了轨迹证据的支持。人工标注员还独立地把这238条标签重新映射到12类分类体系里,最后跟AI裁判的分类结果对比,精确一致率达到95.8%,Cohen"s Kappa系数是0.952。

Cohen"s Kappa*:一种衡量两个评判者打分一致性的统计指标,数值越接近1说明两者的判断越吻合,排除了单纯靠运气一致的可能。

这个验证环节很重要,因为整篇论文的核心结论都建立在这套12类分类体系之上。如果分类本身就不靠谱,后面所有的百分比统计都成了空中楼阁。

在这套体系基础上,研究者构建了528组"三胞胎"对照样本,每一组包含同一个任务在Raw、Workflow Memory、Skill三种条件下的执行记录,覆盖SkillsBench(144组)、Terminal-Bench 2.0(186组)、Terminal-Bench-Pro(198组),总共产生1584条弧级别的分类标注。这种成对比较的设计,让研究者能够直接问出"从Raw切换到Skill这一步,到底修好了什么坑、又引入了什么新坑"这种精细化的问题,而不只是笼统地问"哪种条件成功率更高"。

有限但真实的边界

研究者在论文末尾很坦诚地承认了几点局限。他们的实验主要集中在终端命令行和工具调用类的基准测试上,强调的是多步骤执行、调试和验证,还没覆盖长程网页交互或开放式协作这类场景。测试用的AI组合和模型版本也有限,结论未必能直接推广到其他框架或模型家族上。

最后,那套12类的机制分类体系是从大约3%的样本里通过开放编码归纳出来的,不是穷尽式的标注,一些罕见的行为模式可能没有被充分捕捉到。

不过,这些局限并没有削弱这篇论文最核心的发现:技能包起作用的方式不是简单粗暴地"给更多知识",而是把混乱的经验提炼成稳定的行动指南。这个提炼过程既是技能包价值的来源,也埋下了新的风险,因为提炼出来的东西终究要被正确地识别、调用和适配,这中间的每一环都可能出岔子。

写在后面

读完这篇论文,最让我意外的一点是Workflow Memory居然比裸跑还差(55.9%对59.1%)。直觉上,给AI多一些参考总不会更糟吧?但数据摆在那里,原始轨迹里的噪音和探索性弯路,反而会拖累AI的判断,让它在本该干脆利落的地方犹豫、绕远路、甚至超时。这提醒我一件容易被忽略的事:信息量和信息质量是两码事,多给不等于给对。

另一个让我反复琢磨的细节,是"精确匹配正确技能"和"任务成功"之间那种若即若离的关系。候选池扩大到100个之后,实际调用精确率跌到只剩3.3%,但成功率几乎纹丝不动。这个现象放在其他领域也能找到影子:一个人不需要精确复述教科书上的定义,只要脑子里有几个相关的概念碎片,照样能解决实际问题。检索的"精准"和使用的"有效"从来不是一回事,这个论文用扎实的数字把这个直觉钉实了。

如果技能包真的要走向自动生成、自动进化,下一步该解决的可能不是"怎么写出更好的技能",而是"怎么让AI知道什么时候该信技能、什么时候该怀疑技能"。这个判断力本身,会不会才是比技能内容更难攻克的那道坎?

Q&A

Q1:Skill技能包为什么比Workflow Memory工作流记忆更有效?

A:因为两者用的是同一批原始执行记录,差别只在呈现方式。Skill把混乱的经验提炼成标准化的操作步骤,而Workflow Memory保留了大量原始探索、失败尝试和过程噪音,容易拖累AI的判断速度,甚至导致超时。实测中Skill比Workflow Memory的成功率高出6.06个百分点。

Q2:技能库变大之后,AI还能准确找到该用的技能吗?

A:很难。当候选池从5个扩大到100个,AI实际调用正确技能的精确率从29.6%暴跌到3.3%,尤其是语义相似的干扰项最容易让AI选错。不过有意思的是,即便精确率大跌,最终任务成功率几乎没受影响,说明选中"标准答案"技能不是任务成功的必要条件。

Q3:技能包会不会存在负面影响,比如误导AI?

A:会。研究发现技能指导被误用或忽略的情况在Skill组占了10.0%,远高于裸跑组的0.8%。AI有时会机械套用技能里的某个步骤,却忽略当前任务的特殊前提已经不成立,这是技能包引入的一种新失败模式。

相关资讯
相关资讯
最近更新
最近更新
v AI技能包,用得好是神器,用不好是灾难_焦点速讯 2026-09-17
v 【聚焦】行业首次!申通这次跑在了最前面 2026-09-17
v 美股半导体板块盘前走强-今日关注 2026-09-17
v 焦点播报:三羊马:关注机器人、人工智能在物流场景的应用可能性 2026-09-17
v 时代出版(600551.SH):选举董磊担任公司董事长 动态焦点 2026-09-17
v 国航远洋:控股股东、实际控制人及一致行动人持股比例已降至55.90%_... 2026-09-17
v 看热讯:金隅集团业绩说明会:择机并购优质标的,巩固北方龙头地位 2026-09-17
v 是时候抄底了!豪华燃油车价格集体跳水:最低15万就能拿下-今日视点 2026-09-17
v 终于有老酒友肯说实话:红火一时的乌苏啤酒,现在为啥喝的人少了-热讯 2026-09-17
v 消息!9月17日生意社纯碱市场基差为71.14元/吨 2026-09-17
v 焦点速看:辽宁阜新一家医院停了夜间外科门诊,院长回应:仅2人轮班... 2026-09-17
v 即时看!李昇祐谈未能入选韩国队:我觉得遗憾,这是无可奈何的结果 2026-09-17
v 李昇祐谈未能入选韩国队:我觉得遗憾,这是无可奈何的结果 当前焦点 2026-09-17
v 生死两分钟!无锡跑团上演教科书式生命接力救回心脏骤停跑步老人|当... 2026-09-17
v 生死两分钟!无锡跑团上演教科书式生命接力救回心脏骤停跑步老人 2026-09-17
v 元续科技(08637):终止一致行动确认契据|快看 2026-09-17
v 每日快播:药明康德(02359.HK)转换可转债发行193.88万股H股 2026-09-17
v 福耀玻璃完成发行6.5亿元超短期融资券 利率1.44%-天天快报 2026-09-17
v 每日信息:江苏神州半导体科技股份有限公司科创板IPO审核状态变更为... 2026-09-17
v 生意社:9月17日山东地区醋酐行情强势上行_热头条 2026-09-17
v 生意社:9月17日山东华鲁恒升醋酐价格上调 每日热议 2026-09-17
v 福建高速:控股股东拟1.3亿元—2.3亿元增持公司股份 2026-09-17
v 最新消息:9月17日港股成交额TOP60出炉,智谱、腾讯控股、阿里巴巴-... 2026-09-17
v 新大众文艺·大众抒写|邓立峰:山里的夜生活-每日动态 2026-09-17
v 新大众文艺·大众抒写|邓立峰:山里的夜生活 2026-09-17
v 牧场龙头上扬,截至发稿,优然牧业(09858.HK)涨3.3%,报4.22港元 2026-09-17
v 新消息丨重庆金融监管局关于沈汝洋长安汽车金融有限公司董事会秘书... 2026-09-17
v 福建高速:控股股东拟1.3亿元—2.3亿元增持公司股份 焦点播报 2026-09-17
v 今日热议:45岁金·卡戴珊巴黎约会后,穿深V白裙现身 2026-09-17
v 重点文旅区域糕点食品安全抽检合格率98.2% 2026-09-17
分享到:
更多

增值电信业务经营许可证    互联网新闻信息服务许可证    国际联网备案

   视听节目制作许可证  互联网药品信息服务资格证书   互联网出版机构 备案号:京ICP备2022016840号-68  联系邮箱:920 891 263@qq.com

海峡风网 版权 所有©1997-2017

未经书面授权禁止复制或建立镜像    举报邮箱:jubao@123777.net.cn