Type: concept
Confidence: 0.80
Created: 2026-04-25
Updated: 2026-04-25
Tags: LLM工具调用Agent技能文件技能编排LLM能力

LLM Skill 技术全景

概述

LLM Skill技术是指让大型语言模型能够调用外部工具、使用API以及执行具体任务的工程技术体系。该领域从2022年的ReAct范式起步,逐步发展出包括工具调用、技能库建设、工具生成、大规模工具检索和任务编排在内的完整生态。

关键内容

  1. 第一代:工具增强的朴素尝试
  2. MRKL Systems:最早系统性提出"神经符号混合"架构,通过LLM路由器将查询路由到专业模块(计算器/数据库/搜索引擎)
  3. WebGPT:首批将工具调用与RLHF结合的工作,模型学习何时触发搜索、如何点击链接和整合信息

  4. 第二代:ReAct范式的统一

  5. ReAct:将Chain-of-Thought推理与动作执行交织在同一序列中(Thought → Act → Obs → Thought),解决了纯CoT的幻觉问题
  6. 核心创新是将推理轨迹与真实环境交互相结合

  7. 第三代:技能系统

  8. 关注点转向技能的来源、存储、复用和边界定义
  9. 发展出三条主要研究路线:工具调用基础、技能库建设、工具生成

  10. 工具调用基础研究

  11. Toolformer:让模型自己生成工具调用标注,通过自监督学习使用工具
  12. ToolkenGPT:将工具作为特殊token,冻结LLM只训练工具嵌入向量
  13. Gorilla:连接LLM与真实API生态,采用检索增强微调

  14. 技能范式

  15. Voyager:在Minecraft中实现自动课程学习,包含技能库的持久化存储与检索
  16. GITM任务分解与记忆模块,将复杂任务分解为子目标树
  17. SkiLL-IT技能依赖图,按拓扑顺序组织技能学习

  18. LLM作为工具制造者

  19. LATM:双LLM架构,GPT-4制造工具,GPT-3.5使用工具,降低成本
  20. CRAFT:维护代码片段库,新任务时检索相关代码并组合
  21. Creator:工具创建、决策、执行、修正的统一框架

  22. 大规模工具检索

  23. ToolBench/ToolLLM:大规模API工具调用基准,提出DFSDT决策树搜索
  24. AnyTool:层次化工具检索,自反思机制
  25. API-Bank:端到端评估工具增强LLM的基准

  26. 任务规划与技能编排

  27. HuggingGPT四阶段工作流(任务规划、模型选择、任务执行、响应生成)
  28. AssistGPT:PEIL框架(Plan-Execute-Inspect-Learn)带有主动检查机制

  29. 代码即技能统一范式

  30. CodeAct:使用可执行Python代码作为统一动作空间,优于JSON和自然语言
  31. OpenAgents:专门化Agent平台,包含DataAgent、PluginsAgent、WebAgent
  32. AgentBench:全面评估Agent能力的八大测试环境

来源

相关