跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

吴恩达:智能体研究日趋成熟,模型优化迎来新方向

大型语言模型(LLM)正从单纯优化问答体验转向支持智能体(Agent)工作流程。这一趋势,探讨了工具使用、函数调用及计算机操作能力的演进,并对比了提示工程、微调与原生模型构建三种开发路径。此外,还梳理了从基础理解到私有化部署的系统性学习路线,强调掌握 AI 工具的重要性及未来智能体能力的提升方向。

雾岛听风发布于 2025/2/6更新于 2026/9/357 浏览
吴恩达:智能体研究日趋成熟,模型优化迎来新方向

吴恩达:智能体研究日趋成熟,模型优化迎来新方向

受 ChatGPT 强大问答能力的影响,大型语言模型(LLM)提供商往往优化模型来回答人们的问题,以提供良好的消费者体验。随着智能体(Agent)研究日趋成熟,优化似乎有了新的方向。

人工智能著名学者、斯坦福大学教授吴恩达指出:「现在有一种趋势是优化模型以适应智能体工作流程,这将为智能体性能带来巨大提升」。本文基于其博客内容,深入阐述这一趋势及其技术内涵。

从问答到工作流:LLM 优化的范式转移

继 ChatGPT 在回答问题方面取得突破性成功之后,许多 LLM 的开发都集中在提供良好的消费者体验上。因此,LLM 被调整为回答问题或遵循人类提供的指令。指令调整指导模型的数据集很大一部分可以为人类编写的问题和指令提供更有用的答案,面向 ChatGPT、Claude、Gemini 等等。

但智能体工作负载与传统的对话机器人不同。人工智能软件不是直接为消费者生成响应,而是应该在迭代工作流程中执行任务,具体包括:

  1. 反思自己的输出:模型需要能够评估生成的内容是否满足目标,并在必要时进行自我修正。
  2. 使用工具:模型应能调用外部 API、数据库或代码解释器来获取信息或执行操作。
  3. 编写规划:面对复杂任务,模型需具备拆解步骤、制定计划的能力。
  4. 在多智能体环境中进行协作:多个 AI 智能体之间需要分工合作,共同完成系统级任务。

主要模型制造商也越来越多地优化用于 AI 智能体的模型,而非仅仅针对对话流畅度。

关键技术演进:工具使用与计算机操作

工具使用(函数调用)

以工具使用(或函数调用)为例。如果 LLM 被问及当前天气,它将无法从训练数据中获取所需的信息。相反,它可能会生成 API 调用请求以获取该信息。甚至在 GPT-4 原生支持函数调用之前,应用程序开发人员就已经使用 LLM 来生成函数调用,通过编写更复杂的提示来告诉 LLM 哪些函数可用,然后让 LLM 生成用于确定是否要调用函数的字符串。

在 GPT-4 之后,生成此类调用变得更加可靠,然后许多其他模型本身就支持函数调用。如今,LLM 可以决定调用函数来搜索信息以进行检索增强生成 (RAG)、执行代码、发送电子邮件、在线下订单等等。

计算机原生操作

最近,Anthropic 推出了升级版的 Claude 3.5 Sonnet,能像人一样使用计算机。这意味着 LLM 原生使用计算机方向向前迈出了一大步,将帮助许多开发人员。一些团队还致力于让 LLM 使用计算机构建新一代 RPA(机器人流程自动化)应用程序。

这种能力的提升意味着模型不再仅仅是文本生成器,而是成为了能够感知环境、操作界面的数字员工。

开发策略:Prompt、微调与原生构建

随着智能体工作流程的成熟,开发者面临三种主要的模型适配路径:

1. Prompt Engineering(提示工程)

首先,许多开发人员正在 prompt LLM 来执行他们想要的智能体行为。这样可以进行快速、丰富的探索!通过精心设计的 System Prompt 和 Few-Shot Learning,可以在不改变模型权重的情况下引导模型表现出特定的 Agent 行为。

2. Fine-tuning(微调)

在极少数情况下,开发非常有价值的应用程序的开发人员将微调 LLM,以更可靠地执行特定的智能体功能。例如,尽管许多 LLM 本身支持函数调用,但它们是通过将可用函数的描述作为输入,然后(希望)生成输出 token 以请求正确的函数调用来实现这一点的。对于生成正确函数调用非常重要的任务关键型应用程序,针对应用程序的特定函数调用微调模型可显著提高可靠性。(但请避免过早优化!我仍然看到太多团队在进行微调,而他们可能应该在采取这种做法之前花更多时间进行 Prompt。)

3. Model Building(模型构建)

最后,当诸如工具使用或计算机使用之类的能力对开发人员来说似乎很有价值时,主要的 LLM 提供商正在将这些能力直接构建到他们的模型中。尽管 OpenAI o1-preview 的高级推理对消费者有帮助,但我预计它对于智能体推理和规划会更有用。

大多数 LLM 都针对回答问题进行了优化,主要是为了提供良好的消费者体验,我们已经能够将它们「移植」到复杂的智能体工作流程中,以构建有价值的应用程序。为支持智能体中的特定操作而构建 LLM 的趋势将为智能体性能带来很大提升。我相信,在未来几年内,在这个方向上将实现巨大的智能体能力提升。

大模型(LLM)系统性学习路线

大模型时代,火爆出圈的 LLM 大模型让程序员们开始重新评估自己的本领。"AI 会取代那些行业?" "谁的饭碗又将不保了?"等问题热议不断。事实上,抢你饭碗的不是 AI,而是会利用 AI 的人。

针对所有自学遇到困难的同学们,以下梳理大模型学习脉络,涵盖基础理解、API 应用、架构实践及私有化部署四个阶段。

阶段一:AI 大模型时代的基础理解

目标:了解 AI 大模型的基本概念、发展历程和核心原理。

核心内容:

  • L1.1 人工智能简述与大模型起源:回顾 AI 发展史,从专家系统到深度学习,再到 Transformer 架构的诞生。
  • L1.2 大模型与通用人工智能:探讨大模型在 AGI 路径上的地位,以及当前模型的局限性。
  • L1.3 GPT 模型的发展历程:分析 GPT-1 到 GPT-4 的迭代逻辑,参数量、训练数据及架构的变化。
  • L1.4 模型工程:
    • 知识大模型:专注于知识库构建与问答。
    • 生产大模型:关注稳定性、延迟与成本。
    • 模型工程方法论:如何设计高效的模型训练与推理管线。
    • 模型工程实践:实际项目中的资源调度与监控。
  • L1.5 GPT 应用案例:分析经典应用场景,如客服、写作助手等。

阶段二:AI 大模型 API 应用开发工程

目标:掌握 AI 大模型 API 的使用和开发,以及相关的编程技能。

核心内容:

  • L2.1 API 接口:
    • OpenAI API 接口:熟悉 RESTful 规范,认证机制及速率限制。
    • Python 接口接入:使用 requests 或官方 SDK 进行调用。
    • BOT 工具类框架:封装常用功能,提高开发效率。
    • 代码示例:实现一个简单的聊天机器人 Demo。
  • L2.2 Prompt 框架:学习 Chain-of-Thought, ReAct 等高级 Prompt 技巧。
  • L2.3 流水线工程:构建包含预处理、推理、后处理的完整 Pipeline。
  • L2.4 总结与展望:API 开发的最佳实践与未来趋势。

阶段三:AI 大模型应用架构实践

目标:深入理解 AI 大模型的应用架构,并能够进行私有化部署。

核心内容:

  • L3.1 Agent 模型框架:研究 LangChain, AutoGen 等主流 Agent 框架。
  • L3.2 MetaGPT:了解多智能体协作框架的实现原理。
  • L3.3 ChatGLM:分析国产开源模型的特点与应用。
  • L3.4 LLAMA:深入研究 Meta 开源系列模型的微调与部署。
  • L3.5 其他大模型介绍:覆盖 Mistral, Qwen 等主流模型对比。

阶段四:AI 大模型私有化部署

目标:掌握多种 AI 大模型的私有化部署,包括多模态和特定领域模型。

核心内容:

  • L4.1 模型私有化部署概述:数据安全需求与合规性考量。
  • L4.2 模型私有化部署的关键技术:量化技术(Quantization)、显存优化、推理加速(vLLM, TensorRT)。
  • L4.3 模型私有化部署的实施步骤:环境搭建、模型加载、服务封装。
  • L4.4 模型私有化部署的应用场景:企业知识库、内部数据分析、敏感业务处理。

结语

这份学习路线涵盖了 LLM 大模型书籍、行业报告、视频教程、学习路线及开源教程等核心资源。建议学习者根据自身基础,循序渐进地掌握上述内容。在 AI 时代,谁先尝试,谁就能占得先机。

原文链接:https://www.deeplearning.ai/the-batch/issue-275/

目录

  1. 吴恩达:智能体研究日趋成熟,模型优化迎来新方向
  2. 从问答到工作流:LLM 优化的范式转移
  3. 关键技术演进:工具使用与计算机操作
  4. 工具使用(函数调用)
  5. 计算机原生操作
  6. 开发策略:Prompt、微调与原生构建
  7. 1. Prompt Engineering(提示工程)
  8. 2. Fine-tuning(微调)
  9. 3. Model Building(模型构建)
  10. 大模型(LLM)系统性学习路线
  11. 阶段一:AI 大模型时代的基础理解
  12. 阶段二:AI 大模型 API 应用开发工程
  13. 阶段三:AI 大模型应用架构实践
  14. 阶段四:AI 大模型私有化部署
  15. 结语

更多推荐文章

查看全部
  • Rspack:基于 Rust 的高性能 Web 构建工具详解
  • CCF-GESP 2025 年 9 月 C++ 二级真题解析
  • 网络安全攻防:黑客攻击简要流程
  • 前端图像生成性能优化:从浏览器瓶颈到云端高效渲染
  • 阿里开源 iFlow CLI:终端级 AI 智能体功能与使用指南
  • OpenClaw Scanner:开源利器出鞘,筑牢自主AI Agent安全防线——技术解析、实操指南与前瞻展望
  • OpenClaw 爆火背后的 AI Agent 破圈真相
  • AI 双重突破:MWC IQ 时代与 DeepSeek V4 多模态革命
  • 《大语言模型综述》:全面解析大语言模型技术体系与前沿进展
  • Rust 核心基础数据类型与变量系统
  • MiniRAG:面向 1.5B 小模型的 RAG 框架,效果媲美 GPT4
  • OpenClaw WebUI 空白页问题修复指南
  • 基于 Leaflet Trackplayer 实现 WebGIS 高速轨迹可视化
  • OpenClaw Web Search 配置与渠道选择指南
  • 基于 RetinaFace 与 CurricularFace 的身份核验系统实现
  • AI Agent 开发工程师岗位解析与技能路径
  • Vheer:免费免登录的 AI 绘画与视频生成工具
  • Web3 社区运营指南
  • 把 Python 写得更顺手:常见风格与写法取舍
  • Java 9 至 Java 25:核心演进与实战变革解析

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online