智讯智库

8分钟搭出第一个人工智能智能体:谷歌官方教程的完整拆解

谷歌用一个“先规划、再写作、两次检查”的博客智能体,演示了人工智能智能体如何思考、调用工具和自动返工。下面把视频里的完整流程拆成可以照着完成的步骤。

AI
相关企业:谷歌来源:智讯智库编辑部2026年09月26日 14:21
分享
收藏
字体大小
封面图

普通聊天机器人通常回答一次就结束。人工智能智能体则会先判断任务需要哪些步骤,再执行、查看结果,并决定下一步做什么。

谷歌云技术团队发布的一段 8 分钟教程,用一个博客写作工具展示了这一区别。教程采用谷歌智能体开发套件(Agent Development Kit,简称 ADK)。它是一套开源开发框架,帮助开发者把模型、工具和多个分工不同的智能体连接起来。

教程的目标并不是做一个什么都能干的超级助手,而是完成一条清楚的流水线:用户给出主题,系统先生成提纲并检查,再写出文章并检查,最后补充三个备选标题和两条适合社交平台的短文案。

谷歌官方图示:智能体接收输入,作出决定,执行动作,再根据结果继续调整

先理解智能体在多做哪一步

教程把现代智能体的基本循环概括为四个动作:推理、行动、观察和调整。

例如,用户要求“写一篇人工智能智能体应用指南”。传统聊天机器人可能直接生成全文;智能体可以先列提纲,调用写作工具,检查文章是否漏掉结论。如果检查不通过,它会带着问题重新写,而不是把第一版直接交给用户。

视频还区分了三种常见模式:

  • 顺序型:像流水线一样依次完成第一步、第二步、第三步,稳定但不灵活。
  • 反应型:根据当前情况临时决定下一步,灵活但可能缺少长期计划。
  • 规划型:先画出路线,再按依赖关系执行,适合步骤较多、前后相互影响的任务。

谷歌的这段教程采用规划型结构,因为写文章天然分为规划、写作和检查几个相连环节。

第一步:准备四个文件和运行环境

开始前需要 Python 3.10 或更高版本、一个浏览器,以及从 Google AI Studio 获取的 Gemini 模型接口密钥。密钥相当于调用模型的通行证,不能写进公开网页或上传到公开代码仓库。

视频里的快速演示先运行 pip install uv 和 pip install google-adk,然后新建 agent.py。uv 是一个帮助安装和管理 Python 软件包的工具;如果电脑里已经有习惯使用的 Python 环境,也可以不把它当作必需条件。

与视频配套、后来扩充的官方 Codelab 给出了更完整的项目结构:在电脑上新建 bloggeragent 文件夹,并在其中准备四个文件。requirements.txt 用于列出依赖,.env 用于保存本机密钥,__init__.py 用于让程序识别项目,agent.py 用于放置智能体工作流。

依赖文件写入 google-adk 2.2.0 和 python-dotenv。随后创建 Python 虚拟环境并安装依赖。虚拟环境可以理解为给这个项目准备一个独立工具箱,避免它与电脑里其他项目使用的软件版本相互冲突。

当前 Codelab 的完整命令依次是:创建并进入项目文件夹;运行 python3 -m venv .venv;在 macOS 或 Linux 上运行 source .venv/bin/activate;最后运行 pip install -r requirements.txt。它与视频里的两条快速安装命令目标相同,都是把 ADK 安装到一个可运行的 Python 环境中。

在 .env 文件中写入 GOOGLE_API_KEY 和自己的密钥。示例默认使用 gemini-flash-latest,也可以通过系统环境变量 MODEL 更换模型。latest 表示自动指向当前稳定版本,方便试用,但正式项目最好固定经过验证的具体版本,避免模型更新后行为突然改变。

第二步:让“规划员”只负责提纲

第一个子智能体名为 BlogPlanner,也就是博客规划员。它只做一件事:把用户主题变成结构化提纲。

指令要求提纲必须包含标题、简短导语、四至六个主要部分、每部分两至三个要点,以及结论。把格式写清楚,是为了减少模型随意发挥。

规划员生成的结果通过 output_key 保存为 blog_outline。可以把共享状态想象成团队共用的文件柜:规划员把提纲放进标有 blog_outline 的抽屉,后面的写作者可以直接取用,不必让用户手工复制。

接着加入提纲检查员 OutlineValidationChecker。它不创作新内容,只检查提纲是否拥有标题、导语、四至六个部分和结论。合格就回答 ok;缺少内容就回答 retry,并指出问题。

规划员和检查员被放入一个循环智能体 RobustBlogPlanner。系统先规划、再检查;如果收到 retry,就重新规划,最多尝试三次。这个上限很重要,否则错误条件可能让程序一直循环并持续消耗模型费用。

第三步:让“写作者”根据共享提纲完成正文

第二个主要子智能体是 BlogWriter,也就是博客写作者。它读取 blog_outline,面向软件工程师写出完整文章,解释“怎么做”和“为什么”,并在有帮助时加入简短代码示例。

成稿保存为 blog_post。随后,文章检查员 BlogPostValidationChecker 核对文章是否有导语、是否按照提纲展开、是否有结论、解释是否清楚。写作者和文章检查员同样组成一个最多运行三次的循环。

这一设计没有让一个模型同时承担所有任务,而是把计划、写作和验收拆开。好处是每个角色的目标更清楚,调试时也更容易发现错误究竟出在哪一环。

谷歌官方图示:根智能体把规划和写作两个循环封装成工具

第四步:由总管智能体安排两个工具

教程把“提纲循环”和“写作循环”分别包装成工具,再交给名为 Blogger 的根智能体。根智能体可以理解为项目总管,它不亲自处理每个细节,只按顺序完成三件事:

  1. 调用规划工具,得到经过检查的提纲。
  2. 调用写作工具,得到经过检查的文章。
  3. 在文末生成三个备选标题和两条社交平台短文案。

根智能体只被允许调用这两个工具。限制工具范围会让工作流更容易预测,也能减少模型调用与任务无关功能的机会。

值得注意的是,示例里的“检查”仍由语言模型完成。模型可能误判,也可能在重试后仍保留事实错误。因此,这种自我检查适合提高结构完整度,却不能替代事实核验、代码测试或人工审核。

第五步:在网页界面里运行和观察

完成 agent.py 后,在项目目录运行 adk web。浏览器打开本机的 127.0.0.1:8000 地址,就能看到 Blogger 根智能体,以及它连接的规划和写作工具。

教程输入的测试主题是“人工智能智能体的十大应用”。运行记录会依次显示规划员生成提纲、检查员验收、写作者完成文章和第二次检查。这个记录很有用,因为开发者可以看到系统在哪一步失败、为什么重试,而不是只看到最后答案。

谷歌官方ADK网页界面:根智能体连接规划与写作工具

如果 8000 端口已被其他程序占用,可以换成 8001 等端口。若系统找不到 adk 命令,应先确认虚拟环境已经启用,依赖也已正确安装。

这套教程真正值得学的不是“自动写文章”

博客写作只是一个容易理解的例子。教程更重要的价值,是展示了三项可复用的工程方法。

第一,把复杂任务拆成职责单一的角色。第二,用共享状态传递中间结果,避免人工搬运。第三,为容易出错的步骤设置检查和有限次数的重试。

这套结构可以改造成研究报告助手、客户支持流程、代码审查工具或资料整理系统。但一旦进入真实业务,还要增加权限控制、费用上限、日志、人工批准和针对事实或代码的确定性测试。

谷歌官方 Codelab 还提供了把项目部署到 Cloud Run 云服务的步骤。初学者如果只想理解智能体,可以先停在本地运行;公开部署会产生云服务费用,也不应在缺少登录和权限限制时把管理界面直接暴露给所有人。

八分钟视频演示的是一个能跑起来的最小样板,而不是可以直接交付客户的生产系统。看懂“规划—检查—写作—再检查”的骨架,才是把它迁移到其他任务的关键。

参考资料

[1] GOOGLE CLOUD TECH. AI Agents Explained: Build Your First Agent in 8 Minutes[EB/OL]. 2026-06-10[2026-09-26].

[2] KOLAN S. Build an AI Agent with Google ADK[EB/OL]. Google Codelabs, 2026[2026-09-26].

[3] HUIZENGA E, YANG B. Agent Development Kit: Making It Easy to Build Multi-Agent Applications[EB/OL]. Google Developers Blog, 2025-04-09[2026-09-26].

[4] YAO S, ZHAO J, YU D, et al. ReAct: Synergizing Reasoning and Acting in Language Models[J/OL]. International Conference on Learning Representations, 2023[2026-09-26].

最新发布