前言¶
智以致用:从造出智能,到用好智能¶
一年之前,我们在《AI原生应用架构白皮书》的开篇写下“云智一体,碳硅共生”。那时,我们试图回答的是:当模型从实验室走向产业,云与智应当以怎样的关系存在。答案是让云成为智能的基础设施,让碳基的组织与硅基的算力相互协同,使智能拥有一个可以持续生长的家园。
一年之后,一个更深刻的变化正在发生:思考本身,正在成为一种价格快速下降、供给持续扩大的商品。
工业革命把“力”从人的肌肉中解放出来,使机器生产的力量变得廉价而充沛;今天,人工智能正在把“认知”从个体的时间与经验中解放出来。理解、推理、规划、判断和生成,这些曾经稀缺而昂贵的能力,开始以模型调用的方式被大规模生产。
这并不意味着人的价值被削弱。当越来越多可计算、可重复的思考交给机器,人将更聚焦于机器无法替代的事情:提出渴望、作出取舍、承担责任、建立信任。机器可以生成无数种答案,但为什么出发、选择哪一种结果、愿意为哪一种后果负责,仍然属于人。
当思考的价格持续下降,过去被成本压制的大量需求将被释放。但更廉价的思考,并不会自动转化为更有价值的结果。今天的 AI 仍处于早期产品阶段。蒸汽机最先被用来抽水,真正重塑社会的却是后来出现的铁路、工厂与现代城市;同样,Chatbot、Copilot 乃至今天的 Agent,或许仍只是智能时代的“抽水泵”,真正定义这个时代的产品形态还没有完全出现。
这正是“智以致用”要回答的问题:智能已经被造出来,接下来如何把它组织起来、约束起来,并转化为可以规模化交付的生产力。
把智能真正用出去,首先要从“会回答问题”走向“能完成任务”。上一阶段的AI原生应用大多停留在Chatbot与Copilot:人作出判断,模型提供建议;下一阶段则走向Agent与Managed Agent,由智能承担一个环节、一个岗位,乃至一段完整的业务流程,人只在关键处进行授权、审阅与兜底。
把智能真正用出去,还要从“能演示完成任务”走向“能稳定完成任务”。Demo 验证的是模型能力,生产系统检验的则是确定性:面对长周期、多步骤和不断变化的环境,Agent 能否保持状态、正确调用工具、从失败中恢复;它的行为能否被观察、评估、审计和约束;它能否在性能、成本与安全之间取得平衡。企业真正的挑战,已经不是有没有 Agent,而是 Agent 能否跨角色、跨系统、跨边界地进入核心流程。
从“能对话”到“能交付”,从“点上的智能”到“面上的智能”,需要两条同时向下扎根的主线:全模态与全栈。
全模态,是 AI 理解世界、服务人类的必要界面。仅靠文本,无法完整理解由声音、图像、视频、代码、结构化数据以及物理信号共同构成的世界。如果把大模型看作下一代操作系统,基座模型是内核,芯片是硬件支撑,多模态就是连接人与世界的交互界面。当模型能够自然地读、写、看、听、说,能够理解环境与人的真实意图,应用层将变得更薄,智能能力则会下沉为系统的默认组成部分。
全栈,是智能规模化供给的经济基础,也是 Agent 可靠运行的工程前提。当思考成为商品,决定其能否普及的就不只是能力上限,还有生产和使用智能的成本。从模型、芯片、网络、存储,到推理系统、运行时和安全体系,任何一层的瓶颈,都会在海量 Token 和持续任务中被放大。只有形成端到端协同的全栈体系,才能让 Agent 跑得起来、跑得足够久、成本足够低,并始终运行在可控的边界之内。模型、芯片与 AI 云相互支撑:模型提供智能,芯片持续提升计算效率,AI 云则提供承载各类 AI 应用所需的计算、数据、连接、运行与治理能力。
回到“智以致用”这四个字。“智”是可以被规模化生产的认知能力,“用”是能够被可靠交付的任务结果,而中间这个“以”,正是这本白皮书要讨论的实践命题。
上一版白皮书沿着模型、框架、Prompt、RAG、工具、网关、运行时、可观测、评估和安全,梳理了 AI 原生应用的关键要素。今天,模型仍然是智能的源头,却不再单独构成应用架构的中心。真正的工程中心正在转向 Harness 工程,包括 Agent 运行时与沙箱、AI Gateway、工具与协议连接层、记忆与技能资产、可观测评估与调试,以及持续学习与自进化闭环。
这些能力共同构成了从 AI Native 到 Agent Native 的演进:从“被 AI 增强的应用”,走向“由 Agent 围绕目标动态组织起来的应用”;从围绕一次模型调用优化,走向围绕一项任务的成功交付进行设计;从生产更多 Token,走向用更低的成本、更高的成功率,创造更确定的结果。
如果说“云智一体”回答的是智能生长在哪里,“碳硅共生”回答的是智能与人如何共同工作;那么“智以致用”要回答的,就是一个更迫切的问题:当思考开始变得前所未有地充沛,我们应当以怎样的架构,把它转化为真实、可靠且值得信任的价值?
这本白皮书想给出的,是我们目前所看到的、最接近工程真相的一份答案。
为什么要升级这本白皮书¶
2025年9月,我们发布了《AI 原生应用架构白皮书》,围绕 AI 原生应用的 DevOps 全生命周期,从架构设计、技术选型、工程实践到运维优化,对概念和重难点进行体系化的拆解,并尝试提供一些解题思路。但随着模型和智能体技术的快速发展,我们发现,市场的关注度已经从快速构建智能体,转向以下三大新挑战:
-
工程化挑战:从概率智能到可靠生产力,Agent 能够承担关键任务。
-
规模化挑战:稳定、安全、性能、成本,从单点试验到智能基础设施,Agent 能够被大规模部署。
-
组织化挑战:从 Agent 孤岛到智能组织,Agent 能够进入核心业务流程。
去年的那本白皮书,显然难以应对这些新的诉求。
因此,我们重新梳理了白皮书的架构,希望通过更与时俱进的内容,更高的实践篇幅占比,以及更社区化的协作,为企业选型和内部立项提供参考,并计划长期维护该白皮书,持续呈现 AI 原生应用架构的前沿思考和落地实践。
我们非常欢迎业内各方一道,无论您是研究学者、开发者、或是企业客户等,邀请您共贡献白皮书,共同定义行业共识,加速"智以致用",让 AI 真正成为驱动全球产业升级与社会进步的核心力量。
若白皮书能对各个人学习和企业落地起到一点点的促进作用,将是我们莫大的荣幸。
谨以此项目,献给参与 AI 建设的所有同行者们。
AI 如此强大的当下,白皮书还有价值么¶
去年发布《AI 原生应用架构白皮书》后,我们收到了大量企业的积极反馈,认为这是非常体系化的科普读物,有利于组织内对齐概念,也是 AI 项目立项的重要参考资料。但是这一年,AI 在加速发展,能力之强大、应用范围之广,已经远超去年。很多开发者可能会问,现在 AI 分分钟能写10本质量不错的白皮书出来,你们还有必要再去写一本白皮书吗?
是的,这也是我们集结众多一线研发工程师前,扪心自问过的问题。文字生产成本虽然下降了,但并没有让写作失去价值,稀缺的东西不会消失,只会转移。
比如自洽的概念和语言:Harness、Runtime、Agent、Workflow 这些词,不同人、不同视角,讲的可能并不完全是一件事。AI 会放大这种混乱,我们希望通过白皮书建立一套自洽的概念和叙事框架,让不同团队之间能够在同一个上下文里讨论问题、做决策。这件事虽然没有什么技术含量,但需要有实践经验的团队统筹各个领域的一线工程师,有意识地去梳理,和做取舍。
比如判断:模型很擅长把已经存在的信息重新组织成通顺的表达,但它提供的,往往是一个看起来很合理的平均值。例如以什么样的叙事结构来讲 Agent Handbook 才能引起读者的共鸣,这是需要作者自行判断的。
比如经验:模型的语料,本质上是已公开文本的再混合。某个系统在真实生产环境里到底发生过什么,什么地方反复出问题,这些来自一线工程师的一手经验,已经内化成工程师们的技艺,AI 很难替代,尤其是涉及多方依赖的软件系统,运用到严肃场景、需要长期维护、规模化使用的场景。
比如教训:内容越是丰富,什么不该做就比什么可以做更稀缺。真实的失败模式是从实际生产环境人为提炼出来,不是语言模型顺着上下文续写出来的。我们希望能把这些教训显式地写下来,哪怕它们看上去不那么光鲜,帮读者节省试错成本。
Agent 变化太快,这本书里的体系、判断、经验、教训,也许在不久的时间里就会被修正甚至推翻。我们期望白皮书不是一本写完就封存的文档,而是让白皮书保持持久的生命力,这也是我们以开源方式撰写白皮书的初衷。
这本白皮书主要讲什么¶
白皮书围绕智能体应用的全生命周期展开,依次为架构-构建-运行-治理-调优。
架构篇(第 1–2 章)Agent 不是一上来就动手构建,而是要先从业务场景、目标和需求出发,做好架构的设计与选型。方向对了,后面的构建、运行、治理、调优才能事半功倍。这一篇回顾了 AI 应用的发展历程,以及当前主流的 AI 应用形态和构建范式,并给出一套 Agentic Application 的选型参考指南,为统一后边各章节的概念框架和责任划分,建立统一的认知框架。
构建篇(第 3–6 章)围绕 Harness 依次讲范式(Harness 的主流构建方式和责任边界)、任务(编排、长程推进与协作流转)、信息(上下文、状态与可复用能力资产)、行动(受控执行、验证反馈与交付准备),还原 Agent 完整的构建过程。
运行篇(第 7–12 章)从单个 Agent 的执行环境、状态存储和流量网关,到多个 Agent 的异步任务、协作编排与分布式通信,解决 Agent 运行过程中遇到的稳定性、性能、安全合规、成本等工程问题。
治理篇(第 13–16 章)Agent 实际执行了什么,我们看不看得见;它会不会越过授权边界,或者被外部内容操纵;它依赖的 Prompt、Skill、MCP、Agent 散落在各处,有没有统一管理;它的行为在上线之前,能不能先验证一遍。治理篇让 Agent 的运行实现可观测、行为有边界、依赖的资产可管理、上线前的行为可验证,让一个自主运行的系统变得可信。
调优篇(第 17–24 章)从治理沉淀下来的可信事实出发,沿模型和 Agent 两条主线,讲清轨迹数据、运行时数据处理、黄金数据集、Badcase 优化、受控自进化和边缘运行时优化,把运行和治理产生的证据转化为实实在在的能力提升。
业内实践篇(第 25–29 章)覆盖研发效能、设计工程、客服销售与运营、运维安全与企业 IT、法务税务与财务等领域,同时我们把世界人工智能开源大赛中的优秀作品也纳入进来,既有企业实践,也有来自开发者的前沿探索。
总结与展望篇(第 30 章)从 Agentic Application 望向 Agentic OS,讨论这条路可能通向哪里。