
北大谢涛教授联合团队 | 从用户操作到智能体自动化——走向大语言模型时代的意图驱动软件
北大谢涛教授联合团队 | 从用户操作到智能体自动化——走向大语言模型时代的意图驱动软件

JCST 近期发表一篇关于意图导向软件(Intent-Oriented Software)的观点文章。该文正式提出“意图导向软件”的概念,从软件工程的视角提出实现此类系统的两种核心架构模型,并凝练其在大型语言模型(LLM)时代面临的技术挑战与研究机遇。该文由北京大学计算机学院、高可信软件技术教育部重点实验室(北京大学)、北京通明湖信息技术应用创新中心、复旦大学先进计算系统研究院及上海开放计算系统研究院联合研究团队撰写,收录于 JCST 创刊 40 周年专辑。
核心观点
- 基础模型(Foundation Model)推动了软件交互从“如何操作(How)”向“要实现什么(What)”的范式转变,正式定义了意图导向软件的概念。
- 提出构建意图导向软件的两种互补工程模型:基于 GUI 代理的“插件模型”(Plug-In Model)和基于大模型底层直调的“原生模型”(Native Model)。
- 该范式转移重塑了传统软件工程生命周期,在需求工程、概率执行的可靠性保障、系统可信度和安全性方面提出了全新的研究机遇。
背景意义
软件系统演进的核心历史,是一部不断缩小人类认知与系统执行之间鸿沟的发展史。从早期的命令行界面(CLI)到图形用户界面(GUI),虽然视觉隐喻替代了大段枯燥的代码指令并提升了可访问性,GUI仍然是一种“面向操作(Operation-Oriented)”的范式。用户依旧需要学习特定软件的工作流,将高层次的目标拆解为死板的、低级别的操作序列。随着 GPT-4 和 DeepSeek 等大型语言模型和大模型智能体的爆发,“意图导向(Intent-Oriented)”软件的构想成为现实可能。这种新范式将用户界面的关注点彻底扭转——用户仅需表达“要做什么”(例如“总结这份数据”),作为智能代理的大模型便能够自动决定“如何达成”。这一转变不仅有望打破“数字弱势群体”的技术壁垒,更引发了对下一代软件架构、人机协同方式以及软件工程方法论的深刻思考与前瞻性探索。该综述以此为切入点,为即将到来的智能软件时代绘制架构路线图。

主要内容
论文系统回顾了交互范式的发展进程,并指出在意图导向软件的发展浪潮中,软件系统如何捕捉意图,并将其转化为实际操作,是目前面临的核心重点与难点。为应对这一挑战,本研究梳理出当下与未来构建意图导向软件的两种核心架构路径。
首先是目前被广泛探索的插件模型(Plug-In Model)。在该模式下,大语言模型化身为外部 UI 代理(GUI Agent),它作为中间层包裹在各类经典操作软件之上。其优势在于无需改动底层历史系统,就能通过理解屏幕元素等方式,将用户的高级意图“翻译”为点击或输入等具体操作。
插件模型虽利于快速部署与过渡,却在执行效率和上下文连贯性上存在瓶颈。因此,该文进一步提出了着眼于未来的原生模型(Native Model)。该模型彻底摒弃了传统笨重的操作界面,将大模型作为软件的核心处理中枢,用户的意图被直接映射到后端的API调用或内部工作流中,能够实现极低延迟与深度的复杂状态同步。

然而,无论采用何种模型,这一范式的转变都对现有软件工程方法论提出了系统性重塑的要求。传统的静态需求分析已无法应对多模态下模糊、动态的用户意图;模型生成的概率性特征也极大加剧了在执行出错时系统状态回滚与自我纠错的开发难度。此外,对于敏感数据的越权保护、操作逻辑的透明化解释,也成为了当下面临的严峻挑战。
结论与展望
尽管基础模型的突破为软件智能化执行提供了强大的能力底座,在实际工程落地中,构建意图导向软件并非简单的技术叠加,而是对整个系统架构与软件工程方法论提出了全新且严峻的挑战。未来的跨学科研究与发展应主要聚焦于以下三个核心维度:
• 动态意图获取与渐进式消歧:用户的自然语言意图往往充满歧义且动态多变。未来系统必须强化多模态上下文的实时获取,并具备“渐进式消除歧义”能力,即通过反问来确认模糊需求,并建立强大的运行时的可行性校验机制。
• 概率性执行环境下的可靠性保障:意图导向软件需要容纳大模型带来的不确定性,研究应侧重构建系统的自我反思(Self-Correction)架构设计,以及强大的状态感知反馈、错误恢复与回滚算法。
• 可信度、可解释度与权限边界:基于“思维链(CoT)”的可观测性界面设计将成为主流,以便用户审计智能体的决策逻辑。面临高风险操作时,必须建立强制的“预验证拦截”,以确保自动化始终处于人类意愿的安全掌控之中。
文章来源于计算机科学技术学报JCST,原文链接: https://jcst.ict.ac.cn/article/doi/10.1007/s11390-026-6182-0

