- 集成人工智能代理的浏览器通过与现有浏览器相同的权限和用户会话来扩大攻击面。
- 提示注入、剪贴板操作和 OCR 技术使攻击者能够操纵代理以窃取数据并执行未经授权的操作。
- 将扩展程序与人工智能、影子人工智能和敏感数据相结合,会使用户和公司都面临严重的隐私和合规性问题。
- 降低风险需要在浏览器本身进行严格控制,制定明确的人工智能使用政策,并辅以额外的以网络为中心的安全解决方案。
集成人工智能代理的浏览器浪潮已经到来:OpenAI 的 Atlas、Perplexity 的 Comet、搭载 Leo 的 Brave、搭载 Gemini 的 Chrome、搭载 Copilot 的 Edge、融合智能功能的 Firefox……以及更多即将推出的产品。新一代软件预示着我们将不再只是“浏览”,而是开始告诉机器我们想要它做什么:帮我们阅读、填写表格、管理购物,甚至自动执行复杂的网络任务。
然而,这种便利也存在阴暗面:浏览器本身会变成一个自主代理,可以访问您的权限、打开的会话、文件,在很多情况下,甚至可以访问您的个人或公司数据。一旦出现问题——无论是设计缺陷、安全漏洞还是精心策划的攻击——其影响都可能远远大于传统浏览器或简单的云端聊天机器人。
人工智能浏览器本质上是一款“普通”浏览器,但它深度集成了一个语言模型,能够识别您访问的页面,理解其内容,并被授权像用户一样执行操作。它不仅能概括网站内容,还能点击按钮、填写表单、下载文件、管理标签页,或与您已登录的服务进行交互。
与在另一个标签页中使用传统聊天机器人(需要复制粘贴内容)相比,这有很大的不同:现在,代理程序“位于”浏览器内部,可以直接访问您的浏览上下文、打开的会话,以及可能访问您的本地文件或其他系统资源。
这种架构对大型科技公司尤其具有吸引力。Perplexity推出了 Comet 浏览器,甚至考虑过收购 Chrome,而谷歌和微软则将各自的 Gemini 和 Copilot 模型直接集成到 Chrome 和 Edge 浏览器中。OpenAI 则推出了 ChatGPT Atlas,这是一款基于 Chromium 内核的浏览器,其 AI 层在独立进程中运行,以降低风险。
商业动机显而易见:数百万用户、持续使用以及海量数据。这样的浏览器能够培养极高的用户忠诚度(切换浏览器很困难,这也是为什么同时使用多个浏览器很常见的原因),此外,它还能提供所有网络流量以及用户与网络交互方式的遥测数据,这对于训练模型、测试新功能以及通过将部分工作转移到用户自己的设备上来降低基础设施成本都极其宝贵。

OpenAI Atlas:主要特性和初始安全边界
2025年10月21日,OpenAI发布了ChatGPT Atlas的首个macOS公开版本。这款人工智能浏览器未来将扩展到Windows、Android和iOS平台。其理念是让导航“成为”ChatGPT:用户无需再复制粘贴文本供模型处理,而是直接在当前页面上发出任务请求。
为了降低风险,OpenAI针对浏览器代理实施了多项专门设计的技术限制。Atlas 基于 Chromium,但其 AI 运行在独立的进程中,封装在 OpenAI Web Layer (OWL) 中。根据初始文档,该代理:
- 您无法运行代码或安装扩展程序。 靠自己
- 它缺乏以下能力 独立下载文件或访问其他本地应用程序.
- 他既不看也不用 保存的密码 既不自动完成数据 浏览器。
- 您无法访问 超出其范围的设备信息 导航。
在隐私方面,OpenAI承诺采用“默认隐私”策略:除非用户明确授权,否则与Atlas的交互不会用于训练模型。此外,浏览器内存(即记住页面和上下文的功能)默认处于禁用状态,必须手动启用。
用户还可以删除历史记录和记忆,定义 ChatGPT 可以交互的网站,甚至一键完全屏蔽 AI。在银行或敏感服务等关键网站上,Atlas 要求在代理执行操作前进行人工确认,以防止未经授权的交易或自动转账。
这些安全措施是朝着正确方向迈出的一步,但它们并不能消除根本问题:人工智能浏览器比传统浏览器拥有更大的能力,一个漏洞、配置错误或设计决策就足以将其变成一个非常有利可图的攻击媒介。
人工智能的集成创造了一个全新的攻击面。我们指的不仅仅是传统的浏览器漏洞,还包括语言模型、网页内容和自动化操作之间交互的缺陷。这些是目前已发现的最重大风险。
提示注入和隐藏指令
所谓的提示注入是指将恶意指令隐藏在网页本身、看似无害的文本片段、隐藏的 HTML、论坛评论、markdown 标签,甚至图像中,然后通过 OCR 进行处理。
当用户要求代理对该页面进行总结、分析或交互时,该模型可以将这些指令解释为合法的用户命令,并以会话的所有权限执行这些命令:导航到新的 URL、点击按钮、复制私人数据、填写表单或发布敏感信息。
Brave 浏览器使用 Perplexity Comet 记录了一个实际案例:用户打开一个 Reddit 帖子,该帖子在“剧透”文本中隐藏了一组恶意命令。当用户在启用该代理的情况下点击“继续页面”按钮时,浏览器会:
- 访问 Perplexity 帐户设置并获取用户的电子邮件地址。
- 模拟登录 生成一次性密码 验证。
- 打开 Gmail(如果您已登录),找到包含验证码的邮件并阅读。
- 在Reddit帖子中直接回复。 用户的电子邮件地址和一次性密码将其置于攻击者的视野之内。
这一切都完全通过文本实现,无需恶意脚本或底层漏洞利用,用户只需点击一下即可。正是页面内容“操控”了代理程序,使其滥用权限。
剪贴板注入和OCR
另一种日益流行的攻击途径是剪贴板篡改。传统恶意软件已经利用剪贴板篡改来更改加密货币地址或拦截凭证;在人工智能浏览器的背景下,恶意软件可以读取你复制的内容并采取相应的行动,甚至在你不知情的情况下粘贴修改后的内容。
更复杂的是利用OCR处理的图像中隐藏的指令。浏览器可以读取嵌入在图像或屏幕截图中的文本,如果攻击者将命令隐藏在人眼无法察觉但识别系统可以识别的像素中,攻击者就可以像执行页面合法内容一样执行这些命令。
这两种情况下,问题都是一样的:该模型无法有效地区分“描述性”内容和“指导性”内容,并且倾向于服从任何听起来像命令的内容,尤其是当命令以具有说服力的方式呈现时。
个人和敏感数据的泄露和滥用
人工智能浏览器通常包含智能自动填充或表单管理功能,其功能远超传统的自动完成功能。如果恶意页面模仿合法表单(例如,来自银行、社交网络或SaaS提供商的表单),并且攻击者认为这样做可以“节省您的时间”,那么它无需您明确验证,即可自动填充您的姓名、地址、电话号码,甚至公司内部标识符等数据。
此外,如果浏览器还被授予查看所有已打开或最近使用的标签页的权限,风险将成倍增加:攻击者可以同时利用来自您的电子邮件、日历、联系人、企业客户关系管理系统或项目管理系统的信息来完成任务,从而扩大数据泄露的范围。虽然这在合法用途中可能有用,但一旦落入攻击者手中,它就成了敏感数据的宝库。
在商业环境中,这个问题更加严重。集成到工作流程中的人工智能浏览器扩展程序通常会请求非常广泛的权限:读取和修改所有网站的内容、访问 cookie 和会话、与 API 交互等等。这种组合非常适合窃取知识产权、财务报告、正在进行的设计、源代码或机密对话。
持久会话和账户劫持
现代浏览器会保持多个已认证的会话处于打开状态:电子邮件、云存储、社交网络、网上银行、工作工具、管理面板……如果代理能够与所有这些服务进行交互,并且会话不会过期或无限期地重复使用,那么攻击者就可以利用任何成功的注入来执行一系列操作,而无需再次入侵用户。
这为会话劫持和横向移动攻击打开了方便之门:一旦代理被欺骗,它就可以下载或删除文件、更改设置、向存储库添加 SSH 密钥、修改 CRM 中的记录或批准采购订单,所有这些都可以在用户已登录的不同服务的上下文中进行。
网络钓鱼、虚假信息和行动缺乏透明度
人工智能浏览器也特别容易受到“隐形”网络钓鱼攻击。人工智能代理本身可以被用来访问欺诈页面、填写身份验证表单或确认交易,而用户甚至看不到实际界面,只能看到模型生成的“友好”摘要。
此外,在向用户显示内容之前对其进行转换的系统会使虚假网站的检测变得更加复杂:人工智能可以弱化警告信号、重新排列元素,甚至生成合理的解释,从而使合法网站与旨在窃取凭据的副本更难区分开来。
另一个不太明显但同样严重的风险是容易受到虚假信息和操纵内容的影响。配置不当的模型,或者用被污染的数据训练的模型,可能会优先考虑带有偏见的来源,忽略警告,或者生成强化虚假叙事的回复。如果浏览器被广泛用于新闻采集,那么对现实认知或关键决策(例如投资、健康、政治)的影响可能相当大。
所有这些案例都存在一个共同的问题:代理行为的不透明性。许多交互都发生在“后台”,用户无法确切地看到哪些标签页被打开、哪些数据被复制或哪些按钮被按下。这使得审计、确定法律责任(究竟是用户还是人工智能所为?)以及及早发现异常行为都变得十分困难。
地址栏、伪装命令和零点击漏洞利用
现代浏览器的地址栏(或称地址和搜索栏)功能也带来了新的安全隐患。在人工智能控制的场景中,恶意指令可以伪装成看似无害的网址或搜索查询。如果模型分析你的输入内容并试图通过直接执行操作来“帮助”你,最终可能会将你引导至攻击者控制的网站或执行一系列未经授权的任务。
与此同时,人工智能生态系统中零点击漏洞的激增表明,有时甚至无需直接交互:仅仅接收电子邮件、日历邀请或与代理集成的平台上的消息就足以触发恶意逻辑。例如,Microsoft 365 Copilot 中的 EchoLeak 漏洞就展示了攻击者如何利用自动图像上传、Markdown 解析和内部代理等漏洞,在无需用户干预的情况下提升权限并窃取数据。
这种类型的攻击不仅限于大型办公套件:任何装有 AI 代理的浏览器,如果该代理暴露于网络邮件、消息传递或管理面板,并且模型自动与接收到的内容进行交互,都可能成为受害者。
人工智能驱动的扩展程序、供应链和影子人工智能
除了内置人工智能的“官方”浏览器之外,还有大量基于语言模型的浏览器扩展程序,它们承诺能立即提升工作效率:写作助手、情感检测器、高级自动补全、会议摘要等等。这些扩展程序通常会请求高度侵入性的权限,并且在很多情况下会将数据发送给不透明的外部服务。
这种情况会引发一系列供应链漏洞:第三方库、未经审计的 API、位于其他国家的推理服务器、不受控制的自动更新……恶意行为者可以购买最初合法的扩展程序,并在用户不知情的情况下进行更新,从而收集敏感数据或在企业环境中植入恶意软件。
所有这一切都因“影子人工智能”(Shadow AI)而变得更加复杂,即未经IT部门批准或不公开使用这些工具。出于好意的员工为了提高工作效率而安装人工智能扩展程序,可能在不知不觉中将受GDPR、HIPAA或PCI DSS保护的信息导出给不符合相关法律或安全标准的第三方供应商。
对隐私、监管合规和网络犯罪的影响
这种新情况的直接后果是个人隐私和商业机密面临的风险急剧增加。管理不善的人工智能浏览器或扩展程序可以在无人察觉的情况下窃取书籍、订阅的科学文章、财务报告草稿、战略规划、专有代码或客户数据。
在家庭环境中,我们已经看到了一些具体问题:ChatGPT 甚至由于技术故障显示了其他用户的聊天记录片段;对话分享功能生成的 URL 可被搜索引擎索引,导致成千上万的私人对话对所有人可见。不难想象,当智能助手拥有对网络流量和本地文件的完全访问权限时,会发生什么。
在企业界,知识产权或监管数据的泄露可能导致数百万美元的罚款、竞争优势的丧失以及声誉损害。如果会议转录扩展程序将与敏感客户的对话存储在第三方服务器上,或者人工智能浏览器使用机密财务信息来训练模型,则该组织可能违反 GDPR、CCPA、HIPAA 或其他行业法规。
与此同时,网络犯罪分子正在利用企业梦寐以求的功能。人工智能辅助的勒索软件和多态恶意软件已在实际攻击中出现:例如 PromptLock 等恶意软件家族能够动态生成脚本,在 Windows、macOS 或 Linux 系统中穿梭,逃避检测并加密数据。所谓的“暗黑勒索软件模型”(Dark LLM)——专为犯罪目的而修改的开放模型——能够实现侦察、凭证窃取和整个入侵活动的自动化。
近期研究表明,嵌入企业工作流程中的机器学习模型(LLM)可能通过精心设计的提示或被篡改的训练数据而被诱骗安装恶意软件、提取数据或操纵结果。随着人工智能浏览器成为主要的网络接口,这种威胁将蔓延至几乎所有在线活动。
已实施的缓解措施和降低风险的建议
AI浏览器厂商开始做出反应。除了Atlas中已经讨论过的限制之外,Brave还提出了具体的最佳实践来缓解提示注入攻击和代理滥用问题:
- 明确区分用户命令和网页文本避免在同一指令通道中将两者混合传递给模型。
- 要求 任何敏感操作均需明确确认 (购买、配置更改、资金转账、访问电子邮件)。
- 隔离 基本导航代理的高级功能因此,仅仅访问一个页面并不意味着能够自动执行操作。
- 治疗 默认情况下所有网络内容均被视为不受信任。需要用户明确发出意图信号才能执行操作。
与此同时,一些公司,例如 OpenAI,提供精细的可见性和记忆控制:阻止 AI 在特定领域内运行,默认禁用数据用于训练,允许用户随时删除对话和记忆,或者要求对被认为至关重要的网站进行人工审批。
从用户公司的角度来看,应尽快实施一些基本的卫生措施:
- 明确的人工智能使用政策允许使用哪些浏览器和扩展程序,它们可以处理哪些数据以及在什么条件下可以处理这些数据。
- 持续为员工提供培训,并进行讲解 快速注入、人工智能定向网络钓鱼和数据泄露的风险.
- 使用 虚拟化或隔离环境 对于高风险任务,可以使用虚拟桌面基础架构 (VDI)、沙箱等工具,以便更容易控制事件的发生。
- 实施 以浏览器为中心的安全解决方案 监控扩展程序、异常行为和数据泄露。
专家认为,“理想的AI浏览器”应该允许用户一键启用或禁用特定站点的智能处理功能,隔离模型在不同领域的上下文,始终确认敏感数据的输入,按操作系统限制文件访问权限,甚至允许用户选择本地模型而无需将数据发送到云端。目前尚无任何产品能够满足所有这些要求,因此必须通过外部安全层来补充。
浏览器搭载人工智能代理所带来的局面既强大又脆弱:如果管理得当,它们可以使高级自动化普及到日常生活中;如果疏于管理,它们则可能成为攻击者的首选工具。关键在于技术措施(隔离、用户控制、注入检测)如何发展,以及组织和个人在了解浏览器中这个“助手”的具体功能方面投入多少精力。