- Windows 中的 NPU 将 AI 任务从 CPU 和 GPU 卸载,通过在设备上直接运行模型来提高性能、电池续航时间和隐私性。
- 运行 Windows 11 的 Copilot+ PC 需要 NPU 上超过 40 TOPS 的性能,并使用 Windows ML 和 ONNX Runtime 自动利用 CPU、GPU 和 NPU。
- 英特尔、AMD 和高通正在将高性能 NPU 集成到他们的 SoC 中,从而为办公任务、创意、安全和专业用途提供先进的 AI 功能。
- 任务管理器、WPR、WPA 和 GPUView 等工具可以帮助您测量 NPU 的实际使用情况,并优化模型和应用程序,从而最大限度地利用硬件。
Windows 系统中 NPU的出现彻底改变了我们在 PC 上使用人工智能的方式。过去几乎完全依赖云端的人工智能,现在开始直接运行在我们的笔记本电脑、台式机和迷你电脑上,速度、电池续航时间和隐私保护都得到了极大的提升。Windows 11,尤其是搭配全新的 Copilot+ 设备和英特尔、AMD 和高通的最新处理器,正是这场变革的核心。
如果您正考虑在未来几个月内升级电脑,那么了解什么是NPU(非处理器)、微软为何在Windows 11的许多高级AI功能中需要它、它在Copilot+ PC中的作用、哪些处理器型号包含它,以及哪些实际应用已经开始利用这款新芯片至关重要。让我们开门见山地深入了解一下,以便您能够做出明智的升级决定。
NPU究竟是什么?为什么现在大家都在谈论它?
在现代计算机中,我们所说的NPU(神经处理单元)指的是专门用于执行神经网络和其他机器学习算法的数学运算的处理器。它的目的并非取代CPU或GPU,而是作为它们的补充,处理所有与人工智能相关的任务。
与中央处理器 (CPU) 不同,CPU 旨在按顺序执行逻辑指令,而显卡则专注于大规模像素渲染,NPU 从一开始就被设计成以惊人的速度和极低的功耗进行数字矩阵的乘法和累加运算。这正是人工智能模型“思考”的基础,从人脸识别到图像生成,无所不包。
实际上,我们可以说 NPU 成为系统和应用程序所有智能功能的特定引擎,从视频通话中的背景虚化到实时转录,包括像 Copilot 这样的助手或高级视频编辑滤镜。
一项关键优势在于,人工智能可以直接在设备上运行,无需将数据发送到远程服务器。这提高了隐私性,降低了延迟,并减轻了 CPU 和 GPU 的负担,使它们能够执行其他任务。
此外,许多制造商正在设计这些单元,使其能够使用精度较低的格式,例如 INT8 而不是 FP32。由于进行准确预测不需要极高的数学精度,因此 NPU每次推理都可以节省大量能源,这对于笔记本电脑和迷你电脑尤其重要。
CPU、GPU 和 NPU:现代 SoC 的三大组成部分
现代 Windows 11 设备中使用的处理器通常采用系统级芯片 (SoC) 架构,其中 CPU、GPU 和 NPU 集成在同一块硅芯片上。这种物理上的接近使得它们可以共享系统内存,并在彼此之间传输任务而不会出现明显的瓶颈。
在这个三角形中,CPU 充当控制中心,GPU 负责大规模图形并行处理,而 NPU 则完全专注于机器学习和神经网络运算。它们各自有其擅长的领域,Windows 11 会根据工作负载来决定它们的职责分配。
当系统需要应用视频特效、进行即时语音翻译或运行 ONNX AI 模型时,Windows 11 会分析可用硬件,如果检测到 NPU,则会将这些任务分配给它,以在性能和功耗之间取得最佳平衡。如果由于任何原因 NPU 不可用,则会由 GPU 或最终由 CPU 接管。
这种智能任务分配在轻薄笔记本电脑、迷你电脑和一体机中尤为重要,因为这些设备的散热和功耗控制至关重要(参见我们的笔记本电脑硬件教程)。将持续的AI工作卸载到NPU可以防止CPU过热并降低频率,从而保持系统整体流畅运行。
就效率而言,传统的 GPU 运行一些复杂的 AI 算法可能需要消耗数十瓦的功率,而NPU 可以用更低的功耗完成同样的工作,从而在密集型 AI 场景下轻松延长电池续航时间 15% 到 20%。
NPU 和 Windows 11:Copilot+ PC 的作用
微软更进一步,推出了Copilot+ PC,这是一种全新的 Windows 11 电脑,旨在将人工智能融入用户的日常生活,而非仅仅作为一项附加功能。这些电脑的显著特点之一是配备了高性能 NPU,其运算速度可超过 40 TOPS(每秒万亿次运算)。
40 TOPS 以上的性能要求并非随意之举:Windows 11 的许多新 AI 功能,无论是在系统层面还是应用程序层面,都需要这种持续的性能才能提供实时翻译、图像生成、视频特效和智能助手,而不会影响电池续航时间或其他任务的性能。
实际上,Copilot+ PC 的设计宗旨是提供全天候电池续航时间、持续可用的 AI 体验,以及直接访问微软最先进的 AI 模型和功能。其理念是,您可以利用 Copilot 来辅助工作、学习或创作,而无需过度依赖云服务。
这些系统依赖于高通(例如骁龙 X Elite 系列)、AMD(例如最新的 Ryzen AI)和英特尔(酷睿 Ultra 及其后续产品)的下一代处理器——如需比较不同选项,请参阅英特尔和 AMD 处理器的等效性。它们都采用了集成三个处理引擎(CPU、GPU 和 NPU)的设计理念,从而使 Windows 11 能够高效地分配工作负载。
Windows 11 平台本身正准备通过独特的体验来利用这些功能,例如改进的视频通话效果、智能文档组织、总结本地内容的助手,以及依靠人工智能而无需不断将数据发送到云端的创意功能。
骁龙 X Elite 芯片和高通的赌注
Copilot+ PC 的关键组件之一是高通公司开发的基于 Arm 架构的骁龙 X Elite 芯片。这款处理器在设计之初就考虑到了 AI 集成,并集成了功能强大且极其节能的 NPU。
骁龙 X Elite 的 NPU 可以并行处理大量数据,每秒可达数万亿次运算,使其能够处理 AI 密集型任务,例如同步翻译、图像增强或实时分析,而不会很快耗尽电池电量。
Windows 11 能够协调这些设备中 CPU、GPU 和 NPU 的协同工作。系统会随时根据任务需要选择最合适的组件,力求在速度、响应能力和能耗之间取得最佳平衡。这使得笔记本电脑轻薄便携,电池续航时间长达一天,并能持续提供流畅的 AI 体验。
这种方法的主要优势在于,Copilot+ PC 中的许多 AI 体验可以直接在设备本身运行:从 Windows 11 功能到针对 NPU 优化的第三方工具。这降低了对互联网连接的依赖,并提高了数据安全性。
高通还通过其高通人工智能中心为开发者提供特定资源,您可以在这里找到已经针对这些 NPU 进行优化和验证的模型,这些模型可以在搭载骁龙 X Elite 的 Copilot+ 设备上高效运行。
Windows 如何检测和使用 NPU 进行人工智能
与PC中的其他硬件资源一样,NPU需要操作系统和应用程序才能与其通信并利用其功能。微软一直在改进访问这些单元的方式,目前推荐使用Windows机器学习(WinML或WinML)作为主要方法。
曾几何时,DirectML 是 Windows 平台上 AI 加速的标准方法,但现在WinML 已成为主流。这一转变旨在简化开发者的工作,并使应用程序能够尽可能无缝地利用 NPU 和 GPU,无论是在 Copilot+ PC 还是其他配备 Intel 或 AMD NPU 的设备上。
借助 Windows ML,系统会自动检测与设备硬件兼容的执行提供程序 (EP)。开发者无需手动打包特定于制造商的库,Windows 会通过系统本身或 Windows 更新以集成的方式下载和管理这些 EP。
Windows ML 的核心仍然使用 ONNX Runtime 作为推理引擎,但它对开发者隐藏了管理不同硬件供应商的大部分复杂性。微软直接与高通、英特尔、AMD 和其他合作伙伴协作,以确保每一代新芯片都能获得更新和优化的扩展程序 (EP)。
当应用程序在配备 NPU 的 PC 上使用 Windows ML 部署 AI 模型时,整个过程是自动的:WinML 会检查哪些加速器可用,选择最高效的 EP(例如,高通 NPU 使用 QNN,英特尔平台使用 OpenVINO 等),加载该 EP,然后开始推理。如果出现问题,WinML 会自动切换到 GPU 或 CPU,无需用户干预。
模型格式、量化和开发者工具
AI 模型通常最初使用 FP32 等高精度格式进行训练,但消费级 NPU 往往使用 INT8 等较小的表示形式效果更好,从而实现更高的性能和能效。
这意味着模型必须先进行转换或量化才能在NPU上运行。许多模型都以优化的ONNX格式提供,可以直接使用;而那些想要自带模型(BYOM)的用户可以使用特定的工具链将其适配到硬件上。
其中最有趣的资源之一是高通AI中心,它提供经过验证和优化的模型,可在搭载骁龙X Elite处理器的Copilot+ PC上运行。此外,还包括广受欢迎的ONNX模型库,这是一个预训练的开源模型库,可在各种支持NPU的设备上运行,包括英特尔和AMD的设备。
为了优化自身模型,微软推荐使用 Olive,这是一款与 ONNX Runtime 集成的工具,可处理压缩、优化和面向 NPU 的编译。这种组合能够在相同的硬件条件下显著提升性能,这对于每一瓦都至关重要的笔记本电脑来说尤为重要。
整个生态系统让开发人员更容易专注于用户体验,并将底层硬件集成交给 Windows ML、ONNX Runtime 和相关工具,而兼容性和维护问题过去正是在这里出现的。
如何在 Windows 系统中测量 NPU 的实际性能
将 AI 功能集成到应用程序中时,至关重要的是要测量模型在 NPU 上的实际性能,并了解系统内部的运行情况。Windows 提供了多种诊断和跟踪工具,可以非常详细地完成这项工作。
用户首先可以访问的是Windows 11 任务管理器。在“性能”选项卡中,除了 CPU、内存、磁盘、Wi-Fi 和 GPU 之外,还有一个专门针对 NPU 的部分。您可以在这里查看 NPU 的使用率、驱动程序版本和其他相关数据。
对于开发人员和高级用户,还可以使用其他更强大的工具,例如Windows 性能记录器 (WPR),它现在包含一个神经处理配置文件来记录 NPU 活动,以及Windows 性能分析器 (WPA),它允许您分析这些记录。
WPR 通过 Microsoft 的 MCDM 驱动程序模型生成系统与 NPU 交互的详细跟踪信息。然后,WPA 允许您在同一时间线上查看显示 CPU、磁盘、网络、ONNX 运行时事件以及专用 NPU 表的图表和时间线。
这使得我们可以考察诸如工作负载、模型加载时间、推理会话创建、执行提供程序配置参数、每次推理的时间以及AI模型中每个算子的性能特征等各个方面。甚至可以观察NPU子硬件指标,例如内存带宽。
其他工具:GPUView、ONNX Runtime 和硬件配置文件
除了 WPR 和 WPA 之外,Windows 生态系统还提供了其他实用程序,帮助用户更好地了解 NPU 在运行 AI 模型时的具体操作。其中之一是 GPUView,它可以读取跟踪文件(.etl)中记录的事件,并以可视化的方式显示出来。
GPUView 现在不仅可以显示 GPU 操作,还可以显示NPU 活动以及与 MCDM 设备相关的 DirectX 事件。这有助于了解当应用程序同时大量使用 AI 和图形处理时,工作负载在 GPU 和 NPU 之间的实际分配情况。
另一方面,ONNX Runtime 从 1.17 版本开始,并在 1.18.1 版本中得到改进,它会发出运行时事件,这些事件可以使用 WPA 进行捕获和可视化。这使您可以查看模型加载所需的时间、正在使用的 EP 配置、NPU(例如 QNN)上的推理行为以及模型中每个运算符消耗的时间。
开发者可以将特定的 ONNX Runtime 配置文件与其他 WPR 配置文件(CPU、磁盘等)结合使用,从而非常精确地了解时间消耗在哪里以及如何优化性能。此外,Qualcomm Snapdragon Profiler (qprof) 等第三方工具可以提供系统级视图,并在骁龙平台上提供更详细的 NPU 指标。
借助这套实用程序,不仅可以验证 NPU 是否正在使用,还可以检测瓶颈、意外延迟或次优配置,并进行纠正,以最大限度地利用可用硬件。
如何判断你的 Windows 电脑是否配备了 NPU 以及它如何利用 NPU 的优势
对于最终用户来说,最常见的问题是:我的电脑是否真的配备了NPU(非物理处理器),以及Windows是否正在使用它?最简单的检查方法是打开任务管理器(Ctrl+Shift+Esc),切换到“性能”选项卡,然后查找名为“NPU”的部分。
如果出现专用的 NPU 图表,则表示您的计算机配备了这种专用处理器。您可以在“进程”选项卡中查看哪些应用程序正在使用 NPU 资源,或者使用高级工具进行更深入的技术分析。如果未出现专用的 NPU 图表,则可能需要检查您的计算机系统配置以及BIOS 或 UEFI 设置,以确认固件调整或加速器支持情况。
在现代计算机中,NPU(非物理处理器)的应用越来越普遍,尤其是在通过 Copilot+ 认证的笔记本电脑以及搭载 AMD、Intel 或 Qualcomm 最新一代处理器的电脑中。制造商正将这些单元作为标准硬件组件集成到电脑中,就像 GPU 曾经集成到处理器中一样。
在许多情况下,用户无需改变任何工作方式即可开始注意到这些优势:更清晰的视频通话、实时应用无延迟的效果、使用智能功能时更长的电池续航时间,以及即使同时运行多个任务也能感受到整体的流畅性。
对于那些对技术感兴趣的人来说,Windows 跟踪工具可以让你准确地知道哪些进程正在向 NPU 发送工作负载以及它们的使用模式,如果你正在测试新软件或者想要验证应用程序是否真正利用了硬件,这将非常有用。
已经在 Windows 系统中利用 NPU 的实际应用程序
抛开理论不谈,更有趣的是观察哪些日常程序正在利用 Windows 的 NPU。这个列表每月都在增长,但一些知名程序已经开始依靠这款芯片来加速其 AI 功能。
在图像编辑领域,Adobe Photoshop就是一个典型的例子。如果电脑配备了 NPU(非处理器),那么像自动对象选择、背景移除和实时降噪这样的 AI 工具就能运行得更快,从而释放 GPU 的资源用于其他渲染任务。
在安全性方面,诺顿杀毒软件集成了人工智能驱动的功能,利用神经网络处理单元 (NPU) 更快地检测网站上的网络钓鱼和诈骗行为。这使得实时防护速度更快,而不会占用过多 CPU 资源或降低系统速度。
在设计和视觉内容领域,Canva等平台不断添加功能日益强大的 AI 驱动的生成和编辑工具。当有 NPU 可用时,许多此类功能可以通过本地硬件加速,从而减少应用滤镜、生成背景或智能调整时的等待时间。
在视频编辑方面,DaVinci Resolve Studio还集成了可受益于本地 AI 加速的工具,例如降噪、人脸识别、自动取景和其他高级功能。将这些任务委托给 NPU 可以带来更流畅的编辑体验和更短的导出时间。
此外,在操作系统层面,Windows Studio Effects、Copilot 和其他 Windows 11 功能利用 NPU 实时运行视频特效、语音隔离或上下文助手,使 CPU 专注于用户打开的生产力应用程序。
市场上的NPU:英特尔、AMD、高通以及人工智能PC的推动
在个人电脑中采用NPU并非孤例:种种迹象表明,我们正在见证一场类似于固态硬盘(SSD)普及或GPU集成到处理器中的根本性变革。IDC等分析公司估计,到2025年,将有超过100亿台个人设备(笔记本电脑、平板电脑和台式机)搭载集成NPU。
在此背景下, AMD、英特尔和高通是投资PC原生AI的三大主要厂商。它们各自采取不同的方法,但目标一致:使AI能够快速、高效且私密地直接在用户硬件上运行。
例如,AMD推出了Ryzen AI Max系列和Ryzen AI 300系列,采用了Zen 5和XDNA 2等架构。其中最先进的型号可提供高达55 TOPS的AI性能,是上一代产品的五倍,并实现了极其强大的超便携外形。要了解更多关于其架构的信息,您可以阅读有关AMD RDNA 5和uDNA的文章。
在这个价位区间, AMD Ryzen AI 9 HX 370等处理器脱颖而出,其 NPU 性能达到 50 TOPS,比 Copilot+ PC 的最低要求高出 25%。Ryzen AI 395+也同样出色,能够为要求苛刻的本地模型提供更强大的持续 AI 性能。得益于其空间数据流技术,这些芯片无需频繁访问 RAM 即可在 MAC 单元之间传输数据,从而降低延迟和功耗。
英特尔方面已明确表示,人工智能是其发展路线图的核心:其目标是在几年内出货超过100亿颗配备专用人工智能加速器的处理器,实现高达120 TOPS的综合性能,并在数百家独立软件开发商的支持下,支持超过500种基于人工智能的功能。要了解其芯片的最新发展,请查看我们关于英特尔处理器的最新新闻。
至于高通,其骁龙 X Elite PC 平台已成为 Copilot+ PC 的支柱之一,巩固了 CPU、GPU 和 NPU 在高效 SoC 中共存的模式,非常适合具有数小时电池续航时间和始终可用 AI 功能的超薄笔记本电脑。
不同类型用户的优势:从办公自动化到本地人工智能
许多人最关心的问题是:在 Windows 系统中使用 NPU 能给我的日常工作带来哪些好处?答案取决于具体的使用方式,但几乎所有普通用户都能从中受益。
对于办公人员来说,NPU 可以让视频通话中的 Windows Studio 特效(背景虚化、自动对焦、光线增强、语音隔离)等功能在不占用过多 CPU 资源的情况下运行。这样就能释放更多 CPU 资源,用于处理大型电子表格、同时运行多个办公应用程序以及进行高强度网页浏览,而不会导致电脑运行速度变慢。
即使在网络连接受限的情况下,学生和远程团队也能利用实时翻译、自动音频转录和文档摘要助手等功能。本地人工智能技术能够显著降低延迟,提升国际会议体验。
无论是摄影还是视频领域的创意专业人士,都能受益于NPU加速的滤镜、场景识别、智能蒙版和更快的生成式填充功能,从而减少编辑和导出项目时的等待时间。这在高要求的工作流程中尤为显著。
最后,对于那些希望在本地电脑上运行AI模型的用户(例如,为了避免将敏感数据上传到云端),NPU恰好弥补了这一缺憾。在设备本身上处理推理过程,既能保护隐私,又能消除对网络连接的依赖,还能为本地聊天机器人、文档分类或图像分析等任务提供极具竞争力的响应速度。
在所有情况下,共同点是 NPU 使 AI 不再是只有在连接时才能工作的远程工具,而是作为 PC 的原生功能,始终可用并适应您的各种操作,从最简单的到最先进的。
关于 Windows 中 NPU、性能和隐私的常见问题
一个常见的问题是,NPU与传统显卡究竟有何不同。虽然 GPU 也能运行 AI 模型,但它的主要用途是图形处理,而 NPU 则专门用于加速神经网络和机器学习运算。这使得 NPU 能够将 CPU 和 GPU 从重复性的 AI 任务中解放出来,同时显著降低功耗。
另一个重要问题是它如何提升隐私保护。通过在本地运行 AI 功能,NPU 可以避免用户持续将个人数据发送到云端。对于那些处理敏感信息(例如记者、律师、医生、拥有关键数据的公司)或重视隐私的用户而言,与完全依赖远程服务相比,这具有显著优势。
在游戏方面,NPU 并不能取代 GPU,但它可以在某些情况下间接地提供帮助。例如,AMD FidelityFX 超分辨率技术利用 AI 来提升图像分辨率并提高帧率(或者像Nvidia 的 DLSS 5那样)。如果部分计算工作由 NPU 完成,GPU 就可以专注于纯粹的渲染,这在某些游戏中可以带来更均衡的整体性能。
人们自然会担心,集成到杀毒软件、助手或效率工具中的人工智能是否会“窥探”更多隐私。但事实恰恰相反,NPU(神经网络处理单元)的本地处理能力恰恰相反:设备本身处理的数据越多,需要传输到外部服务器的数据就越少,从而降低了攻击面。即便如此,查看每个应用程序的隐私政策仍然十分必要。
厂商和分析师普遍认为,NPU 和 AI PC 并非昙花一现,而是 PC 发展历程中的必然趋势,正如多核处理器和 SSD 存储技术在当时的发展一样。我们仍处于早期阶段,但市场上的种种迹象表明,短短几年内,NPU 将像集成 GPU 一样普及。
Windows 中 NPU 的所有这些发展趋势,都为人工智能从孤立的云服务转变为个人电脑的标准功能奠定了坚实的基础,从而打造出速度更快、效率更高、更私密的电脑,更好地适应我们每天的工作、学习和内容创作方式。