NPU 作为神经网络处理器专门用于 AI 推理,相比 CPU/GPU 具有更高的能效比。高通、联发科等厂商持续推出集成高性能 NPU 的移动芯片,使手机端能够流畅运行数十亿参数的大模型。随着国产存算一体端侧 AI 芯片陆续完成流片,端侧算力将在功耗、算力与带宽层面进一步提升。
通过模型量化、剪枝和知识蒸馏等技术,将大模型压缩至适合端侧运行的规模。DeepEye 张量压缩神经网络可在终端设备实现高效视频理解;荣耀通过自研量化压缩技术使大模型在端侧流畅运行,并结合"两锁一芯"硬件加密确保模型安全。面壁智能的量产级多模态模型已部署至多家头部手机厂商的产品中。
端侧智能不仅限于模型推理,还包括对环境的多模态感知和自主决策能力。面壁智能搭载于吉利银河 M9 车型的座舱模型,无需依赖云端即可完成"感知—记忆—推理—执行"的完整闭环,可根据环境与乘客状态自动调节车窗、空调等功能,在车辆事故场景下还能完成状态识别、情绪安抚与理赔流程引导。
端侧智能并非孤立存在,而是通过与云端的协同持续进化。端侧模型向云端反馈执行成效与场景数据,云端据此优化模型并下发更新。这种机制使得端侧设备能够在不更换硬件的前提下,通过软件更新不断提升智能水平,形成"越用越聪明"的良性循环。