首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >端云协同 >端云协同在大模型推理中如何发挥作用?

端云协同在大模型推理中如何发挥作用?

词条归属:端云协同

1. 任务切分与模型切分

端云协同通过两种切分策略优化大模型推理效率。任务切分是将完整的 AI 工作流切割为多个子任务,目前主要以静态切分为主,未来将朝动态任务切分方向发展。模型切分是将 AI 模型沿网络结构切分为多个子模型,中国电信已在探索边缘算力与云侧算力的模型切分来实现 Prompt 不出域的安全推理方案。

2. Token 调度与消耗优化

荣耀 YOYO Claw 技术通过"端云协同、端侧优先"及 Token 调度引擎,将综合词元消耗降低 50%。其核心逻辑是简单查询、高频交互在端侧小模型完成,复杂推理才调用云端大模型。智慧园区等多设备协同场景通过工具描述优化等技术将词元消耗降低 40% 至 70%,并实现本地推理零云端词元费用。

3. 离线大模型推理

南航在 2026 年完成端侧离线大模型 2.0 版本升级,获得中国互联网协会的团体标准认证。该升级依托云端协同、量化加速、架构创新等技术,面向民航客舱服务、机务维修等场景,强化了无网络环境下的智能服务能力。这表明端云协同不仅服务于在线场景,也能有效支撑离线状态下的大模型推理。

4. 端云协同推理框架

智能辅助诊断系统的云边大模型协同推理框架采用分层架构设计,边缘侧部署轻量化医疗大模型支持本地快速推理,云端汇聚通用大模型与医疗垂直大模型。智能体经语义解析提取关键特征后,动态决策推理节点——若分配至边缘侧则直接返回结果,若需云端处理则先通过动态语义脱敏匿名化敏感字段再上传,有效规避隐私泄露风险。

相关文章
vLLM中如何实现大模型推理加速技术?
输入三个prompt,token长度分别是:31、29、30,vllm会concat成一个长度为90个token的输入,一次跑完prefill。
aaronwjzhao
2025-11-17
1.5K1
如何在不可信的云环境中,构建兼具极致性能与卓越安全的大语言模型(LLM)推理服务?
打开链接点亮社区Star,照亮技术的前进之路。每一个点赞,都是社区技术大佬前进的动力
隐语社区小迷弟
2025-11-04
5390
多模态Agent开发实战营:在腾讯云上构建“能看会听”的数字员工
在2026年的今天,企业AI的竞争早已跨越了单纯的文本对话阶段,全面进入了多模态感知的深水区。真正的智能体(Agent)不再仅仅是“会聊天”的助手,而是进化成了能看懂报表、听懂语音、甚至能实时处理视频流的“数字员工”。多模态Agent开发实战营的圆满落幕,正是为了帮助开发者打破单一模态的桎梏,依托腾讯云强大的全栈生态,掌握构建下一代跨模态智能系统的核心能力。
用户12502941
2026-05-27
2710
C++20 协程:在 AI 推理引擎中的深度应用
在人工智能推理引擎的世界里,性能就是生命。一个成熟的推理系统要同时处理成百上千的请求,调度 CPU、GPU、网络 I/O,还要保证低延迟、高吞吐。如果你做过这类系统,就会知道它的复杂程度往往不在算子本身,而在调度与数据流的编排上。
海棠未眠
2025-10-22
5060
算法服务器是什么?从技术架构到应用场景的深度解析
在人工智能和大数据技术蓬勃发展的今天,“算法服务器” 已成为支撑企业智能化转型的核心基础设施。简单来说,算法服务器是专门为算法运行(尤其是复杂 AI 算法)提供高性能计算、数据处理和模型部署的专用服务器。它与普通服务器的本质区别在于:通过硬件加速、分布式架构和软件优化,将算法的开发、训练、推理过程高效落地,解决传统服务器在算力、实时性、资源调度上的瓶颈。
用户10637826
2025-04-30
7910
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券