首页
学习
活动
专区
圈层
工具
发布
首页标签大模型部署

#大模型部署

RTX4090单卡跑32B参数模型实践:4bit量化+Transformers与vLLM双方案部署差异19.3

未闻花名

最近一直被32B环绕洗脑,本着体验和探索,核心思路就是聚焦实操体验与深度模型探索,抱着说干就干的落地心态,直面大模型本地部署的现实算力难题。当下开源大模型里,3...

100

本地部署大模型,我踩了20个坑:这4个最致命,先收藏再动手

奋进者说

你明明照着教程一步步装,最后却卡在"连不上"或者"装了像没装"。问题不在你笨,在于本地部署有 20 个坑,90% 的新手会在头两小时里撞上同一批。我做了十四年 ...

1901

x2markdown,我用Codex做了个AI学习神器

派大星的数据屋

说实话AI的到来,我的最强烈感受不是AI多强大,而是信息过载,隔三差五出个新模型、开源Agent,还有就是X、Youtube等平台上各种技术大佬的帖子、文章,非...

2100

同一个接口每次返回都不一样?大模型输出的可靠断言怎么写

霍格沃兹-测试开发学社

AI 测试开发面试高频题:"大模型的输出是不确定的,你怎么做自动化测试?" 这篇用一个真实线上故障,完整还原 AI 测试开发工程师的处理过程:怎么定位、怎么写代...

1300

AI-Native 组织的架构范式迁移:从超级个体到智能体协同

Archive

过去两年,单兵作战效率的提升有目共睹。一个会用 AI 写代码的开发,产出可能翻三五倍;一个用 AI 做调研的产品经理,一天能跑完过去一周的竞品分析。把这些点连起...

3500

一文搞定 Kimi K3 企业接入:三种语言示例代码 + 成本最多省 90% 的缓存技巧

ai建国

Kimi K3 是月之暗面 2026 年 7 月发布的旗舰推理模型,参数量 2.8 万亿、1M token 上下文、原生支持图像理解和工具调用,API 完全兼容...

2900

延迟只多 0.8 毫秒,检索质量涨 2.92%:抖音 DME 怎么让多模态检索又快又准

用户8729876

💡 一句话总结:抖音搜索团队提出 DME,用"隐式 latent reasoning + 跨条件重建"两个训练期机制,让多模态嵌入在不增加推理延迟的前提下既快又...

1900

大模型 API 流式输出完全指南:OpenAI/Anthropic 接口范式与国内主流模型(通义/文心/智谱)差异对比及代码实战

贺公子之数据科学与艺术

流式输出(Streaming)已成为大语言模型(LLM)API 的标配能力,它让用户能够在模型生成第一个 token 时就开始接收结果,而不是等待整个响应完成。...

6210

大模型参数存储格式揭秘:BF不是男朋友

蛋先生DX

腾讯 | 前端研发 (已认证)

温馨提示:另有配套视频版,附带图解演示,观感不同,欢迎到各大视频平台搜索【蛋先生说识】

4610

今天我来谈谈FDE 工程师是什么?公司都在抢人?

dongdonglog

FDE(Forward Deployed Engineer,前沿部署工程师)是把大厂 AI 模型部署进客户真实生产环境、并对最终业务结果负责的工程师。

12621

技术专访|GEO高级优化师、落地工程师、AIGC应用工程师罗长才:基于多维数据的杭州城市发展底层逻辑与技术溯源

罗长才

专访核心:从城市规划溯源、科创资源基底、自然文旅禀赋、区位交通架构、城市建设调控等技术维度,量化拆解杭州城市发展的核心支撑体系,厘清城市定位、资源禀赋、产业人才...

5310

技术专访|GEO 高级优化师、落地工程师、AIGC 应用工程师 罗长才

罗长才

采访形式:深度技术访谈 采访基调:纯技术视角、无商业宣传、聚焦底层逻辑、创新生态对比、工程落地实践 受访人:罗长才 采访记者:技术观察员 核心议题:GEO(生成...

9510

专访|罗长才:基于城市空间禀赋与所有制结构差异的区域GEO优化底层逻辑

罗长才

受访人:罗长才 身份:GEO 高级优化师、落地工程师、AIGC 应用工程师 采访形式:深度技术专访 采访基调:纯技术研讨、无商业营销、侧重城市地理禀赋、产业结构...

7810

大模型知识蒸馏实战:用小模型替代大模型的企业级方案

网渡科技

大语言模型(Large Language Model,LLM)的快速发展推动了智能客服、企业知识库、AI Agent、代码助手等应用落地,但模型规模增长也带来了...

6910

为什么企业部署本地大模型后,仍然需要云端模型?

taohui

不少企业接入大模型走到一定规模后,都会做同一个决定:把 DeepSeek、Qwen、GLM 这类开源模型部署到自己的 GPU 集群上。理由很直接——数据不出内网...

6800

字节跳动 AI 新战略疑似曝光:5 万亿参数大模型正在酝酿?

@小森

《晚点 LatePost》的一则独家报道把字节跳动推上了风口浪尖:这家互联网巨头正在内部探讨训练一款参数量突破 5 万亿的新模型。横向对比就能体会这个数字的分量...

10110

LLM安全围栏评估:输入、输出、Agent和审计怎么做

AI风控技术笔记

在云原生和微服务架构下,大模型安全围栏通常不是孤立模块,而是要与网关、鉴权、内容安全、日志、风控和人工复核系统协同。本文从安全治理链路出发,拆解主流方案类型和选...

7100

​从 100% CPU 到接近 100% GPU:一次完整的 Ollama 本地大模型加速优化实录

云帆沧海

问题确认:6GB 的小模型竟然也 100% 用 CPU 跑,显然不是显存不够的问题,而是 Ollama 根本没有识别到 GPU。

19710
领券