拿手机绕房间拍一圈,AI 把墙、门、窗、家具全变成带坐标的数据——听起来像是家装、地产、机器人公司的救命稻草。 我把 SpatialLM 的 benchmark、License 条款、硬件门槛和成本账全扒了一遍。结论是:能用,但只能用一半,而且大部分人正在盯错地方。

老板刷到了 Demo 视频,转手甩进群里:"这个能做,下周排期。"
算法同学点开 GitHub,翻到 README 最下面那张 benchmark 表,沉默了三分钟,回了句:"这个……可能不行。"
两个人看的是同一个模型。区别在于,一个看的是演示视频,另一个看的是零样本那一栏。
这篇文章想干的事很简单:把这张表翻译成人话,再把它换算成钱和风险。看完你应该能当场判断——这东西进不进你的技术选型清单。
先交代研究对象。SpatialLM,群核科技(酷家乐母公司)开源的空间理解大模型。输入 3D 点云,输出一份结构化场景脚本:每面墙的坐标、门窗开在哪、59 类家具各自的位置尺寸。论文进了 NeurIPS 2025。 截至发稿:4667 Star / 395 Fork / 未关闭 issue 只剩 3 个,最后一次代码推送在一个多月前。
先看模型最能打的一面。在 Structured3D 数据集上做布局估计(识别墙、门、窗),微调后的成绩:
方法 | F1 @.25 IoU | F1 @.5 IoU |
|---|---|---|
RoomFormer | 83.4 | 81.4 |
SceneScript(Meta 出品) | 90.4 | 89.2 |
SpatialLM 1.1-Qwen-0.5B | 94.3 | 93.5 |
一个 0.5B 的小模型,把 Meta 的 SceneScript 干下去了 4 个点。这个成绩含金量是真的——参数量小意味着推理便宜,能塞进边缘设备。
然后翻到下一张表。零样本视频检测,也就是"手机拍一圈"这条真实链路上的表现:
识别对象 | F1 @.25 IoU | 企业视角解读 |
|---|---|---|
床 | 96.8 | 基本不会错 |
墙 | 68.9 | 能用,但需复核 |
沙发 | 66.9 | 三个里错一个 |
门 | 49.1 | 一半靠猜 |
窗 | 47.0 | 一半靠猜 |
椅子 | 20.8 | 基本等于没识别 |
数据来源:SpatialLM 官方 README,SpatialLM-Testset(107 个由 MASt3R-SLAM 从真实 RGB 视频重建的点云,含噪声和遮挡)。
94.3 和 20.8,中间隔的不是模型能力,是合成数据和真实点云之间的鸿沟。
训练它的数据集有 12328 个场景、54778 个房间,全部来自酷家乐平台上的真实设计项目。这些数据的优点是干净、标注精准、摆放逻辑合理;缺点也正是干净——它没见过你家客厅那把被外套盖住一半的椅子,也没见过手机绕圈时因为走太快糊掉的那面墙。
这是我做完这轮研究最想说的一句话: SpatialLM 是个"结构派"模型,不是"物件派"。 它对墙、门、窗、大件家具这类有强几何先验、位置稳定的东西理解得很好;对椅子这类小、多、易遮挡、摆放随机的物体,基本抓瞎。 想清楚这一点,你的产品设计方向就定了一半。

光看模型分数没意义,得看它替代的是什么。我把几个行业的现有成本基线拉了一遍:
做法 | 成本 | 周期 |
|---|---|---|
手工量房 + 建模(1500 sqft 住宅) | 现场 2–4 小时 + 建模 4–8 小时按 $100/h 算,$600–1200 | 1–2 天 |
Scan-to-BIMLOD 200(体量级) | $0.35–0.60 / sqft | 7–14 天 |
Scan-to-BIMLOD 300(含 MEP) | $0.60–1.50 / sqft | 3–4 周 |
10000 sqft 办公室全套 LOD 300 | 扫描 $4000–6000 + 建模 $18000–35000= $22000–41000 | 1 个月+ |
还有个数字很扎心:79% 的手工测量项目需要二次返场。漏量一个尺寸,回一趟工地,成本全是隐性的。
SpatialLM 支持导出 IFC 格式,能直接进 BIM 软件。这意味着它的靶心不是取代 LOD 300 的精细建模,而是那个$0.35–0.60/sqft 的 LOD 200 打底市场——先自动出一版粗模,人工在上面修,而不是从零开始画墙。
这块的成本对比更夸张:
数据来源 | 单位成本 |
|---|---|
真机遥操作采集(规模化) | 约 275 元/小时 |
UMI 便携方案 | 55–80 元/小时 |
高保真仿真合成 | 0.3–2 元/小时 |
一条 30 秒的真机操作数据,采集成本 10–15 元。凑够 20 万小时要花两个亿。而全行业目前累计的高质量真实交互数据大约只有 50 万小时,距离训练通用具身模型所需的千万小时量级,缺口在 95% 以上。
行业已经跑出了共识配方:10 份合成数据 + 1 份真机数据 ≈ 纯真机数据的训练效果,成本压到 1/20。有厂商跑的是 10% 真机 + 80% 仿真 + 10% 微调,Sim-to-Real 迁移成功率做到 85%,长尾场景覆盖率 99%。
这里必须澄清一个常见误读。 上面这些"数据成本"说的是操作轨迹数据(关节角度、力矩、视觉帧),而 SpatialLM 提供的是场景数据(房间长什么样、东西摆在哪)。这是两件事,不能直接换算。 但它们卡的是同一个瓶颈的两头:机器人换个房间就失灵,缺的往往不是动作样本,而是场景多样性。这才是 SpatialLM 真正的位置。
基于上面的精度分布和成本结构,我做了一张可用性分级表。这张表是这篇文章的核心。
场景 | 为什么可行 |
|---|---|
机器人训练场景批量生成 | 要的是数量和多样性,不是单个场景 100% 精确。识别错一把椅子不影响训练价值,反而增加了鲁棒性。这是它的主场。 |
空间数据预标注 | 模型先出一版,标注员在上面改。哪怕只对 70%,也能砍掉大半人力。关键是有人工兜底这一环。 |
AR 量房 / 户型图初稿 | 墙的识别 68.9 分,配合人工微调够用。生成的是"可编辑文本脚本"不是黑盒 mesh,改起来成本极低。 |
存量空间快速摸底 | 连锁门店、仓储、养老机构做资产盘点,要的是"大致什么结构",容错高。 |
场景 | 缺什么 |
|---|---|
家装量房正式交付 | 门窗只有 49 分,必须补人工复核或激光测距校准。改造成本要算进 ROI。 |
Scan-to-BIM 打底 | IFC 导出能力有,但精度只够 LOD 200。想上 LOD 300 得再叠一层。 |
室内导航底图 | 结构层可用,但通行障碍物(椅子 20.8 分)识别不住,得靠实时传感器补。 |
场景 | 为什么 |
|---|---|
施工验收 / 竣工核量 | 要的是毫米级和法律效力,模型给不了,也担不起责任。 |
面积计价 / 房产测绘 | 同上。这类场景一个数字错了就是纠纷。 |
保险定损 / 事故还原 | 需要可举证的精度链路和检定资质。 |
消防合规 / 疏散通道审查 | 门的识别只有 49 分,而门在这个场景里恰恰是最关键的对象。 |

大部分讨论都停在"手机拍一圈变 3D"。我觉得那恰恰是最不值钱的那个用法。
2025 年 8 月群核发布了 SpatialLM 1.5,配套一个对话系统 SpatialLM-Chat。输入一句"布置一个老人的卧室,床的一边有扶手",它自动生成结构化场景脚本、匹配家具模型、完成布局——现场演示里模型还自己加了把轮椅。
识别(看懂已有房间)会被真实点云的噪声拖后腿,生成(凭空造合规房间)不会。生成方向上,那个 94.3 分的结构理解能力是满血输出的。
对具身智能公司来说,这才是刚需:批量造出一万个不重样但都物理正确的家庭场景,扔进仿真器训机器人。成本从 275 元/小时降到 2 元以下。
我把群核的整个开源矩阵拉了一遍:
项目 | Star | 做什么 |
|---|---|---|
SpatialLM | 4667 | 点云 → 结构化场景(NeurIPS 2025) |
SpatialGen | 405 | 布局 → 多视角图像 / 3DGS(3DV 2026) |
InteriorGS | 284 | 3D 高斯语义数据集 |
ComfyUI-Lux3D | 112 | ComfyUI 生成 3D 模型节点 |
CAD2Program | 27 | 2D CAD 图纸 → 3D 参数化模型(AAAI 2025) |
看到最后一行了吗。
绝大多数家装公司、地产公司、物业公司手里堆着的,不是点云,是十几年积累下来的 CAD 图纸。让他们派人拿手机去几万套房子里挨个拍一圈?不现实。但把历史图纸批量转成 3D 模型?这是能立刻算出 ROI 的事。
一个 AAAI 2025 的工作,27 个 Star。这个数字本身就说明:开源社区的注意力分配,和企业的真实需求分布,压根不是一回事。
SpatialLM 吐出来的不是 mesh,是这样一段文本:

人看得懂,程序能解析,出错了手动改一行就行。
更关键的是——这是 LLM 能直接读写的格式。
意味着你可以把空间理解塞进 Agent 工作流:让大模型读懂房间结构,做推理,再改回去。"把这个房间改成无障碍布局"、"检查所有通道宽度是否大于 0.8 米"、"找出所有靠窗且面积大于 15 平的房间"——这些都是纯文本层面的操作。
市面上大多数三维重建方案给你的是一个黑盒模型文件,你只能看,不能问,更不能让 AI 改。这个差异,在 Agent 时代的权重会越来越高。
🚫 红线一:License 有雷,而且 GitHub 都识别不出来。 仓库的 License 字段显示 NOASSERTION——因为它是混合协议。 Qwen 版模型权重是 Apache 2.0,看着能商用。但 1.0 依赖的 SceneScript 点云编码器是 CC-BY-NC-4.0,1.1 换的 Sonata 编码器权重同样是 CC-BY-NC-4.0。 CC-BY-NC 里的 NC 就是 Non-Commercial。 换句话说:两个版本的编码器都不能直接商用。想做商业产品,你得自己换编码器重训,这个工作量不是"改个配置"级别的。法务这关,请在立项前过,不要在上线前过。
🚫 红线二:微调门槛比推理高一个数量级。 推理对显存要求不高,一张消费级卡能跑。但全量微调要 60GB 显存,官方明确说LoRA 还没支持。 而前面那些 90+ 的成绩,全是 finetuned 之后的。零样本状态下墙只有 68.9。 这意味着:想要论文里的效果,你必须微调;想微调,你得准备 A100/H100 级别的卡和你自己的标注数据。预算表上那行"模型免费"要打个问号。
🚫 红线三:发布会上的能力 ≠ 你能拿到的能力。 SpatialLM 1.5 和 SpatialLM-Chat 是 2025 年 8 月技术开放日发布的,媒体报道铺天盖地。 但我翻了主仓库:能跑的仍然是 1.1。1.5 的权重和代码没在 GitHub 上。 做技术选型的时候,请以仓库里能 clone 下来的东西为准,不要以新闻稿为准。这条适用于所有开源项目。
七、别忘了对面还站着一个苹果
做选型不能只看一个方案。企业里最现实的竞品其实是 Apple RoomPlan——2022 年就有的 API,很多人忘了。
Apple RoomPlan | SpatialLM | |
|---|---|---|
精度 | 约 1.3 cm | 看场景,波动大 |
速度 | 60–90 秒/房间 | 取决于重建链路 |
硬件 | 必须 iPhone Pro / iPad Pro(带 LiDAR)安卓完全不支持 | 任意点云来源手机视频 / RGBD / 激光雷达都行 |
可定制 | 黑盒,不能微调 | 开源可微调 |
家具识别 | 只有基础类别 | 59 类,可指定子集 |
输出 | USD / USDZ | 文本脚本 / IFC / 2D 户型图 |
费用 | 免费 | 模型免费,商用编码器有坑 |
RoomPlan 的其他限制:房间建议不超过 9×9 米,镜面、开着的门、弱光都会让结果退化,扫描超过 5 分钟设备会发热降频。
决策逻辑其实很清楚:
技术之外,还得看背后的人会不会跑路。这点上 SpatialLM 的答案挺硬的。
群核科技已经通过港交所聆讯,冲刺"全球空间智能第一股"。2025 年营收 8.2 亿,毛利率 82.2%,经调整净利润 5710 万,实现扭亏为盈。截至 2025 年 6 月底,平台沉淀了超过 4.41 亿个 3D 模型和 5 亿个结构化 3D 空间场景。
它开源不是做慈善,是一套很清晰的商业设计:工具沉淀数据 → 数据训练模型 → 模型反哺工具。开源模型负责占领开发者心智和技术标准,真正收钱的是酷家乐、SpatialVerse 和 Aholo 开放平台。
这对企业用户来说是好事也是提醒:
好事是——它不会像很多"开源完就没人管"的仓库一样烂尾。一年多时间从 1.0 到 1.1 再到 1.5,论文进 NeurIPS,数据集也放出来了,395 个 Fork 对 4667 个 Star(8.5% 的比例在这类项目里算高的,说明真有人在动手跑),未关闭 issue 只剩 3 个。这些都是活着的信号。
提醒是——你在用的是一家上市公司商业战略的一部分。免费的那部分永远会停在某条线上,越过那条线就该付费了。做长期架构决策的时候,把这个前提写进风险评估里。
如果你正准备把这东西塞进项目排期,先回答这三个问题:
💡 我的整体判断: 这不是一个"下载下来就能变现"的项目,它是一块地基。 真正的价值不在于它现在能识别多准,而在于它把"让机器读懂物理空间"这件事,从一个需要博士团队攻关的课题,变成了几行命令 + 一次微调。 空间大模型现在大概处在语言模型的 GPT-2 阶段——能用,但还没到涌现。这个阶段进场的人,赌的不是今天的精度,是明天的位置。


项目地址:github.com/manycore-research/SpatialLM 同组织值得看的:CAD2Program(2D 图纸转 3D)、SpatialGen(布局转多视角图像)、InteriorGS(3DGS 语义数据集)
本文数据来源:SpatialLM 官方仓库 README 及 benchmark 表、GitHub API 实时数据、群核科技港交所招股文件公开信息、行业公开成本调研。所有结论为独立分析,与项目方无关联。
下一篇想看哪个方向? 评论区告诉我:① CAD2Program 实操拆解 ② 空间大模型选型全景对比 ③ Agent 怎么调用空间理解能力
这个号只写一件事:把开源项目扒到能落地的颗粒度。 不写"太强了",只写"能不能用、成本多少、坑在哪"。