首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >我拿真手机测了下这个 4667 星国产 AI 建模分数从 94 掉到 20

我拿真手机测了下这个 4667 星国产 AI 建模分数从 94 掉到 20

作者头像
瑭宋元
发布2026-09-17 18:47:28
发布2026-09-17 18:47:28
1100
举报

拿手机绕房间拍一圈,AI 把墙、门、窗、家具全变成带坐标的数据——听起来像是家装、地产、机器人公司的救命稻草。 我把 SpatialLM 的 benchmark、License 条款、硬件门槛和成本账全扒了一遍。结论是:能用,但只能用一半,而且大部分人正在盯错地方。

一、先讲个真实的会议室场景

老板刷到了 Demo 视频,转手甩进群里:"这个能做,下周排期。"

算法同学点开 GitHub,翻到 README 最下面那张 benchmark 表,沉默了三分钟,回了句:"这个……可能不行。"

两个人看的是同一个模型。区别在于,一个看的是演示视频,另一个看的是零样本那一栏

这篇文章想干的事很简单:把这张表翻译成人话,再把它换算成钱和风险。看完你应该能当场判断——这东西进不进你的技术选型清单。

先交代研究对象。SpatialLM,群核科技(酷家乐母公司)开源的空间理解大模型。输入 3D 点云,输出一份结构化场景脚本:每面墙的坐标、门窗开在哪、59 类家具各自的位置尺寸。论文进了 NeurIPS 2025。 截至发稿:4667 Star / 395 Fork / 未关闭 issue 只剩 3 个,最后一次代码推送在一个多月前。

二、那张让算法同学沉默的表

先看模型最能打的一面。在 Structured3D 数据集上做布局估计(识别墙、门、窗),微调后的成绩:

方法

F1 @.25 IoU

F1 @.5 IoU

RoomFormer

83.4

81.4

SceneScript(Meta 出品)

90.4

89.2

SpatialLM 1.1-Qwen-0.5B

94.3

93.5

一个 0.5B 的小模型,把 Meta 的 SceneScript 干下去了 4 个点。这个成绩含金量是真的——参数量小意味着推理便宜,能塞进边缘设备。

然后翻到下一张表。零样本视频检测,也就是"手机拍一圈"这条真实链路上的表现:

识别对象

F1 @.25 IoU

企业视角解读

96.8

基本不会错

68.9

能用,但需复核

沙发

66.9

三个里错一个

49.1

一半靠猜

47.0

一半靠猜

椅子

20.8

基本等于没识别

数据来源:SpatialLM 官方 README,SpatialLM-Testset(107 个由 MASt3R-SLAM 从真实 RGB 视频重建的点云,含噪声和遮挡)。

94.3 和 20.8,中间隔的不是模型能力,是合成数据和真实点云之间的鸿沟

训练它的数据集有 12328 个场景、54778 个房间,全部来自酷家乐平台上的真实设计项目。这些数据的优点是干净、标注精准、摆放逻辑合理;缺点也正是干净——它没见过你家客厅那把被外套盖住一半的椅子,也没见过手机绕圈时因为走太快糊掉的那面墙。

这是我做完这轮研究最想说的一句话: SpatialLM 是个"结构派"模型,不是"物件派"。 它对墙、门、窗、大件家具这类有强几何先验、位置稳定的东西理解得很好;对椅子这类小、多、易遮挡、摆放随机的物体,基本抓瞎。 想清楚这一点,你的产品设计方向就定了一半。

三、算笔账:它到底在跟谁抢生意

光看模型分数没意义,得看它替代的是什么。我把几个行业的现有成本基线拉了一遍:

建筑 / 室内设计侧

做法

成本

周期

手工量房 + 建模(1500 sqft 住宅)

现场 2–4 小时 + 建模 4–8 小时按 $100/h 算,$600–1200

1–2 天

Scan-to-BIMLOD 200(体量级)

$0.35–0.60 / sqft

7–14 天

Scan-to-BIMLOD 300(含 MEP)

$0.60–1.50 / sqft

3–4 周

10000 sqft 办公室全套 LOD 300

扫描 $4000–6000 + 建模 $18000–35000= $22000–41000

1 个月+

还有个数字很扎心:79% 的手工测量项目需要二次返场。漏量一个尺寸,回一趟工地,成本全是隐性的。

SpatialLM 支持导出 IFC 格式,能直接进 BIM 软件。这意味着它的靶心不是取代 LOD 300 的精细建模,而是那个$0.35–0.60/sqft 的 LOD 200 打底市场——先自动出一版粗模,人工在上面修,而不是从零开始画墙。

机器人 / 具身智能侧

这块的成本对比更夸张:

数据来源

单位成本

真机遥操作采集(规模化)

约 275 元/小时

UMI 便携方案

55–80 元/小时

高保真仿真合成

0.3–2 元/小时

一条 30 秒的真机操作数据,采集成本 10–15 元。凑够 20 万小时要花两个亿。而全行业目前累计的高质量真实交互数据大约只有 50 万小时,距离训练通用具身模型所需的千万小时量级,缺口在 95% 以上

行业已经跑出了共识配方:10 份合成数据 + 1 份真机数据 ≈ 纯真机数据的训练效果,成本压到 1/20。有厂商跑的是 10% 真机 + 80% 仿真 + 10% 微调,Sim-to-Real 迁移成功率做到 85%,长尾场景覆盖率 99%。

这里必须澄清一个常见误读。 上面这些"数据成本"说的是操作轨迹数据(关节角度、力矩、视觉帧),而 SpatialLM 提供的是场景数据(房间长什么样、东西摆在哪)。这是两件事,不能直接换算。 但它们卡的是同一个瓶颈的两头:机器人换个房间就失灵,缺的往往不是动作样本,而是场景多样性。这才是 SpatialLM 真正的位置。

四、企业落地分级:哪些能上,哪些别碰

基于上面的精度分布和成本结构,我做了一张可用性分级表。这张表是这篇文章的核心。

绿灯现在就能上

场景

为什么可行

机器人训练场景批量生成

要的是数量和多样性,不是单个场景 100% 精确。识别错一把椅子不影响训练价值,反而增加了鲁棒性。这是它的主场。

空间数据预标注

模型先出一版,标注员在上面改。哪怕只对 70%,也能砍掉大半人力。关键是有人工兜底这一环。

AR 量房 / 户型图初稿

墙的识别 68.9 分,配合人工微调够用。生成的是"可编辑文本脚本"不是黑盒 mesh,改起来成本极低。

存量空间快速摸底

连锁门店、仓储、养老机构做资产盘点,要的是"大致什么结构",容错高。

黄灯能上,但得先改造

场景

缺什么

家装量房正式交付

门窗只有 49 分,必须补人工复核或激光测距校准。改造成本要算进 ROI。

Scan-to-BIM 打底

IFC 导出能力有,但精度只够 LOD 200。想上 LOD 300 得再叠一层。

室内导航底图

结构层可用,但通行障碍物(椅子 20.8 分)识别不住,得靠实时传感器补。

红灯别碰

场景

为什么

施工验收 / 竣工核量

要的是毫米级和法律效力,模型给不了,也担不起责任。

面积计价 / 房产测绘

同上。这类场景一个数字错了就是纠纷。

保险定损 / 事故还原

需要可举证的精度链路和检定资质。

消防合规 / 疏散通道审查

门的识别只有 49 分,而门在这个场景里恰恰是最关键的对象。

五、三个被严重低估的用法

大部分讨论都停在"手机拍一圈变 3D"。我觉得那恰恰是最不值钱的那个用法。

用法一:别拿它"看房间",拿它"造房间"

2025 年 8 月群核发布了 SpatialLM 1.5,配套一个对话系统 SpatialLM-Chat。输入一句"布置一个老人的卧室,床的一边有扶手",它自动生成结构化场景脚本、匹配家具模型、完成布局——现场演示里模型还自己加了把轮椅。

识别(看懂已有房间)会被真实点云的噪声拖后腿,生成(凭空造合规房间)不会。生成方向上,那个 94.3 分的结构理解能力是满血输出的。

对具身智能公司来说,这才是刚需:批量造出一万个不重样但都物理正确的家庭场景,扔进仿真器训机器人。成本从 275 元/小时降到 2 元以下。

用法二:同一个仓库里,那颗只有 27 星的珠子

我把群核的整个开源矩阵拉了一遍:

项目

Star

做什么

SpatialLM

4667

点云 → 结构化场景(NeurIPS 2025)

SpatialGen

405

布局 → 多视角图像 / 3DGS(3DV 2026)

InteriorGS

284

3D 高斯语义数据集

ComfyUI-Lux3D

112

ComfyUI 生成 3D 模型节点

CAD2Program

27

2D CAD 图纸 → 3D 参数化模型(AAAI 2025)

看到最后一行了吗。

绝大多数家装公司、地产公司、物业公司手里堆着的,不是点云,是十几年积累下来的 CAD 图纸。让他们派人拿手机去几万套房子里挨个拍一圈?不现实。但把历史图纸批量转成 3D 模型?这是能立刻算出 ROI 的事。

一个 AAAI 2025 的工作,27 个 Star。这个数字本身就说明:开源社区的注意力分配,和企业的真实需求分布,压根不是一回事。

用法三:它的输出格式,比它的精度更重要

SpatialLM 吐出来的不是 mesh,是这样一段文本:

人看得懂,程序能解析,出错了手动改一行就行。

更关键的是——这是 LLM 能直接读写的格式

意味着你可以把空间理解塞进 Agent 工作流:让大模型读懂房间结构,做推理,再改回去。"把这个房间改成无障碍布局"、"检查所有通道宽度是否大于 0.8 米"、"找出所有靠窗且面积大于 15 平的房间"——这些都是纯文本层面的操作。

市面上大多数三维重建方案给你的是一个黑盒模型文件,你只能看,不能问,更不能让 AI 改。这个差异,在 Agent 时代的权重会越来越高。

六、三条红线,先看再动手

🚫 红线一:License 有雷,而且 GitHub 都识别不出来。 仓库的 License 字段显示 NOASSERTION——因为它是混合协议。 Qwen 版模型权重是 Apache 2.0,看着能商用。但 1.0 依赖的 SceneScript 点云编码器是 CC-BY-NC-4.0,1.1 换的 Sonata 编码器权重同样是 CC-BY-NC-4.0。 CC-BY-NC 里的 NC 就是 Non-Commercial。 换句话说:两个版本的编码器都不能直接商用。想做商业产品,你得自己换编码器重训,这个工作量不是"改个配置"级别的。法务这关,请在立项前过,不要在上线前过。

🚫 红线二:微调门槛比推理高一个数量级。 推理对显存要求不高,一张消费级卡能跑。但全量微调要 60GB 显存,官方明确说LoRA 还没支持。 而前面那些 90+ 的成绩,全是 finetuned 之后的。零样本状态下墙只有 68.9。 这意味着:想要论文里的效果,你必须微调;想微调,你得准备 A100/H100 级别的卡和你自己的标注数据。预算表上那行"模型免费"要打个问号。

🚫 红线三:发布会上的能力 ≠ 你能拿到的能力。 SpatialLM 1.5 和 SpatialLM-Chat 是 2025 年 8 月技术开放日发布的,媒体报道铺天盖地。 但我翻了主仓库:能跑的仍然是 1.1。1.5 的权重和代码没在 GitHub 上。 做技术选型的时候,请以仓库里能 clone 下来的东西为准,不要以新闻稿为准。这条适用于所有开源项目。

七、别忘了对面还站着一个苹果

做选型不能只看一个方案。企业里最现实的竞品其实是 Apple RoomPlan——2022 年就有的 API,很多人忘了。

Apple RoomPlan

SpatialLM

精度

约 1.3 cm

看场景,波动大

速度

60–90 秒/房间

取决于重建链路

硬件

必须 iPhone Pro / iPad Pro(带 LiDAR)安卓完全不支持

任意点云来源手机视频 / RGBD / 激光雷达都行

可定制

黑盒,不能微调

开源可微调

家具识别

只有基础类别

59 类,可指定子集

输出

USD / USDZ

文本脚本 / IFC / 2D 户型图

费用

免费

模型免费,商用编码器有坑

RoomPlan 的其他限制:房间建议不超过 9×9 米,镜面、开着的门、弱光都会让结果退化,扫描超过 5 分钟设备会发热降频。

决策逻辑其实很清楚:

  • ▪ 只做 iOS、只要户型结构、不需要定制——直接上 RoomPlan,别折腾。精度更高还免费。
  • ▪ 要覆盖安卓、要接自己的传感器、要识别特定物品、要把结果喂给自己的 AI 流程——SpatialLM 才有意义
  • ▪ 要批量造场景训机器人——RoomPlan 完全不在这个赛道上,SpatialLM 1.5 是唯一解。

八、这个项目值不值得押注

技术之外,还得看背后的人会不会跑路。这点上 SpatialLM 的答案挺硬的。

群核科技已经通过港交所聆讯,冲刺"全球空间智能第一股"。2025 年营收 8.2 亿,毛利率 82.2%,经调整净利润 5710 万,实现扭亏为盈。截至 2025 年 6 月底,平台沉淀了超过 4.41 亿个 3D 模型和 5 亿个结构化 3D 空间场景。

它开源不是做慈善,是一套很清晰的商业设计:工具沉淀数据 → 数据训练模型 → 模型反哺工具。开源模型负责占领开发者心智和技术标准,真正收钱的是酷家乐、SpatialVerse 和 Aholo 开放平台。

这对企业用户来说是好事也是提醒:

好事是——它不会像很多"开源完就没人管"的仓库一样烂尾。一年多时间从 1.0 到 1.1 再到 1.5,论文进 NeurIPS,数据集也放出来了,395 个 Fork 对 4667 个 Star(8.5% 的比例在这类项目里算高的,说明真有人在动手跑),未关闭 issue 只剩 3 个。这些都是活着的信号。

提醒是——你在用的是一家上市公司商业战略的一部分。免费的那部分永远会停在某条线上,越过那条线就该付费了。做长期架构决策的时候,把这个前提写进风险评估里。

九、上手前的三个自问

如果你正准备把这东西塞进项目排期,先回答这三个问题:

  • ▪ 我要的是"结构"还是"物件"? 要墙门窗的框架——它能干。要精准数清房间里有几把椅子——换方案。
  • ▪ 我的流程里有没有人工兜底这一环? 有,它能帮你省 50%–70% 的力气。没有,任何一次识别错误都会直接变成客诉。
  • ▪ 我的商用链路能不能绕开 CC-BY-NC? 能,往下走。不能,那就是个纯技术预研项目,别写进商业计划书。

💡 我的整体判断: 这不是一个"下载下来就能变现"的项目,它是一块地基。 真正的价值不在于它现在能识别多准,而在于它把"让机器读懂物理空间"这件事,从一个需要博士团队攻关的课题,变成了几行命令 + 一次微调。 空间大模型现在大概处在语言模型的 GPT-2 阶段——能用,但还没到涌现。这个阶段进场的人,赌的不是今天的精度,是明天的位置。


项目地址:github.com/manycore-research/SpatialLM 同组织值得看的:CAD2Program(2D 图纸转 3D)、SpatialGen(布局转多视角图像)、InteriorGS(3DGS 语义数据集)

本文数据来源:SpatialLM 官方仓库 README 及 benchmark 表、GitHub API 实时数据、群核科技港交所招股文件公开信息、行业公开成本调研。所有结论为独立分析,与项目方无关联。

下一篇想看哪个方向? 评论区告诉我:① CAD2Program 实操拆解 ② 空间大模型选型全景对比 ③ Agent 怎么调用空间理解能力

这个号只写一件事:把开源项目扒到能落地的颗粒度。 不写"太强了",只写"能不能用、成本多少、坑在哪"。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-08-01,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 一、先讲个真实的会议室场景
  • 二、那张让算法同学沉默的表
  • 三、算笔账:它到底在跟谁抢生意
    • 建筑 / 室内设计侧
    • 机器人 / 具身智能侧
  • 四、企业落地分级:哪些能上,哪些别碰
    • 绿灯现在就能上
    • 黄灯能上,但得先改造
    • 红灯别碰
  • 五、三个被严重低估的用法
    • 用法一:别拿它"看房间",拿它"造房间"
    • 用法二:同一个仓库里,那颗只有 27 星的珠子
    • 用法三:它的输出格式,比它的精度更重要
  • 六、三条红线,先看再动手
  • 八、这个项目值不值得押注
  • 九、上手前的三个自问
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档