SAM 3D(站点地址 sam3d.org)是一个在浏览器里运行的图片转 3D 服务:上传一张普通照片,指出其中的某个物体或某个人,几秒后得到一个带贴图的三维网格,可以直接下载并导入常规三维软件。它不需要转台、不需要环绕拍摄、不需要跑一整套摄影测量流程,输入就是一张图。
首先要说清楚的是归属问题,因为名字很容易造成误会。这个网站不属于 Meta。站点自己的 FAQ 区域写明了这是一个独立项目、与 Meta 没有隶属关系。它的真实身份是:一家独立运营方,把 Meta 公开发布的 SAM 3D 模型权重托管起来,配上自己的网页界面、计费系统和在线预览器对外提供服务。首页的说法很直白——基于 Meta 开源的 SAM 3D 模型,把任何一张照片变成三维资产,不用配置环境,也不用自备显卡。这句话诚实地概括了它的全部价值:智能来自上游研究,产品卖的是便捷的使用通道。
把这两层分开看,会影响你使用它时的几乎每一个判断。重建质量、失败方式、模型层面的授权条款,都要追溯到上游模型本身;而价格、积分计量、上传限制、数据留存和客服,则完全由这家运营方决定。评估这个工具时请分层评估:模型决定你的网格好不好,运营方决定你付多少钱、以及你上传的照片会被怎么处理。
两条独立的重建通道。 SAM 3D Objects 负责物体与场景重建,即使画面杂乱,也能选中其中任意一个物体并生成带姿态信息的网格;SAM 3D Body 则是单独的人体通道,从一张照片里还原人体姿态与体型。两者被拆成不同入口,是因为它们解决的本来就是两类问题:一个预测任意物体几何,一个拟合参数化的人体表示。
可提示的目标选择,不用手工描边。 选择目标支持三种方式:输入文字描述、点击目标、或者框选。直接打一句"木凳子"是合法的选取方式,点一下也是。这一点直接继承自 Segment Anything 系列的核心能力——交互式、开放词表的分割。
被遮挡面与背面由模型补全。 一张照片本身不包含物体背面的任何信息,模型会推断出一个合理的背面,而不是给你一张空壳或者一片薄板。得到的是一个封闭、可以任意角度观看的资产。要清醒地认识到:这是"编"出来的,不是"测"出来的,这正是单图重建的固有代价。
把骨架和软组织分开的人体绑定。 人体通道基于 Meta Momentum Human Rig,这套表示把骨骼结构与软组织形状拆成可分离的部分。对需要做动画的人来说,这种拆分远比一坨不加区分的顶点有用,因为姿态和体型可以分别调整。
标准且可直接入引擎的导出格式。 物体导出提供 GLB(面向游戏与网页)、PLY 点云(面向技术流程),也可以打包成包含全部格式的 ZIP。官方说明这些文件可以直接用于 Unity、虚幻引擎和 Blender,所以除非下游明确要点云数据,否则 GLB 是默认选择。
下载前先在浏览器里检查。 生成的网格可以在页面内的交互查看器里旋转、缩放、逐个角度查看。这一点比听起来重要得多:单图重建的错误往往在原始拍摄角度看不出来,一转到侧后方就暴露无遗,先看再下载能省掉大量返工。
附带的格式查看器。 除了生成之外,站点还提供 GLB、PLY、OBJ、FBX、GLTF、STL、DAE 等常见三维交换格式的在线查看器。这些是边角工具而非主打功能,但想快速看一眼模型又不想开重型软件时确实方便。
电商商品可视化。 很多中小卖家手上只有商品平面照,为每个 SKU 单独做三维扫描成本过高。用现成照片重建出可旋转的模型,就能做"放到你家看看"式的场景摆放和 360 度商品展示。请把产出当作展示素材,而不是尺寸精确的复制品——它"看起来对"会远早于"量起来对"。
游戏与原型的快速占位。 关卡设计阶段经常需要一把椅子、一个箱子、一辆踏板车,只要剪影正确就行,真正的美术资产还在排期。用参考照片生成 GLB 丢进引擎,几分钟就能填上这个位置。这类占位资产后期多半会被替换,所以生成速度比拓扑质量更值钱。
角色参考与基础网格。 人体通道能把一张全身参考照变成带姿态的网格,角色美术可以拿它当比例骨架用。它替代的是雕刻前的大形阶段,而不是成品角色——但从一个比例大致正确的人形开始,总好过从一个球体开始。
AR / VR 场景布置。 沉浸式场景永远缺道具,而 GLB 在多数 WebXR 与移动端 AR 流程里都是一等公民。把你要复刻的真实环境里的物件逐个拍下来重建,做出的场景会带有"就是这个地方"的具体感,而不是通用素材库的味道。
教学、存档与研究可视化。 博物馆、教师和田野研究者手上常有标本、器物或设备的照片,而实物已经无法再次扫描。用存档照片做出一个粗略的三维模型,足以支撑交互式教学材料和空间讨论——前提是向受众如实说明几何是近似的。
不动基建的计算机视觉试验。 想知道这些模型在自己的图片上表现如何、再决定要不要自建部署的工程师,可以先跑几张代表性图片。自建部署同一套开源权重的公开门槛是 Linux 64 位环境加一块至少 32GB 显存的 NVIDIA 显卡,所以先用托管服务试水,是回答"值不值得为它买硬件"最便宜的方式。
按对象选对通道。 静物、家具、商品和场景道具走 Objects 入口,人物照片走 Body 入口。把人扔进物体通道,通常会得到一个僵硬的雕像式网格,完全没有人体模型该有的绑定结构。
准备一张模型读得懂的输入。 上传支持 JPEG、PNG、WebP 三种格式,单个文件不超过 10MB。挑一张主体不被遮挡、光照均匀、在画面里占比够大的图。由于背面靠推断而非观测,一张能同时看到两个面的四分之三侧视角,会比正正方方的平视图给模型多得多的信息。
把目标框出来。 物体流程是四步闭环:上传图片、选择目标、生成三维模型、下载。在选择这一步,用文字描述、点击或框选把目标指出来,然后确认返回的掩膜是否严丝合缝贴着轮廓。掩膜溢到背景或者吃进旁边的物体,这个误差会一路传导到几何上,所以宁可在这里多试两次,也别指望后面修。
生成后换角度检查。 跑完重建立刻在查看器里转一圈。重点看三个地方:相机没拍到的那一面、把手和腿这类细长结构、以及原图里被遮住的区域。单图重建的错误就集中在这些位置。
按目的地选择导出格式。 进游戏引擎、实时渲染器和网页查看器就选 GLB;下游技术流程要点云数据就选 PLY;想保留余地就下 ZIP 全包。人体重建的实际导出目标是 GLB。
进生产前先做清理。 导入 Blender 或你惯用的三维软件,根据用途预留重拓扑、UV 或减面的工作量。把下载下来的文件当成一个很好的起点,而不是可以直接交付的成品。
为重建拍照,而不是为好看拍照。 如果相机在你手上,就用四分之三角度拍全主体,背景要和主体有明显反差。均匀的散射光优于戏剧性打光——硬阴影会被当成几何结构,直接烤进贴图里。
掩膜有问题就在掩膜阶段解决。 几乎每一个让人失望的网格,根子都在那个稍微偏了一点的选区。换更具体的措辞重新提示、补一次点击、或者把框收紧。在掩膜上花的三十秒,稳定地省下一次白跑的生成。
拆开单独重建,别指望整场景一把过。 裁到一个边界清晰的单体,效果通常明显好于把一整幅密集构图丢进去碰运气。真要做场景,就分别重建再回三维软件里拼装,摆位反而完全可控。
要省的不只是钱,还有生成次数。 由于积分和分割请求是分开计量的,养成"多分割几个候选、只对最满意的那个做生成"的习惯,配额利用率会高很多。分割是便宜的那一步,生成才是贵的那一步。
尺度必须手动校准。 单图重建没有任何绝对尺度参照。导入之后,先拿一个已知真实尺寸的物体把大小定下来,再在它周围搭别的东西。
不要拿网格当量具。 凡是尺寸会带来后果的事——加工、装配、医疗或安全相关——请使用真正的测量工具。这些模型是"视觉上说得通",这和"数值上正确"是两回事。
商用前把授权链条捋清楚。 权利分成两层:你对工具产出的使用权,和你对源照片中内容的权利。上游模型的宽松许可,并不会顺带给你别人的产品外观、美术作品或人物肖像的权利。
独立游戏开发者与技术美术:需要道具和占位几何的速度超过建模流程的供给能力,并且不介意事后自己清理网格。
电商与商品营销团队:手握大量平面商品图,想做可旋转的交互展示,又不愿为每个 SKU 单独下单三维采集。
AR / VR 与 WebXR 开发者:需要 GLB 道具填充沉浸式场景,看重周转速度胜过逐面精修。
三维通才与爱好者:想摸清当前单图重建的能力边界,宁可付一份小额订阅,也不想为此攒一台工作站。
计算机视觉工程师与研究者:想先用自己的图片评估 SAM 3D 系列的实际表现,再决定要不要自建部署开源权重。
教师与内容创作者:想用手头已有的图片做出可交互的三维插图,用于课件、科普或视频。
角色美术:需要从参考照片得到一个比例合理的人体基础网格,作为雕刻起点而非成品角色。
原型设计者:在概念与布局阶段需要一个物体的空间替身,近似就完全够用。
网页浏览器就是产品本体。 服务在浏览器中运行,计算在服务端完成。站点没有宣传桌面客户端、移动应用或浏览器扩展,这本身就是设计意图——托管服务的意义正在于重计算不发生在你的机器上。
产物可直接进入常规三维软件。 官方说明导出文件可以直接用于 Unity、虚幻引擎、Blender 等三维软件。其中 GLB 在引擎、网页查看器和现代三维软件中的支持面最广。
同站附带的格式查看器。 提供 GLB、PLY、OBJ、FBX、GLTF、STL、DAE 的在线查看,适合快速检查,不必启动重型软件。
自建部署是另一条路。 由于底层模型公开发布,自己跑是真实可行的选项。公开资料记录的门槛是 Linux 64 位环境加至少 32GB 显存的 NVIDIA 显卡——这个硬件要求,恰恰解释了托管前端为什么存在。
未见公开的 API 套餐。 站点未在套餐中宣传面向开发者的公开接口或 SDK。需要程序化批量重建的团队,应评估自建部署或使用把这些模型作为端点开放的推理平台。(信息待验证)
服务采用订阅制,公开三档:Basic、Pro 和 Max,年付相对月付标注为对折。三档的差别在用量而非能力——功能清单三档相同,往上升级换来的是每月能处理多少。每一档同时计量两套预算:每月的生成积分,以及单独的每月图像分割请求额度。订阅前值得先把这套双重计量想清楚:反复试探候选选区的工作流会很快吃掉分割额度而几乎不动生成积分,批量转换的工作流则正好相反。各档还标注了单位积分单价,随档位上升而下降,是常见的量大从优结构。
付费档位宣传的权益包括去除水印、优先处理速度与商用授权。把去水印列为付费项,意味着未付费或试用产出会带水印,这在同类产品中是通行做法。站点定价页没有公开详细的免费额度、退款政策或企业合同通道,而任何订阅制服务的价格都会随时间调整。签约前请直接在定价页核对当前费率、单次生成实际消耗多少积分,以及商用条款的准确措辞——尤其当你的工作依赖商用权利时。(信息待验证)
如果你要的就是单图重建,可选路径不少,区别主要在"谁来运营"。最直接的替代是往上游走:SAM 3D 权重由 Meta 公开发布,自己跑就把中间层整个去掉了,代价是要准备一块相当规格的显卡。Meta 自己也运营着试用这些模型的在线场地,如果你只是想看看研究成果、不想订阅,那才是第一站。
跳出这个模型家族,更广的图生 3D 与文生 3D 领域里,既有主打"游戏可用资产"的专门三维生成产品,也有把大量开源模型(包括这一套)以按次计费 API 形式开放的通用推理平台——后者比按席位订阅更适合自动化批处理。而如果精度是真需求,诚实的替代方案根本不是另一个生成器:规范多角度采集的传统摄影测量,或者一台真正的三维扫描仪,仍然能给出单图方法无法企及的、数值上可信的几何。按需求选:要快和省事就用托管生成,要精度和可信尺寸就老老实实去采集。
分辨率与细节存在上限。 上游模型文档直言输出分辨率有限、细节因此受限,且物体模型无法推理接触、穿插这类物理交互。精细表面纹理、锐利的机械棱边和小特征会被抹平或丢失;分别重建的多个物体拼在一起时可能互相穿插,因为流程里没有任何东西负责保证它们之间的物理合理性。
看不见的那一面是编出来的。 所有背对相机的部分都由学到的先验生成,而非观测所得。对熟悉的对称物体,这个猜测常常很像样;对不对称的物体,或者背面有独特细节的东西,背面会以很自信的姿态出错。信任一个资产之前,务必先从背后看一眼。
人体重建有明确边界。 人体模型逐个处理每一个人,不考虑多人之间或人与物之间的交互。合影不会得到一个交互关系连贯的群体,手部精细关节也是通用人体模型的公认弱项。
网格不是可直接制造的。 一篇面向增材制造的独立实测评测结论是:这些网格不适合直接进切片软件,理由是表面既不光滑也不水密。打算把产出拿去 3D 打印的人,请预留修复与重网格化的工序,不要默认它可打印。
拓扑是生成的,不是人工规划的。 预期会得到密集、不规则、没有美术布线规划、也没有干净 UV 的网格。要做动画、形变或者控制面数预算,重拓扑不是可选项。
输入限制是实打实的。 上传仅支持 JPEG、PNG、WebP 且不超过 10MB,人体重建以全身照效果最好。低分辨率、压缩严重、运动模糊或角度极偏的照片,会在模型开始工作之前就先把上限拉低。
权利是分层的,而营销话术会把它拍扁。 上游代码采用类似 Apache 2.0 的宽松许可、可商用,这正是第三方合法托管这些权重的前提。但这份许可管的是模型,不是你的输入图片。重建一个受版权保护的产品外观、一件美术作品或一个可辨识的真人,会产生任何模型许可都解决不了的义务。
隐私需要一次明确的决策。 向任何托管服务上传照片,都意味着把它传给了第三方运营方。可辨识人物的照片在很多法域属于个人数据,而人体重建本身就是在对人的图像做处理。站点没有醒目公布数据留存周期,涉及敏感、机密或未发布素材时,请先确认当时的条款再上传。(信息待验证)
运营方能否长期存续是未知数。 这是一家独立运营方基于他人开源模型搭建的服务,这个赛道更替很快。你依赖的资产请自行下载归档,不要把这里当成长期存储。
不是。这是一家独立商业服务,把 Meta 公开发布的 SAM 3D 模型托管在自己的界面和计费体系之后。站点自己的 FAQ 区域写明了这是独立项目、与 Meta 没有隶属关系。如果你要找的是 Meta 自己的在线演示或原始研究材料,请前往 Meta 官方的 AI 站点。这个区分在售后、计费、隐私条款和任何商业承诺上都很重要。
一张图。上传支持 JPEG、PNG、WebP,单文件不超过 10MB。和摄影测量不同,它不需要多角度拍摄集——这正是这项技术的意义所在,也正是它大部分局限的来源,因为那一帧里看不到的一切都得靠推断。
物体导出提供 GLB(游戏与网页)、PLY 点云(技术流程),以及包含全部格式的 ZIP 打包。人体重建导出为 GLB。要进游戏引擎或网页查看器,GLB 是正确的默认值;下游需要点云数据时才选 PLY。
付费档位宣传包含去水印、优先处理与商用授权,上游模型许可也允许商业使用。但这只覆盖工具和模型本身,并不赋予你源照片中被拍摄内容的权利——受版权保护的产品设计、美术作品、商标或可辨识的真人,各自都带着独立的义务。请阅读当时的服务条款,并单独处理素材版权。
用于可视化、原型、道具和参考是够的;当作测量依据或最终生产几何则不够。上游模型文档直言输出分辨率有限、细节因此受限,且物体模型无法推理接触、穿插这类物理交互。请预留一道清理工序。
不修就不能稳定打印。一篇面向增材制造的独立实测评测结论是:这些网格不适合直接进切片软件,理由是表面既不光滑也不水密。你需要先用修复与重网格化工具处理,并确认水密性,才能进切片。
因为门槛在硬件。公开资料记录的自建门槛是 Linux 64 位环境加至少 32GB 显存的 NVIDIA 显卡。如果你已经有这样的硬件和运维意愿,自建在量大时更便宜,而且图片留在自己的基础设施里;如果没有,订阅相当于把一笔资本开支和一堆运维事务换成了月费。
这是两套独立的计量。每一档同时计量两套预算:每月的生成积分,以及单独的每月图像分割请求额度。选取和调整掩膜消耗的是分割额度,真正产出三维网格消耗的才是生成积分。实际上这鼓励一种工作流:先放开手分割,找到对的选区,再只生成一次。
每个人是被分别处理的。人体模型逐个处理每一个人,不考虑多人之间或人与物之间的交互。你可以从一张合影里重建出多个人,但他们之间的相对位置、接触和互动不会被连贯建模——这部分需要你自己回三维软件里摆。
这个服务是围绕单图重建构建的,实际做法是从视频里抽一帧代表性画面作为输入。挑一帧运动模糊小、主体不被遮挡且在画面里占比够大的即可。(基于公开资料推测)