街景 3DGS 补课 · 第六课 · 2026-09-03
周围的人在做什么
最后一课不讲技术,讲地图。谁在做什么、谁跟你抢地盘、谁其实正交、哪些坑别人已经踩过、以及那个真正空着的位置在哪。全部素材来自你 08-23 那轮调研和 09-02 的查新,这里做的是整理和定位。
先看清楚自己站在哪
找创新点这件事,八成的力气应该花在确认一个位置真的空着,而不是想新点子。点子谁都有,难的是知道它有没有被人做过、做到什么程度、为什么别人做不下去。
这一课回答四个问题:领域有哪几条线、每条线自己承认的难点是什么、哪些假设人人默认但没人验证、你现在的位置在哪。
外推是这个领域公认最大的痛点,所有现有解法都是事后花大钱补——生成模型的入场费是数百 GPU 小时,而且伤像素忠实度、伤原轨迹质量。没有一篇问过「训练过程本身能不能少造成一点过拟合」。训练侧是空白。
但第五课刚给了这个空白一个残酷的答案:你试了六个训练侧干预,全是负结果。所以现在的位置比 08-23 那时候更微妙——空缺是真的,但你已经知道最直白的填法行不通。这反而是有价值的信息,§6 会说为什么。
六条活跃线
点一条看它在做什么、代表工作是谁、自己承认的难点、以及跟你的关系:
仪器 1 · 领域地图
橙色是跟你直接相关的三条。
同一条线上的邻居
你的代码底座就长在这条线上,前两课讲的全是它。这里只做一件事:把四个最常被一起提的工作摆清楚差别。
| 工作 | 动态怎么处理 | 关键设计 | 跟你的关系 |
|---|---|---|---|
| Street Gaussians ECCV 2024 | 每辆车一个点云 + 可优化的跟踪位姿 | 4D 球谐:把每个球谐系数换成一组傅里叶系数,按时间反变换 | 你跑的 streetgs.yaml 的骨干。但 DriveStudio 的重实现没有 4D 球谐,别把论文当代码(第二课 §2.3) |
| OmniRe ICLR 2025 Spotlight | 场景图:刚体车 + SMPL 行人 + 可变形节点 | 把行人也建进去,用线性混合蒙皮驱动 | DriveStudio 就是它的官方实现,你所有实验都跑在这上面 |
| DrivingGaussian CVPR 2024 | 动态高斯图,逐物体重建后按包围盒合成 | 增量式静态高斯:按深度把场景切成若干 bin,按时间顺序逐段并入,避免远景过早引入造成尺度混乱 | 另一套代码库,你没跑过。它的「增量式」思路跟你的背景冻结有对话空间 |
| PVG 周期振动高斯 | 不做静动分解,每个高斯自带周期振动和生命周期 | 单一表征,无需标注框 | 你八月拿它做过边界对照,结论是「分解式场景图是快收敛的前提」 |
这条线自己承认的难点有三个:训练慢(30k 步一小时量级)、动态分解依赖标注框、光度不一致。第二课讲的曝光仿射就是在补第三个。
效率线:你八月站过的位置
八月你在这条线上做了一个多月,最后自己判断「太工程、撑不起论文」而撤了。现在回头看这个判断,顺便把三个相关工作的关系摆清楚。
| 工作 | 做什么 | 不做什么 |
|---|---|---|
| FastGS CVPR 2026 Highlight | 通用场景训练加速 3 到 15 倍,用多视角一致性给高斯打重要性分 | 没做驾驶场景。官方路线图挂着「Autonomous Driving 待发布」,2026-03 之后没更新 |
| SparseStreet ICMR | 街景压缩:高斯数 −80%、渲染 FPS ×2 | 完全不碰训练时间 |
| PAGS arXiv 2510.12282 | 语义优先级剪枝 + 渲染时深度预剪,350+ FPS | 无外推评测、无分区指标、无调度机制 |
PAGS 那一条值得单独说,因为它是唯一同时沾「驾驶」和「训练时间」的,08-23 一度被当成竞品。你精读后把威胁降级了,理由很硬:
- 协议大概率不可比。同样是 Waymo 三前置相机、同样 4090,但它报 PSNR 32 到 34.6,而你实测 StreetGS 在留测试帧的 NVS 协议下只有 26 到 27.7。全文没提 test split、没提训练迭代数和分辨率——几乎肯定是重建协议(不留测试帧)。
- 训练时间数字不可横向比。它的 StreetGS 基线是 3 小时 39 分,你同卡实测 DriveStudio 的 StreetGS 30k 只要 29 到 46 分钟。差了五倍,说明实现或配置差异巨大。
- 所处的规模完全不同。它表里列了 5240 万个图元,DriveStudio 是 100 万量级。在它那个规模里光栅化占比高、剪枝收益大;在你的规模里,你实测过「高斯数 −30% 只换来 −8% 时间」。
撤得对,但理由可以更精确。不是因为工程优化不值钱,是因为在你这个规模下,削减高斯数换不来相称的时间——你自己那张成本解剖表已经把这条路封死了:大量成本不随高斯数缩放,而随像素数缩放。这个观察本身是有信息量的,写进任何一篇论文的 discussion 都站得住。
外推:公认最难的那个
这是你现在所处的位置,也是整张地图上最热闹的地方。两篇奠基工作:
VEGS:把问题命名了
arXiv 2407.02945,首个正面提出 EVS(Extrapolated View Synthesis)。它的贡献不只是提出问题,还给了崩溃的微观机制:
the covariance is trained to cover the frustum of a training pixel with a minimal optimization effort. As a result, these covariances are prone to produce unwanted cavity on an underlying scene surface, which is revealed when viewed from unobserved angles.
翻成人话:光度损失只要求盖住训练像素,最省力的姿势就是把自己摊成对着训练相机的伞面。插值视角看不出破绽,侧过去看就是表面上的空腔。
第五课 §4:实测薄轴与视线的 \(|\cos|\) 只有 0.29,真正倒向视线的是中轴和长轴;机制是横向被数据压薄、纵向没人管,不是「摊成朝向相机的伞面」。
这是个好位置——你有数据去修正一篇被广泛引用的定性描述。写的时候要客气但明确:VEGS 的现象观察成立,机制描述需要修正,而且你有逐高斯的谱分解证据。
EUVS:把问题量化了
arXiv 2412.05256,NYU + NVIDIA。90810 帧、345 段视频、104 个案例,光造数据就花了 300 多小时人工挑选加 800 多小时 COLMAP。三个设定分别对应变道、换朝向、不同路线过同一路口。
仪器 2 · 外推到底崩到什么程度
EUVS 三个设定下九个基线的平均 PSNR 降幅,以及 OmniRe 的单独读数。数字来自你 08-23 的精读笔记。
三条结论值得记住,其中最后一条是你现在这套协议的直接来源:
- 原话:current NVS methods are prone to overfitting to training views。
- 原话:incorporating diffusion priors and improving geometry cannot fundamentally improve NVS under large view changes。生成先验和几何先验都不解决根本问题。
- Future work 原话:a more in-depth evaluation of how observed and unseen regions differ is left for future work。这正是你第四课那套分区协议在做的事,而且是他们自己点名留下的空缺。
EUVS 的主基准排除动态物体(用 Grounded-SAM-2 掩掉,训练评测都不算),所以基本是静态场景评测。另外它只用 COLMAP 稀疏点初始化,不用 LiDAR——跟 DriveStudio 的 80 万 LiDAR 点起步差异巨大。
后一条对你其实是优势:ViSE 明说好的几何初始化能「prevent overfitting / escape poor local minima」。你的平台起点更强,这可以单独量化成一个分析点——同一套留出协议下比一比 COLMAP 初始化和 LiDAR 初始化,很可能是白捡的。
修补流派花了多少钱,买到了什么
面对外推,现在的主流做法是事后用生成模型补。两个代表:
ViSE:冠军的消融链
arXiv 2510.18341,小米 EV,ICCV 2025 RealADSim NVS 赛道冠军。四个阶段叠上去,每一步值多少一目了然:
仪器 3 · 四个阶段各值多少
ViSE 论文里的消融链。注意几何先验那一格。
三个要点:
- 几何先验的收益小得惊人。2D-SDF 路面先验只值 +0.016 dB。大头全在生成补画(+0.917)和时域适配(+0.942)。
- 他们自己承认在拿像素忠实度换观感。原文说伪 GT 会「hallucinate unrealistic details… harm pixel-level metrics」,所以要把 L1 权重调小去偏袒感知指标。
- 冠军的绝对水平也只有 PSNR 18.2。这个问题远没被解决。
FreeSim:把成本说清楚了
arXiv 2412.03566,中科院自动化所。修补流派的完全体:先渲染出劣化图,再用双 ControlNet 的 SD1.5 修复,然后渐进式外扩——每 5000 步横移 0.5 米,把生成图并入训练集。
对你最有用的三条:
| 它说的 | 对你意味着什么 |
|---|---|
| 原文:侧向相机沿行驶轨迹的移动,几乎等价于前向相机的横向平移 | 直接支持你的留出侧相机设计。他们用这个等价性去造训练数据,你用它做评测——同一个几何事实,两种用法 |
| 训练生成增强模型:8×A100 × 5 万步;造 150 万对训练数据:全 Waymo 重建 40 小时 × 8 GPU | 修补流派的入场费是数百 GPU 小时。训练侧正则化如果有效,额外成本是零。这个对比很有力 |
| on-trajectory 质量反而下降:28.32 vs PVG 基线 29.19 | 生成的不一致性污染了原轨迹的重建。修补是有代价的,不是白送的 |
空缺在哪,以及你现在的位置
把上面几节合起来,空缺是清楚的:
- 外推是公认痛点,全员崩 25% 到 31%,冠军也只有 18 dB。
- 现有解法全是事后补,入场费数百 GPU 小时,而且伤像素忠实度、伤原轨迹质量。
- 没有一篇研究过训练过程本身。EUVS 的所有基线都是默认配置训完就评测,训练步数、调度、冻结跟外推的关系是明确空白。
- 连 EUVS 自己都在 future work 里点名说「观测区与未观测区如何不同」留待后人。
然后是第五课那个残酷的答案:你把最直白的填法试了六遍,全是负结果。
小c的判断是,这反而让你的位置更清楚了,理由有三条:
| 你手上的东西 | 为什么它有价值 |
|---|---|
| 分区评测协议 | EUVS 自己点名留下的空缺,你已经实现并跑出两个场景的数字 |
| 「PSNR 在未观测区奖励平滑的幻觉」 | 这条如果站住,是对整个外推评测领域的提醒,比任何单个方法都通用 |
| 六个训练侧干预的负结果 + 失败机制 | 把一整类做法一次性排除掉。审稿人会认这个,前提是失败机制说得清楚 |
| VEGS 机制描述的修正 | 有逐高斯谱分解的证据去修正一篇被广泛引用的定性说法 |
| kNN 填色 +1.95 dB | 指出问题性质是「外观没有信息来源」,把方向从训练侧推向未观测区 |
这五条加起来,形状不是一篇「我们提出了 X 方法」的论文,而是一篇分析加协议的文章——对标的就是 EUVS 自己那一类。这也正是你 09-03 早上得出的判断。
那就往未观测区走。第五课的数据说得很直白:六个训练侧干预加起来是负的,一个零成本的颜色替换拿到 +1.95 dB。这块地方现在只有生成模型在做,而它们的入场费是数百 GPU 小时——一个便宜的、不需要生成模型的未观测区处理,位置是空的。kNN 填色只是最粗的版本。
写 related work 时怎么划界
最后给一张实用的表:哪些必须引、引的时候怎么把自己跟它区分开。划界写得好,审稿人就不会问「这跟 X 有什么区别」。
| 工作 | 为什么必须引 | 怎么划界 |
|---|---|---|
| VEGS | EVS 问题的定义者,也是「躺平」说法的来源 | 现象一致,机制描述需要修正;它做的是空间维度的修正,没碰训练过程 |
| EUVS | 唯一的外推 benchmark,你的问题定义靠它立住 | 它评测最终模型,你研究的是训练过程;它不分区,你分区,而且这是它自己点名的 future work |
| ViSE / FreeSim | 修补流派的代表,你的成本论证靠它们 | 互补而非竞争:先少犯错,再让生成模型补剩下的。两条可以叠加 |
| PAGS | 唯一同时沾驾驶和训练时间的 | 协议不同不可直接比(它大概率没留测试帧);机制是语义剪枝,跟你正交 |
| SparseStreet / FastGS | 效率线的两个锚点 | 一个只做压缩不碰训练时间,一个没做驾驶场景 |
| AdamW-GS | Sparse Adam 那条实验的来源 | 你在驾驶场景验证了它,效应小但方向一致;它讲的是不可见高斯的隐式更新,你关心的是外推 |
| PUP-3DGS / FisherRF | 逐高斯 Fisher 这个量的来源 | 它们用它做剪枝和主动视角选择,你用它做诊断 |
| eRank-GS | 有效秩这个度量的来源 | 物体级;你把它搬到驾驶场景并加了视线方向这个轴 |
❧
自查清单
- 说出领域的六条线,以及你的工作坐落在哪几条上。
- 说出 VEGS 提出的崩溃机制,以及你的实测在哪一点上跟它不同。
- 说出 EUVS 的三个设定分别对应什么驾驶行为,以及它的两个 caveat。
- 说出修补流派的入场费和三个代价。
- 说出 PAGS 为什么不能跟你同表比较,至少讲两条理由。
- 说出你现在手上五样东西各自的价值,以及它们合起来是什么形状的文章。
- EVS Extrapolated View Synthesis
- 视角外推合成。测试视角落在训练相机分布之外,比如往左看、往右看、变道。
- 多穿越 multi-traversal
- 同一段路被不同时间、不同车道的行驶记录多次。EUVS 靠它拿到外推视角的真值。
- 前馈重建 feed-forward reconstruction
- 一次网络前向直接输出高斯,秒级完成,但质量上限低于逐场景优化。
- 伪 GT pseudo ground truth
- 用生成模型在没有真值的视角上造出「看起来对」的图,当作监督信号。修补流派的核心手段。
- 重建协议 vs NVS 协议
- 前者不留测试帧,在训练过的视角上报指标;后者留。两者的数字差好几个 dB,混着比会得出荒唐结论。
六节课从一个椭球讲到整张领域地图。回头看,最有用的可能不是任何一个具体知识点,而是你现在能自己判断一个数字能撑什么、不能撑什么——第四课和第五课全在练这个。
接下来要做的三件事在第五课 §8,都不需要新想法,只需要机时。服务器一开就能排。