街景 3DGS 补课 · 第六课 · 2026-09-03

周围的人在做什么

最后一课不讲技术,讲地图。谁在做什么、谁跟你抢地盘、谁其实正交、哪些坑别人已经踩过、以及那个真正空着的位置在哪。全部素材来自你 08-23 那轮调研和 09-02 的查新,这里做的是整理和定位。

素材:survey/问题地图.md、survey/精读笔记-EVS线.md、survey/精读笔记-修补流派与竞品.md
本页提到的 arXiv 编号与标题已逐个核对(2026-09-03)
前置:第四课(评测协议)· 第五课(结果重读)

0.0开场

先看清楚自己站在哪

找创新点这件事,八成的力气应该花在确认一个位置真的空着,而不是想新点子。点子谁都有,难的是知道它有没有被人做过、做到什么程度、为什么别人做不下去。

这一课回答四个问题:领域有哪几条线、每条线自己承认的难点是什么、哪些假设人人默认但没人验证、你现在的位置在哪。

先说结论

外推是这个领域公认最大的痛点,所有现有解法都是事后花大钱补——生成模型的入场费是数百 GPU 小时,而且伤像素忠实度、伤原轨迹质量。没有一篇问过「训练过程本身能不能少造成一点过拟合」。训练侧是空白。

但第五课刚给了这个空白一个残酷的答案:你试了六个训练侧干预,全是负结果。所以现在的位置比 08-23 那时候更微妙——空缺是真的,但你已经知道最直白的填法行不通。这反而是有价值的信息,§6 会说为什么。

1.0全景

六条活跃线

点一条看它在做什么、代表工作是谁、自己承认的难点、以及跟你的关系:

仪器 1 · 领域地图

橙色是跟你直接相关的三条。

2.0同行

同一条线上的邻居

你的代码底座就长在这条线上,前两课讲的全是它。这里只做一件事:把四个最常被一起提的工作摆清楚差别。

工作动态怎么处理关键设计跟你的关系
Street Gaussians
ECCV 2024
每辆车一个点云 + 可优化的跟踪位姿4D 球谐:把每个球谐系数换成一组傅里叶系数,按时间反变换你跑的 streetgs.yaml 的骨干。但 DriveStudio 的重实现没有 4D 球谐,别把论文当代码(第二课 §2.3)
OmniRe
ICLR 2025 Spotlight
场景图:刚体车 + SMPL 行人 + 可变形节点把行人也建进去,用线性混合蒙皮驱动DriveStudio 就是它的官方实现,你所有实验都跑在这上面
DrivingGaussian
CVPR 2024
动态高斯图,逐物体重建后按包围盒合成增量式静态高斯:按深度把场景切成若干 bin,按时间顺序逐段并入,避免远景过早引入造成尺度混乱另一套代码库,你没跑过。它的「增量式」思路跟你的背景冻结有对话空间
PVG
周期振动高斯
不做静动分解,每个高斯自带周期振动和生命周期单一表征,无需标注框你八月拿它做过边界对照,结论是「分解式场景图是快收敛的前提」

这条线自己承认的难点有三个:训练慢(30k 步一小时量级)、动态分解依赖标注框、光度不一致。第二课讲的曝光仿射就是在补第三个。

3.0回顾

效率线:你八月站过的位置

八月你在这条线上做了一个多月,最后自己判断「太工程、撑不起论文」而撤了。现在回头看这个判断,顺便把三个相关工作的关系摆清楚。

工作做什么不做什么
FastGS
CVPR 2026 Highlight
通用场景训练加速 3 到 15 倍,用多视角一致性给高斯打重要性分没做驾驶场景。官方路线图挂着「Autonomous Driving 待发布」,2026-03 之后没更新
SparseStreet
ICMR
街景压缩:高斯数 −80%、渲染 FPS ×2完全不碰训练时间
PAGS
arXiv 2510.12282
语义优先级剪枝 + 渲染时深度预剪,350+ FPS无外推评测、无分区指标、无调度机制

PAGS 那一条值得单独说,因为它是唯一同时沾「驾驶」和「训练时间」的,08-23 一度被当成竞品。你精读后把威胁降级了,理由很硬:

回头看那个「too toy」的判断

撤得对,但理由可以更精确。不是因为工程优化不值钱,是因为在你这个规模下,削减高斯数换不来相称的时间——你自己那张成本解剖表已经把这条路封死了:大量成本不随高斯数缩放,而随像素数缩放。这个观察本身是有信息量的,写进任何一篇论文的 discussion 都站得住。

4.0痛点

外推:公认最难的那个

这是你现在所处的位置,也是整张地图上最热闹的地方。两篇奠基工作:

VEGS:把问题命名了

arXiv 2407.02945,首个正面提出 EVS(Extrapolated View Synthesis)。它的贡献不只是提出问题,还给了崩溃的微观机制:

the covariance is trained to cover the frustum of a training pixel with a minimal optimization effort. As a result, these covariances are prone to produce unwanted cavity on an underlying scene surface, which is revealed when viewed from unobserved angles.

翻成人话:光度损失只要求盖住训练像素,最省力的姿势就是把自己摊成对着训练相机的伞面。插值视角看不出破绽,侧过去看就是表面上的空腔。

但你的实测跟这个说法对不上

第五课 §4:实测薄轴与视线的 \(|\cos|\) 只有 0.29,真正倒向视线的是中轴和长轴;机制是横向被数据压薄、纵向没人管,不是「摊成朝向相机的伞面」。

这是个好位置——你有数据去修正一篇被广泛引用的定性描述。写的时候要客气但明确:VEGS 的现象观察成立,机制描述需要修正,而且你有逐高斯的谱分解证据。

EUVS:把问题量化了

arXiv 2412.05256,NYU + NVIDIA。90810 帧、345 段视频、104 个案例,光造数据就花了 300 多小时人工挑选加 800 多小时 COLMAP。三个设定分别对应变道、换朝向、不同路线过同一路口。

仪器 2 · 外推到底崩到什么程度

EUVS 三个设定下九个基线的平均 PSNR 降幅,以及 OmniRe 的单独读数。数字来自你 08-23 的精读笔记。

三条结论值得记住,其中最后一条是你现在这套协议的直接来源:

  1. 原话:current NVS methods are prone to overfitting to training views。
  2. 原话:incorporating diffusion priors and improving geometry cannot fundamentally improve NVS under large view changes。生成先验和几何先验都不解决根本问题。
  3. Future work 原话:a more in-depth evaluation of how observed and unseen regions differ is left for future work。这正是你第四课那套分区协议在做的事,而且是他们自己点名留下的空缺。
两个必须记住的 caveat

EUVS 的主基准排除动态物体(用 Grounded-SAM-2 掩掉,训练评测都不算),所以基本是静态场景评测。另外它只用 COLMAP 稀疏点初始化,不用 LiDAR——跟 DriveStudio 的 80 万 LiDAR 点起步差异巨大。

后一条对你其实是优势:ViSE 明说好的几何初始化能「prevent overfitting / escape poor local minima」。你的平台起点更强,这可以单独量化成一个分析点——同一套留出协议下比一比 COLMAP 初始化和 LiDAR 初始化,很可能是白捡的。

5.0竞争

修补流派花了多少钱,买到了什么

面对外推,现在的主流做法是事后用生成模型补。两个代表:

ViSE:冠军的消融链

arXiv 2510.18341,小米 EV,ICCV 2025 RealADSim NVS 赛道冠军。四个阶段叠上去,每一步值多少一目了然:

仪器 3 · 四个阶段各值多少

ViSE 论文里的消融链。注意几何先验那一格。

三个要点:

FreeSim:把成本说清楚了

arXiv 2412.03566,中科院自动化所。修补流派的完全体:先渲染出劣化图,再用双 ControlNet 的 SD1.5 修复,然后渐进式外扩——每 5000 步横移 0.5 米,把生成图并入训练集。

对你最有用的三条:

它说的对你意味着什么
原文:侧向相机沿行驶轨迹的移动,几乎等价于前向相机的横向平移直接支持你的留出侧相机设计。他们用这个等价性去造训练数据,你用它做评测——同一个几何事实,两种用法
训练生成增强模型:8×A100 × 5 万步;造 150 万对训练数据:全 Waymo 重建 40 小时 × 8 GPU修补流派的入场费是数百 GPU 小时。训练侧正则化如果有效,额外成本是零。这个对比很有力
on-trajectory 质量反而下降:28.32 vs PVG 基线 29.19生成的不一致性污染了原轨迹的重建。修补是有代价的,不是白送的
6.0定位

空缺在哪,以及你现在的位置

把上面几节合起来,空缺是清楚的:

  1. 外推是公认痛点,全员崩 25% 到 31%,冠军也只有 18 dB。
  2. 现有解法全是事后补,入场费数百 GPU 小时,而且伤像素忠实度、伤原轨迹质量。
  3. 没有一篇研究过训练过程本身。EUVS 的所有基线都是默认配置训完就评测,训练步数、调度、冻结跟外推的关系是明确空白。
  4. 连 EUVS 自己都在 future work 里点名说「观测区与未观测区如何不同」留待后人。

然后是第五课那个残酷的答案:你把最直白的填法试了六遍,全是负结果。

小c的判断是,这反而让你的位置更清楚了,理由有三条:

你手上的东西为什么它有价值
分区评测协议EUVS 自己点名留下的空缺,你已经实现并跑出两个场景的数字
「PSNR 在未观测区奖励平滑的幻觉」这条如果站住,是对整个外推评测领域的提醒,比任何单个方法都通用
六个训练侧干预的负结果 + 失败机制把一整类做法一次性排除掉。审稿人会认这个,前提是失败机制说得清楚
VEGS 机制描述的修正有逐高斯谱分解的证据去修正一篇被广泛引用的定性说法
kNN 填色 +1.95 dB指出问题性质是「外观没有信息来源」,把方向从训练侧推向未观测区

这五条加起来,形状不是一篇「我们提出了 X 方法」的论文,而是一篇分析加协议的文章——对标的就是 EUVS 自己那一类。这也正是你 09-03 早上得出的判断。

如果一定要有方法

那就往未观测区走。第五课的数据说得很直白:六个训练侧干预加起来是负的,一个零成本的颜色替换拿到 +1.95 dB。这块地方现在只有生成模型在做,而它们的入场费是数百 GPU 小时——一个便宜的、不需要生成模型的未观测区处理,位置是空的。kNN 填色只是最粗的版本。

7.0收尾

写 related work 时怎么划界

最后给一张实用的表:哪些必须引、引的时候怎么把自己跟它区分开。划界写得好,审稿人就不会问「这跟 X 有什么区别」。

工作为什么必须引怎么划界
VEGSEVS 问题的定义者,也是「躺平」说法的来源现象一致,机制描述需要修正;它做的是空间维度的修正,没碰训练过程
EUVS唯一的外推 benchmark,你的问题定义靠它立住它评测最终模型,你研究的是训练过程;它不分区,你分区,而且这是它自己点名的 future work
ViSE / FreeSim修补流派的代表,你的成本论证靠它们互补而非竞争:先少犯错,再让生成模型补剩下的。两条可以叠加
PAGS唯一同时沾驾驶和训练时间的协议不同不可直接比(它大概率没留测试帧);机制是语义剪枝,跟你正交
SparseStreet / FastGS效率线的两个锚点一个只做压缩不碰训练时间,一个没做驾驶场景
AdamW-GSSparse Adam 那条实验的来源你在驾驶场景验证了它,效应小但方向一致;它讲的是不可见高斯的隐式更新,你关心的是外推
PUP-3DGS / FisherRF逐高斯 Fisher 这个量的来源它们用它做剪枝和主动视角选择,你用它做诊断
eRank-GS有效秩这个度量的来源物体级;你把它搬到驾驶场景并加了视线方向这个轴

❧

自查清单

EVS Extrapolated View Synthesis
视角外推合成。测试视角落在训练相机分布之外,比如往左看、往右看、变道。
多穿越 multi-traversal
同一段路被不同时间、不同车道的行驶记录多次。EUVS 靠它拿到外推视角的真值。
前馈重建 feed-forward reconstruction
一次网络前向直接输出高斯,秒级完成,但质量上限低于逐场景优化。
伪 GT pseudo ground truth
用生成模型在没有真值的视角上造出「看起来对」的图,当作监督信号。修补流派的核心手段。
重建协议 vs NVS 协议
前者不留测试帧,在训练过的视角上报指标;后者留。两者的数字差好几个 dB,混着比会得出荒唐结论。
这门课到这儿就完了

六节课从一个椭球讲到整张领域地图。回头看,最有用的可能不是任何一个具体知识点,而是你现在能自己判断一个数字能撑什么、不能撑什么——第四课和第五课全在练这个。

接下来要做的三件事在第五课 §8,都不需要新想法,只需要机时。服务器一开就能排。