您当前的位置: 首页 >  3d

暂无认证

  • 2浏览

    0关注

    94181博文

    0收益

  • 0浏览

    0点赞

    0打赏

    0留言

私信
关注
热门博文

假3D场景逼真到火爆外网!超1亿像素无死角,被赞AI渲染新高度

发布时间:2021-10-20 07:00:00 ,浏览量:2

萧箫 杨净 发自 凹非寺 量子位 报道 | 公众号 QbitAI

先来看一段“视频”,有没有看出什么不对劲的地方?

ac89d1515e2d656554a1f2b5a6f5ffd4.gif

其实,这仅仅是由一组照片渲染出来的(右下角为拍摄照片)!

fc09d6991af11b2c6487819632a02a7a.gif

生成的也不仅仅是一段视频,更是一个3D场景模型,不仅能任意角度随意切换、高清无死角,还能调节曝光、白平衡等参数,生成船新的照片:

937d910b0fd6e58d60c0470d9ca0c128.gif

在完全不同的场景下,例如一个坦克厂中,同样能用一组照片渲染出逼真3D场景,相同角度与真实拍摄图像几乎“完全一致”:

b33d351382addd56eacc83a7b3f4d811.gif

要知道,之前苹果虽然也做过一组照片生成目标物体3D模型的功能,但最多就是一件物体,例如一只箱子:

6e487785a07607937eeddeac78401690.gif

这次可是整个3D场景!

cff4c14f67d19988c70350478085d7d5.gif

这是德国埃尔朗根-纽伦堡大学的几位研究人员做的项目,效果一出就火得不行,在国外社交媒体上赞数超过5k,阅读量达到36w+。

5d8634ed680970e1ef94bb02d62b76d1.gif

那么,这样神奇的效果,究竟是怎么生成的呢?

用照片还原整个3D场景图

整体来说,这篇论文提出了一种基于点的可微神经渲染流水线ADOP(Approximate Differentiable One-Pixel Point Rendering),用AI分析输入图像,并输出新角度的新图像。

7659a3ac51ab52efb3efffb3b891a12c.png

在输入时,由于需要建模3D场景,因此这里的照片需要经过严格拍摄,来获取整个场景的稀疏点云数据。

具体来说,作者在从照片获取点云数据时,采用了COLMAP。

先从多个不同的角度拍摄场景中的照片,其中每张照片的视角都会经过严格控制。

然后采用SfM(Structure From Motion,运动恢复结构)方法,来获取相机内外参数,得到整个场景的3D重建数据,也就是表示场景结构的稀疏点云:

ce4c057fe733e77ad8838385d490454e.png

然后,包含点云等信息的场景数据会被输入到流水线中,进行进一步的处理。

流水线(pipeline)主要分为三个部分:可微光栅化器、神经渲染器和可微色调映射器。

6def2b2430ae5df217d79c103a821bc9.png

首先,利用多分辨率的单像素点栅格化可微渲染器(可微光栅化器),将输入的相机参数、重建的点云数据转换成稀疏神经图像。

其中,模型里关于图像和点云对齐的部分,采用了NavVis数据集来训练。

然后,利用神经渲染器,对稀疏神经图像进行阴影计算和孔洞填充,生成HDR图片。

e40401e5f89e549e03036f126c0eef3b.png

最后,由于不是每个设备都支持HDR画面,因此在显示到LDR设备之前,还需要利用基于物理的可微色调映射器改变动态范围,将HDR图像变成LDR图像。

每个场景300+图像训练

这个新模型的优势在哪里?

由于模型的所有阶段都可微,因此这个模型能够优化场景所有参数(相机模型、相机姿势、点位置、点颜色、环境图、渲染网络权重、渐晕、相机响应函数、每张图像的曝光和每张图像的白平衡),并用来生成质量更高的图像。

具体到训练上,作者先是采用了688张图片(包含73M个点)来训练这个神经渲染流水线(pipeline)。

d77870d662400b63a2c2b0ca792a494f.png

针对demo中的几个场景(火车、灯塔、游乐园、操场等),作者们分别用高端摄像机拍摄了300~350张全高清图像,每个场景生成的像素点数量分别为10M、8M、12M和11M,其中5%的图像用作测试。

也就是说,制作这样一个3D场景,大约需要几百张图像,同时每张图像的拍摄需要经过严格的角度控制。

不过仍然有读者表示,拍几百张图像就能用AI做个场景出来,这个速度比当前人工渲染是要快多了。

ceaed8970bbcb0c7d1a88c0578879626.png

功能上,模型既能生成可以调节参数的新角度照片,还能自动插值生成全场景的3D渲染视频,可以说是挺有潜力的。

那么,这个模型的效果与当前其他模型的渲染效果相比如何呢?

实时显示1亿+像素点场景

据作者表示,论文中采用的高效单像素点栅格化方法,使得ADOP能够使用任意的相机模型,并实时显示超过1亿个像素点的场景。

肉眼分辨生成结果来看,采用同行几个最新模型生成的图片,或多或少会出现一些伪影或是不真实的情况,相比之下ADOP在细节上处理得都非常不错:

e281a63a3be4406d84862d8cb7d97e62.png

从数据来看,无论是火车、操场、坦克还是灯塔场景,在ADOP模型的渲染下,在VGG、LPIPS和PSNR上几乎都能取得最优秀的结果(除了坦克的数据)。

490e14cff9a38d7ea129cb8c34b5720f.png

不过,研究本身也还具有一些局限性,例如单像素点渲染仍然存在点云稀疏时,渲染出现孔洞等问题。

但整体来看,实时显示3D场景的效果还是非常出类拔萃的,不少业内人士表示“达到了AI渲染新高度”。

已经有不少网友开始想象这项研究的用途,例如给电影制片厂省去一大波时间和精力:

aac4c5cade9d4d0ff0de09d1cffa624f.png

(甚至有电影系的学生想直接用到毕设上)

7c87f8d4a8bce1b3b11b2d99b09dac46.png

对游戏行业影响也非常不错:

在家就能搞3A大作的场景,是不是也要实现了?简直让人迫不及待。

2100b47a24ebdde95095bec339fba273.png

还有人想象,要是能在iPhone上实现就好了(甚至已经给iPhone 15预定上了):

2de912b02ec62e9770abb2d640ae79e6.png

对于研究本身,有网友从行外人视角看来,感觉更像是插帧模型(也有网友回应说差不多是这样):

b4db48b95d3ddb17743a31dbaee87939.png

也有网友表示,由于需要的图像比较多,效果没有宣传中那么好,对研究潜力持保留态度:

a9d57ff50f317f142ff48a5ca592b40a.png

虽然目前作者们已经建立了GitHub项目,但代码还没有放出来,感兴趣的同学们可以先蹲一波。

至于具体的开源时间,作者们表示“会在中了顶会后再放出来”。(祝这篇论文成功被顶会收录~)

论文地址: https://arxiv.org/abs/2110.06635

项目地址(代码还没po出来): https://github.com/darglein/ADOP

参考链接: [1]https://www.reddit.com/r/MachineLearning/comments/q9phnq/r_adop_approximate_differentiable_onepixel_point/ [2]https://twitter.com/ak92501/status/1448489762990563331 [3]https://developer.apple.com/augmented-reality/object-capture/

本文仅做学术分享,如有侵权,请联系删文。

3D视觉精品课程推荐:

1.面向自动驾驶领域的多传感器数据融合技术

2.面向自动驾驶领域的3D点云目标检测全栈学习路线!(单模态+多模态/数据+代码) 3.彻底搞透视觉三维重建:原理剖析、代码讲解、及优化改进 4.国内首个面向工业级实战的点云处理课程 5.激光-视觉-IMU-GPS融合SLAM算法梳理和代码讲解 6.彻底搞懂视觉-惯性SLAM:基于VINS-Fusion正式开课啦 7.彻底搞懂基于LOAM框架的3D激光SLAM: 源码剖析到算法优化 8.彻底剖析室内、室外激光SLAM关键算法原理、代码和实战(cartographer+LOAM +LIO-SAM)

重磅!3DCVer-学术论文写作投稿 交流群已成立

扫码添加小助手微信,可申请加入3D视觉工坊-学术论文写作与投稿 微信交流群,旨在交流顶会、顶刊、SCI、EI等写作与投稿事宜。

同时也可申请加入我们的细分方向交流群,目前主要有3D视觉、CV&深度学习、SLAM、三维重建、点云后处理、自动驾驶、多传感器融合、CV入门、三维测量、VR/AR、3D人脸识别、医疗影像、缺陷检测、行人重识别、目标跟踪、视觉产品落地、视觉竞赛、车牌识别、硬件选型、学术交流、求职交流、ORB-SLAM系列源码交流、深度估计等微信群。

一定要备注:研究方向+学校/公司+昵称,例如:”3D视觉 + 上海交大 + 静静“。请按照格式备注,可快速被通过且邀请进群。原创投稿也请联系。

f6c08d13d1f1e38e43cb86e07c4315e2.png

▲长按加微信群或投稿

e035406c6eb6397561047fb5c31001b5.png

▲长按关注公众号

3D视觉从入门到精通知识星球:针对3D视觉领域的视频课程(三维重建系列三维点云系列结构光系列、手眼标定、相机标定、激光/视觉SLAM、自动驾驶等)、知识点汇总、入门进阶学习路线、最新paper分享、疑问解答五个方面进行深耕,更有各类大厂的算法工程人员进行技术指导。与此同时,星球将联合知名企业发布3D视觉相关算法开发岗位以及项目对接信息,打造成集技术与就业为一体的铁杆粉丝聚集区,近4000星球成员为创造更好的AI世界共同进步,知识星球入口:

学习3D视觉核心技术,扫描查看介绍,3天内无条件退款

4e0bc67b84c5c7c605418e00d5c4ded9.png

 圈里有高质量教程资料、答疑解惑、助你高效解决问题

觉得有用,麻烦给个赞和在看~  

关注
打赏
1655516835
查看更多评论
立即登录/注册

微信扫码登录

0.4098s