
以下著述转载自量子位kaiyun体育网页平台是您休闲娱乐的首选网站! 一张图就能创建上半身动作视频,法子还入选了ICCV 2025! 来自清华大学、IDEA(粤港澳大湾区数字经济商讨院)的商讨东说念主员提议新框架GUAVA,不需要多视角视频、不需要针对不同个体单东说念主磨练, 仅需0.1秒就能从单图创建一个上半身3D化身。 往还回说,创建传神且糟践发扬力的上半身东说念主体化身(如包含致密面部神志和丰富手势),在电影、游戏和编造会议等限制具有弥留价值。 但阻抑现在,仅凭单张图像终了这一标的仍然是

以下著述转载自量子位kaiyun体育网页平台是您休闲娱乐的首选网站!
一张图就能创建上半身动作视频,法子还入选了ICCV 2025!
来自清华大学、IDEA(粤港澳大湾区数字经济商讨院)的商讨东说念主员提议新框架GUAVA,不需要多视角视频、不需要针对不同个体单东说念主磨练, 仅需0.1秒就能从单图创建一个上半身3D化身。
往还回说,创建传神且糟践发扬力的上半身东说念主体化身(如包含致密面部神志和丰富手势),在电影、游戏和编造会议等限制具有弥留价值。
但阻抑现在,仅凭单张图像终了这一标的仍然是一个要紧挑战,何况同期还需要易于创建和扶植及时渲染。
而GUAVA,动作第一个从单张图像创建可出手上半身3D高斯化身的框架,与需要多视图视频或单东说念主磨练的3D法子不同——不错在秒级时期内完成推理重建,并扶植及时动画和渲染。
伸开剩余88%与基于扩散模子的2D法子比拟,GUAVA使用3D高斯来确保更好的ID一致性和及时渲染。何况还引入一种糟践发扬力的东说念主体模子EHM,处治了现存模子在捕捉致密面部神志方面的局限性。
此外,它还应用逆纹理映射时期以准确地预计高斯纹理,并勾通一个神经渲染器来升迁渲染质地。
本质末端裸露,GUAVA在渲染质地和效力方面优于现存2D和3D法子。
底下详备来看GUAVA所袭取的法子。
具体法子
3DGS的兴起催生了很多3D化身重建法子,可是这些法子仍然存在一些局限性:
逐ID练:每个个体齐需要单独磨练;
磨练复杂性:该经由耗时,需要标定的多视图或单目视频;
发扬力有限:头部重建法子衰退肉体动作暗示,而全身方次第忽略了致密的面部神志。
逐ID练:每个个体齐需要单独磨练;
磨练复杂性:该经由耗时,需要标定的多视图或单目视频;
发扬力有限:头部重建法子衰退肉体动作暗示,而全身方次第忽略了致密的面部神志。
另外,扩散模子在视频生成方面得回了权贵恶果。一些职责通过添加罕见要求,如关节点或SMPLX渲染图,来指令扩散模子的生成经由,扩张了模子在生成可控东说念主体动画视频上的应用。
但问题是,天然这些法子终赫然细密的视觉效果,其局限性却依旧存在:
ID一致性:难以保执一致的ID,尤其是在姿势发生大变化时;
效力:高瞎想本钱和多步去噪导致推理速率慢,庇荫了及时应用;
视点阻抑:2D法子无法糟塌挽救相机姿势,从而阻抑了视点阻抑。
ID一致性:难以保执一致的ID,尤其是在姿势发生大变化时;
效力:高瞎想本钱和多步去噪导致推理速率慢,庇荫了及时应用;
视点阻抑:2D法子无法糟塌挽救相机姿势,从而阻抑了视点阻抑。
而GUAVA则通过以下举措进行了校正。
(1)EHM模子与精准追踪
为了处治SMPLX模子在捕捉面部神志上的不及,GUAVA引入了EHM(Expressive Human Model)。
EHM勾通了SMPLX和FLAME模子,好像终了更准确的面部神志暗示。
同期,商讨东说念主员瞎想了对应的两阶段追踪法子,终了从单张图像到姿态的准确推断——最初应用预磨练模子进行和精真金不怕火推断,然后使用2D关节点蚀本进行精细优化,从而为重建提供精准的姿势和神志参数。
(2)快速重建与双分支模子
GUAVA基于追踪后的图像,通过单次前向推理神气完成化身的重建。
它包含两个分支:一个分支说明EHM顶点和投影特征预计和精真金不怕火的“模板高斯”,另一个分支则通过“逆纹理映射”时期,将屏幕特征映射到UV空间,生成捕捉精细细节的“UV高斯”。
这两种高斯组合成完好的Ubody高斯,从而在保执几何结构的同期,捕捉丰富的纹理细节。
(3)及时动画与渲染
重建完成后,Ubody高斯不错说明新的姿势参数进行变形和动画。
临了,通过神经细化器对渲染的图像进行优化,以增强细节和渲染质地。
本质本领
本质诞生方面,商讨东说念主员从YouTube、OSX和HowToSign网罗视频数据集,主要怜惜东说念主体上半身视频。
其中磨练集包含逾越62万帧,测试集包含58个ID。
为确保评估的全面性,本质袭取了多种规画:
自爱演(self-reenactment)场景下,通过PSNR、L1、SSIM和LPIPS评估动画末端的图像质地;
跨重演(cross-reenactment)场景下,使用ArcFace瞎想身份保留分数(IPS)以预计ID一致性。
自爱演(self-reenactment)场景下,通过PSNR、L1、SSIM和LPIPS评估动画末端的图像质地;
跨重演(cross-reenactment)场景下,使用ArcFace瞎想身份保留分数(IPS)以预计ID一致性。
评估中与MagicPose、Champ、MimicMotion等2D法子以及GART、GaussianAvatar和ExAvatar 3D法子进行比较。
定量末端如下:
(1)Self-reenactment
与2D法子比拟,GUAVA在统统规画(PSNR, L1, SSIM, LPIPS)上均发扬最好,并在动画和渲染速率上达到约50 FPS,而其他法子仅为每秒几帧。
与3D法子比拟,GUAVA的重建时期仅为0.1秒足下,而其他法子需要数分钟到数小时。
(2)Cross-reenactment
GUAVA在身份保留分数(IPS)上权贵优于其他统统2D法子,解说了其在不同姿势下保执ID一致性的智商。
定性末端裸露,尽管2D法子能生成高质地图像,但它们在保执ID一致性和准确收复复杂手势及面部神志方面存在不及。
举例,Champ的手部暗昧 ,MagicPose存在失真 ,而MimicMotion则无法保执ID一致性。
3D法子在处理精细的手指和面部神志方面存在贫瘠,也衰退泛化智商,在未见区域或极点姿势下会产生伪影。
GUAVA则能对未见区域生成合理的末端,在极点姿势下发扬出更好的鲁棒性,并提供更准确、更致密的手部和面部神志。
为了考据法子中各个部分的有用性,论文还进行了充分的消融本质。
小结一下,论文所提议的GUAVA,是一个用于从单张图像重建可动画、具有考究发扬力上半身3D化身的快速框架。
商讨通过引入EHM模子过甚精准追踪法子,增强了面部神志、形状和姿势的捕捉智商,并通过UV高斯和模板高斯的两个推理分支共同构建一个上半身高斯。
本质末端标明kaiyun体育网页平台是您休闲娱乐的首选网站!,GUAVA在渲染质地和效力方面均优于现存法子。它终赫然约0.1秒的重建时期,并扶植及时动画和渲染。
发布于:安徽省