RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration

TL;DR

RegHead通过前馈注册生成非人形头部表情混合形状,速度快于优化方法。

cs.CV 🔴 高级 2026-07-14 5 次浏览
Jiahao Luo Hao Zhang Jianqi Chen Yijie He Jiaxu Zou Michael Vasilkovsky Sergei Korolev Sergey Tulyakov Chaoyang Wang Peter Wonka James Davis Jian Wang
计算机视觉 动画 非人形角色 实时重定向 前馈注册

核心发现

方法论

RegHead通过构建一个大规模非人形角色数据集,采用密集随机锚点运动表示,并使用前馈注册模型,将未注册的表情网格转换为对应的混合形状基。模型结合全局匹配器和局部匹配器,确保在没有地面真值的情况下实现高效的表情网格生成。

关键结果

  • RegHead生成的表情网格比基线方法更高保真度,运行速度比优化方法快数个数量级。
  • 在实验中,RegHead在PSNR、SSIM和LPIPS等指标上优于ActionMesh和V2M4。
  • 通过人脸追踪信号实现实时重定向,捕捉头部姿态和局部面部运动。

研究意义

RegHead在学术界和工业界具有重要意义,解决了非人形角色表情混合形状生成的高成本问题。其方法不仅加快了生成速度,还提高了生成质量,为AR通信、社交媒体和游戏中的角色动画提供了更高效的解决方案。

技术贡献

RegHead的技术贡献在于引入了密集随机锚点运动表示和前馈注册模型,避免了传统优化方法的高计算成本。该方法在没有地面真值的情况下训练,提供了新的理论保证和工程可能性。

新颖性

RegHead首次将前馈注册应用于非人形角色的表情混合形状生成,区别于现有方法,其创新在于无需预定义骨架或模板,采用拓扑无关的运动表示。

局限性

  • RegHead在处理极端复杂的面部拓扑时可能表现不佳,尤其是当锚点布局不够密集时。
  • 模型依赖于高质量的初始数据集,数据集质量直接影响最终结果。

未来方向

未来工作可以包括扩展数据集的多样性,改进模型在极端复杂拓扑下的表现,以及探索更多实时应用场景。

AI 总览摘要

RegHead提出了一种新颖的框架,用于生成可动画的非人形头部表情混合形状。传统方法在生成这些混合形状时面临高成本和低效率的问题,而RegHead通过构建大规模数据集和使用前馈注册模型,显著提高了生成速度和质量。

RegHead的核心技术包括密集随机锚点运动表示和前馈注册模型。该方法通过预测中性形状的锚点变形,将未注册的表情网格转换为对应的混合形状基。实验结果显示,RegHead在生成保真度和运行速度上均优于现有基线方法。

RegHead的成功应用于实时重定向,从人脸追踪信号到非人形角色,捕捉头部姿态和局部面部运动。这一突破为AR通信、社交媒体和游戏中的角色动画提供了更高效的解决方案。尽管如此,RegHead在处理极端复杂的面部拓扑时仍有改进空间。

深度分析

研究背景

随着AR通信、社交媒体和游戏的发展,生成可动画的非人形头部角色变得越来越重要。然而,现有方法在生成这些角色的表情混合形状时面临高成本和低效率的问题。传统方法依赖于艺术家手动调整或重度优化过程,这使得大规模应用变得困难。

核心问题

生成非人形角色的表情混合形状需要解决多个瓶颈,包括缺乏一致的表情监督、生成的4D资产通常缺乏对应性,以及面部运动高度局部化。这些问题使得现有方法在处理多样化的非人形角色时表现不佳。

核心创新

RegHead的核心创新在于引入了密集随机锚点运动表示和前馈注册模型。通过构建一个大规模的非人形角色数据集,RegHead能够在没有地面真值的情况下训练模型,并通过预测锚点变形实现高效的表情网格生成。

方法详解

  • �� 构建大规模非人形角色数据集,提供一致的表情语义观察。
  • �� 定义密集随机锚点运动表示,适应局部面部变形。
  • �� 使用前馈注册模型,将未注册的表情网格转换为对应的混合形状基。
  • �� 结合全局匹配器和局部匹配器,确保高效的表情网格生成。

实验设计

实验使用了大约20k个非人形身份的数据集,每个身份具有固定的语义表情集。模型在没有地面真值的情况下训练,通过可微渲染损失和几何损失进行优化。实验结果显示,RegHead在PSNR、SSIM和LPIPS等指标上优于现有基线方法。

结果分析

RegHead在生成保真度和运行速度上均优于现有基线方法。实验结果显示,RegHead在PSNR、SSIM和LPIPS等指标上优于ActionMesh和V2M4,且运行速度比优化方法快数个数量级。

应用场景

RegHead可用于AR通信、社交媒体和游戏中的角色动画。其高效的表情混合形状生成方法使得实时重定向成为可能,能够从人脸追踪信号捕捉头部姿态和局部面部运动。

局限与展望

RegHead在处理极端复杂的面部拓扑时可能表现不佳,尤其是当锚点布局不够密集时。此外,模型依赖于高质量的初始数据集,数据集质量直接影响最终结果。未来工作可以包括扩展数据集的多样性,改进模型在极端复杂拓扑下的表现。

通俗解读 非专业人士也能看懂

想象你在玩一个角色扮演游戏,你需要为你的角色设计各种表情。传统的方法就像是手动为每个表情制作一个面具,非常费时费力。而RegHead就像是一个智能的面具制造机,只需要输入角色的基本信息,它就能快速生成各种表情的面具。这是因为RegHead使用了一种叫做“前馈注册”的技术,能够快速预测角色面部的变化,并生成相应的表情。这就像是有一个聪明的助手,能够帮你快速完成角色设计。

简单解释 像给14岁少年讲一样

想象你在玩Minecraft,你想给你的角色添加一些酷炫的表情。传统的方法就像是手动雕刻每个表情的面具,超级麻烦。而RegHead就像是一个魔法工具,只需要告诉它你想要的表情,它就能自动为你生成。这是因为RegHead有一个特别聪明的算法,能够快速预测角色面部的变化,并生成相应的表情。这样你就可以轻松地为你的角色添加各种表情,玩得更开心!

术语表

前馈注册 (Feed-Forward Registration)

一种快速预测未注册网格变形的方法,无需逐实例优化。

用于将未注册的表情网格转换为对应的混合形状基。

混合形状 (Blendshapes)

用于动画的低维度表情表示,支持跨身份重定向。

提供了一种可解释的动画接口。

密集随机锚点 (Dense Stochastic Anchors)

一种拓扑无关的运动表示,用于局部面部变形。

避免了预定义骨架或模板的使用。

可微渲染损失 (Differentiable Rendering Loss)

一种基于点的渲染损失,用于监督变形。

用于优化模型的训练目标。

Chamfer距离 (Chamfer Distance)

一种用于测量两组点集之间距离的指标。

用于监督全局匹配器的几何变形。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂的面部拓扑下提高RegHead的表现?现有方法在锚点布局不够密集时可能表现不佳。
  • 2 如何进一步减少对高质量初始数据集的依赖?数据集质量直接影响最终结果。

应用场景

近期应用

AR通信

RegHead可用于增强现实中的角色动画,提供高效的表情混合形状生成。

社交媒体

在社交媒体中,RegHead可以用于生成个性化的虚拟角色表情,提高用户互动体验。

远期愿景

游戏开发

RegHead可以用于游戏中的角色设计,提供更高效的表情生成工具,减少开发时间。

原文摘要

We present RegHead, a framework for constructing semantic blendshape sets for animatable non-humanoid head avatars. With a fixed expression vocabulary, semantic blendshapes provide a low-dimensional and interpretable animation interface and support cross-identity retargeting. Building such blendshape sets remains expensive because (i) expression-consistent supervision is scarce, (ii) generated 4D assets typically lack correspondence, and (iii) facial motion is highly localized. We propose (1) a large-scale dataset of non-humanoid identities paired with a shared expression vocabulary, obtained by expanding a small artist-rigged library via fine-tuned image editing; (2) a dense stochastic anchor motion representation tailored to localized facial deformations; and (3) a fast feed-forward registration model that converts unregistered expression meshes into a corresponded blendshape basis by predicting anchor-based deformations from the neutral shape. Experiments show that our approach produces higher-fidelity expression meshes than baselines, while running orders of magnitude faster than optimization. We further demonstrate real-time retargeting from human face tracking signals to non-humanoid characters, capturing both head pose and localized facial motions. Our project page is available at https://snap-research.github.io/RegHead/.

cs.CV cs.GR