VirSqueezer: Generating Realistic Deformations and Squeezing Dynamics in VR from Fine-Grained Squeezing Controls

TL;DR

VirSqueezer以SenseGlove、MPM和扩散模型生成细粒度挤压变形,但论文未报告具体数值指标。

cs.HC 🔴 高级 2026-09-02 36 次浏览
Qian Zhang Xiaoming Chen Xiaorui Ma Haisheng Li Weidong Cai
虚拟现实 挤压交互 MPM物理仿真 扩散模型 视觉动力学

核心发现

方法论

VirSqueezer将SenseGlove采集的五指屈曲、指尖三维位置和手掌6-DoF姿态对齐到统一时间轴,并用指数移动平均去噪。SC-CAE估计多指接触区域,再通过公式ck,t=wk max(ũk,t−β,0)^γ生成指力代理,将各向异性位移场转为Dirichlet边界条件。随后以MPM执行P2G、网格更新和G2P,结合GPT-5推断的材料属性提供阻力反馈;最终使用RGB、深度、粒子掩码、文本提示以及AnimateDiff、Stable Diffusion和ControlNet生成破裂、溢出等二级效果。

关键结果

  • 论文报告了定量指标、人工评价及多个大语言模型评价,并声称在视觉质量、物理常识和挤压控制一致性方面优于现有方法;但所提供全文片段没有给出数据集名称、样本规模、具体分数或百分比,因此不能可靠复述数值增益。
  • 定性结果覆盖局部压陷、可乐罐破裂、软玩具受压反弹和水果出汁等场景。MPM负责可解释的主变形,生成模型负责复杂外观动力学;这一分工改善了空间结构与时间变化的协同,但论文摘录未提供与3DGS、PhysGaussian或纯扩散基线的逐项数值表。
  • 消融与比较结论强调SC-CAE、Dirichlet约束、材料先验和物理条件扩散的必要性。内部粒子可表达3DGS难以重建的内部结构;不过原始MPM释放的二级效果真实度较低,需G-buffer条件和视频生成模型进一步优化。

研究意义

该工作把VR中的挤压从粗粒度手势映射推进到连续、逐指、时变控制。它回应了现有3D Gaussian Splatting和MPM方法难以稳定表现局部变形、破裂与溢出的痛点,也回应了扩散视频模型缺乏物理约束和用户输入一致性的缺陷。学术上,它展示了物理模拟与生成视觉的互补路线;产业上,可降低高质量交互内容的手工制作成本,并为训练、娱乐、设计和触觉体验提供更丰富的可控素材。

技术贡献

核心技术包括SC-CAE接触区域估计、指级力代理、各向异性软权重位移场和Dirichlet边界驱动的MPM。应力由超弹性能量Ψ、弹性变形梯度FE及修正映射ψ共同决定,更新采用FnewE=(I+Δt∇v)FE并执行return mapping。系统还以屈服强度乘接触面积估算SenseGlove阻力,并用内部粒子和G-buffer把难以直接仿真的破裂、溢出转化为扩散模型条件。

新颖性

作者称VirSqueezer是首个专门面向细粒度虚拟挤压的框架。其根本新意不在单独提出MPM、ControlNet或AnimateDiff,而在于建立“逐指控制—局部接触—材料响应—生成动力学”的闭环,并以物理深度、RGB和粒子掩码约束多视角生成。相比仅依赖提示词的3DGS编辑,它明确保留用户控制的时空结构。

局限性

  • 系统不是实时系统:破裂和溢出依赖计算昂贵的AnimateDiff、Stable Diffusion与ControlNet,难以即时响应连续手部输入。
  • GPT-5推断材料类型、杨氏模量、泊松比和屈服强度,可能产生不准确先验;论文未展示系统化材料标定、真实触觉测量或误差界限。
  • 论文摘录缺少公开数据集、训练细节和具体定量结果,因而复现性及跨对象泛化能力仍难判断。

未来方向

首要方向是将扩散生成蒸馏、缓存或轻量化,使系统达到VR交互所需帧率,同时保持逐指控制与物理一致性。还应建立包含材料、接触轨迹和多视角视频的公开基准,引入真实力传感器进行材料参数标定,并研究可微分物理与生成模型联合训练,以减少GPT-5先验依赖和人工阈值设定。

AI 总览摘要

挤压是VR中极具表现力却难以复现的手部动作。它不是一个简单的“握紧”指令,而是五根手指以不同速度、不同位置和不同力度持续变化。现有3D Gaussian Splatting擅长实时外观,MPM擅长物理变形,但往往难以同时捕捉局部压陷、破裂和溢出;扩散视频模型能生成逼真画面,却可能忽略连续用户输入和物理因果。

VirSqueezer提出了一条混合路线。SenseGlove记录五指屈曲、指尖位置和手掌6-DoF姿态;SC-CAE把这些信号投影到物体表面,估计逐指接触区域,并以Dirichlet位移约束驱动MPM。MPM通过P2G、网格更新和G2P计算主变形,GPT-5则推断材料类型、杨氏模量、泊松比和屈服强度,用于材料响应和阻力反馈。超过挤压阈值后,内部粒子模拟内容物运动。

为了生成MPM难以表现的破裂和溢出,系统提取RGB、深度图和内部粒子掩码,配合文本提示控制AnimateDiff、Stable Diffusion和ControlNet,生成多视角动态效果。论文称其在视觉质量、物理常识和控制一致性上优于现有方法,并经定量指标、人工评价和多种大语言模型评估验证;但当前材料未提供具体数据集、样本数或分数。其现实价值在于建立了可控、可解释的VR挤压内容管线,主要瓶颈则是生成模型带来的非实时性。

深度分析

研究背景

3DGS、4D Gaussians和VR-GS推动了高效的静态与动态场景表达;PhysGaussian、OmniPhysGS等进一步把MPM引入视觉内容创作。Stable Diffusion、VideoCrafter和AnimateDiff则擅长生成高保真时序画面。然而,前者多关注全局运动或预设物理参数,后者主要依赖提示词,均未充分解决逐指挤压导致的局部变形和复杂次生效果。

核心问题

目标是把连续的五指屈曲、指尖轨迹与手掌姿态,映射为时间同步、空间局部且材料合理的视觉结果。难点包括接触区域不稳定、多指重叠、局部曲率约束、材料参数未知,以及破裂和溢出无法仅靠常规表面仿真生成。系统还必须提供与变形相符的触觉阻力。

核心创新

  • �� 用SC-CAE估计逐指接触区,联合几何、法向、曲率、尺度和重叠约束。• 用ck,t公式将屈曲转为非线性、指别相关的力代理。• 以Dirichlet边界而非直接施力驱动局部MPM变形,提高稳定性。• 以GPT-5推断材料先验并计算屈服阈值和阻力。• 用内部粒子、G-buffer和物理条件扩散连接主变形与破裂、溢出等二级效果。

方法详解

  • �� 输入:SenseGlove采集五指归一化屈曲、指尖3D位置和手掌6-DoF姿态,并统一采样、指数移动平均去噪。• 接触映射:SC-CAE在物体表面优化接触中心x、法向n和各向异性尺度σ。• 控制构造:按ck,t=wk max(ũk,t−β,0)^γ计算指力代理,再以Δx(x)=Σkηck,tφk(x)nk合成位移场。• 物理求解:MPM执行P2G、网格更新、G2P,并用超弹性应力和return mapping更新FE。• 反馈与阈值:依据屈服强度和接触面积估算阻力;超过阈值时释放内部粒子。• 生成:整理RGB、深度和粒子掩码,联合文本提示控制AnimateDiff、Stable Diffusion和ControlNet。

实验设计

论文进行定量指标、人工评价和多个大语言模型评价,并与3DGS/MPM路线及扩散生成路线进行比较。测试关注局部变形真实性、视觉质量、物理常识、时间一致性和挤压控制一致性,案例包括可乐罐、软玩具和水果。提供内容未列出具体数据集、样本规模、硬件、训练轮数或评价分数,因此只能确认评价维度,不能重建完整实验协议。

结果分析

作者报告VirSqueezer在视觉质量、物理常识和控制一致性上优于现有方法,并能同步呈现局部压陷及破裂、溢出等动态。内部粒子弥补了3DGS缺乏内部结构的不足,G-buffer改善了二级效果的外观。然而,论文摘录没有具体百分比、分数或数据集名称;因此“优于”应理解为论文的总体结论,而非可核验的数值声明。

应用场景

可用于VR游戏中的捏碎罐体、挤压玩具和榨汁互动,也适用于沉浸式广告、产品展示、虚拟实验和触觉训练。内容创作者只需准备物体表示、文本描述和SenseGlove轨迹;系统则自动产生局部变形、阻力反馈及多视角动态。实际部署仍需离线生成、模型推理设备和经过校准的材料先验。

局限与展望

主要限制是非实时性,复杂动态依赖扩散模型,无法保证低延迟交互。GPT-5材料推断可能偏离真实物理,屈服阈值和释放方向也带有启发式假设。内部粒子虽然可表现内容物,却不等同于真实流体、断裂或多相材料模拟。未来需要真实传感器标定、公开基准、快速扩散推理、可微分联合优化和更严格的跨材料、跨视角评估。

通俗解读 非专业人士也能看懂

把VirSqueezer想成一家会听手势的智能厨房。你戴上一只特殊手套,五根手指每次弯曲、指尖碰到哪里、手掌怎样移动,都会像厨师的操作记录一样被保存。系统先判断每根手指压住食物或罐子的哪个位置,再估计这个物体是硬、软、容易破裂,还是里面装着液体。

接着,一位“物理厨师”计算物体会怎样凹下去。它不是把整件东西一起缩小,而是让拇指压出的凹痕和食指压出的凹痕分别出现,所以局部变化更像真的。与此同时,手套会给手指回传阻力:越难压,感觉越顶手。

如果压力足够大,物体可能裂开、喷出汁液或溢出内容物。系统先用简单的运动记录确定“哪里裂、什么时候喷”,再请一个会画动态画面的模型补充真实外观。这样既保留手的控制,也避免完全靠想象生成。缺点是画面生成较慢,还不能像真正的游戏一样立刻完成所有效果。

简单解释 像给14岁少年讲一样

想象你在VR里捏一个汽水罐。普通系统可能只会让罐子整体变扁,或者生成一段看起来很酷、但不一定跟你的手同步的视频。VirSqueezer想做得更细:它要知道大拇指、食指和其他手指分别在哪里、弯了多少、什么时候加力。

你戴的SenseGlove就像游戏手柄加手套,能记录每根手指和手掌的动作。系统把这些动作传给一个“虚拟物理实验室”,先算出罐子被哪些地方压凹,再判断材料有多硬、什么时候会坏。它还把计算出来的阻力传回手套,所以你会感觉像真的在捏东西。

当压力超过某个程度,罐子可能破裂,果汁可能喷出来。物理模拟负责决定喷出的位置和时间,AnimateDiff、Stable Diffusion、ControlNet等生成模型负责把这些过程画得更逼真。就像一组同学分工:一个负责规则,一个负责画面。

这很适合游戏、虚拟实验和互动广告。不过它现在还不是实时系统,因为生成视频需要较多计算。未来如果模型变快,你就能在VR里随手捏、马上看到并感受到结果,甚至用同一种方式探索不同材料的反应!

术语表

Material Point Method (MPM,物质点法)

一种用粒子表示材料、用背景网格计算运动和受力的物理仿真方法。它适合处理大变形、软体和复杂材料行为。

VirSqueezer用MPM计算挤压造成的主变形,并执行P2G、网格更新和G2P。

Dirichlet boundary condition(狄利克雷边界条件)

直接规定边界位置或位移的约束,而不是只施加一个外力。它能稳定地控制接触表面运动。

论文将估计的手指接触位移转化为物体表面的Dirichlet约束。

SC-CAE(挤压条件接触区域估计)

根据手指位置、方向和屈曲控制估计物体表面接触区域的方法。它考虑法向、曲率、尺度和多指重叠。

SC-CAE负责把SenseGlove信号映射为局部接触与位移场。

G-buffer(几何缓冲)

保存每个像素几何或材质信息的辅助图像集合,常包括颜色、深度和掩码。它为后续视觉生成提供结构条件。

系统使用RGB、深度图和内部粒子掩码生成二级动态。

ControlNet

一种为扩散模型加入外部空间条件的控制架构。它可利用边缘、深度、姿态或掩码保持生成结果的结构。

VirSqueezer用ControlNet约束破裂和溢出的空间位置及几何一致性。

return mapping(返回映射)

在材料模型更新后,将不符合材料约束的状态投影回允许范围的数值步骤。它常用于塑性或受限弹性计算。

MPM的G2P阶段用该步骤修正新的弹性变形梯度。

开放问题 这项研究留下的未解疑问

  • 1 论文提供的材料没有列出数据集、样本数和具体指标,因此无法判断方法在不同物体、材质和用户上的统计泛化能力。
  • 2 GPT-5推断的材料参数与真实测量之间有多大误差尚不清楚;需要标准化材料库、力传感器和可重复标定流程。
  • 3 扩散生成如何在低延迟下保持多视角、逐指控制和物理因果,仍是实时VR部署的核心开放问题。

应用场景

近期应用

VR互动游戏

游戏开发者可用SenseGlove记录玩家逐指挤压,把软玩具压陷、罐体破裂或水果出汁作为可控事件。前提是准备物体表示、材料先验和生成模型;当前更适合离线制作或高容忍延迟的体验。

沉浸式产品展示

广告或教育应用可让用户捏压包装、海绵和水果,观察局部变形并获得阻力反馈。生成的RGB、深度和掩码条件有助于从多个视角展示结果,但部署需要GPU推理和预设文本提示。

远期愿景

实时物理生成式VR

若扩散模型被蒸馏并与可微分MPM联合,用户可实时探索不同材料、力度和手法,虚拟物体将同时提供可信视觉、触觉和因果反馈。关键障碍是延迟、参数标定与跨视角一致性。

原文摘要

Squeezing is one of the most natural forms of hand manipulation, inherently involving fine-grained, temporally evolving, per-finger flexion. In VR content creation, squeezing plays a unique role in enabling particular visual effects such as localized deformations and dynamic behaviors, e.g., bursting a Coke can or juicing a fruit, thereby expanding the expressive possibilities of VR content. However, existing techniques, such as 3D Gaussian splatting-based methods and diffusion-based video generation models, are limited in their ability to simulate fine-grained virtual squeezing effects. We introduce VirSqueezer, a framework designed to generate both localized deformations (primary effects) and complex squeezing dynamics, such as rupture and overflow (secondary effects). VirSqueezer captures squeezing control signals using a SenseGlove and provides the user with inferred resistance force feedback during the squeezing process. By estimating object contact areas, inferring physical properties, and simulating physical responses, VirSqueezer computes conditions that guide generation models for visual effect generation, ensuring both visual coherence and temporal synchronization with the simulation. Consequently, VirSqueezer enables the generation of physically realistic visual effects directly from continuous, fine-grained squeezing control signals. Our extensive evaluation demonstrates VirSqueezer's ability to reproduce realistic localized deformations, generate convincing visual dynamics, and maintain consistency in fine-grained squeezing controls.

cs.HC