DynSUP: Dynamic Gaussian Splatting from An Unposed Image Pair
DynSUP方法通过两个无姿态图像对实现动态高斯喷溅,显著提升动态场景合成效果。
Weihang Li, Weirong Chen, Shenhan Qian 等
DynSUP方法通过两个无姿态图像对实现动态高斯喷溅,显著提升动态场景合成效果。
Weihang Li, Weirong Chen, Shenhan Qian 等
HyperForget利用超网络实现机器遗忘,在保留集上保持高准确率。
Jose Miguel Lara Rangel, Stefan Schoepf, Jack Foster 等
提出Video-3D LLM,通过引入3D位置编码实现视频到3D场景理解,提升多个基准任务性能。
Duo Zheng, Shijia Huang, Liwei Wang
SSACL+ICLCR联合解决数据湖表集成,F1提升4.2%,准确率提升18.9%。
Daomin Ji, Hui Luo, Zhifeng Bao 等
TQA-Bench评估LLMs在多表问答中的表现,使用8K-64K令牌的上下文。
Zipeng Qiu, Chenyue Li, You Peng 等
提出AMO采样器,通过overshooting增强文本渲染,提升准确率达35.9%。
Xixi Hu, Keyang Xu, Bo Liu 等
提出轨迹注意力机制,通过像素轨迹实现视频细粒度运动控制,显著提升长程一致性。
Zeqi Xiao, Wenqi Ouyang, Yifan Zhou 等
SoLM通过自监督去噪生成符合复杂模式的结构化对象,成本效益高。
Amir Tavanaei, Kee Kiat Koo, Hayreddin Ceker 等
提出FonTS,利用两阶段DiT管线实现字级字体与风格控制,提升文本渲染的细粒度和一致性。
Wenda Shi, Yiren Song, Dengming Zhang 等
AC3D通过频率分析与模型调优,实现视频中3D相机控制的高精度与高质量。
Sherwin Bahmani, Ivan Skorokhodov, Guocheng Qian 等
提出VDMini,通过剪枝和一致性损失加速视频扩散模型,提升2.5倍速度。
Yiming Wu, Zhenghao Chen, Huan Wang 等
G3Flow结合3D生成模型与语义流,提升机器人操控的精度与泛化能力。
Tianxing Chen, Yao Mu, Zhixuan Liang 等
ChatRex通过解耦感知设计提高多模态大模型的感知能力,在COCO数据集上召回率达72.8%。
Qing Jiang, Gen Luo, Yuqin Yang 等
提出Safety-as-Policy,通过虚拟场景生成与反思实现机器人责任操控,显著提升安全性。
Minheng Ni, Lei Zhang, Zihan Chen 等
LLM驱动的GUI代理通过自然语言处理和视觉处理实现自动化,提升人机交互效率。
Chaoyun Zhang, Shilin He, Jiaxu Qian 等
提出基于非线性Ramp ADC的模拟存储器阵列非线性函数逼近,提升RNN能效。
Junyi Yang, Ruibin Mao, Mingrui Jiang 等
Type-R通过后处理自动修正文本生成中的拼写错误,显著提升文字渲染准确率。
Wataru Shimoda, Naoto Inoue, Daichi Haraguchi 等
提出CHOICE基准,系统评估大视觉-语言模型在遥感中的感知与推理能力,涵盖23个任务。
Xiao An, Jiaxing Sun, Zihan Gui 等
MiniKV通过2位层区分KV缓存实现86%压缩率,保持98.5%准确率。
Akshat Sharma, Hangliang Ding, Jianping Li 等
提出结合视觉语言预训练模型与知识推理的VQA新框架,显著提升准确率。
Jiayi Kuang, Jingyou Xie, Haohao Luo 等