VipDiff: Towards Coherent and Diverse Video Inpainting via Training-free Denoising Diffusion Models
VipDiff利用光流和无训练扩散模型实现视频修复,显著提升时空一致性。
Chaohao Xie, Kai Han, Kwan-Yee K. Wong
VipDiff利用光流和无训练扩散模型实现视频修复,显著提升时空一致性。
Chaohao Xie, Kai Han, Kwan-Yee K. Wong
基于扩散变换器的Hunyuan3D 2.0系统,结合ShapeVAE与Paint模型,实现高分辨率纹理3D资产生成。
Zibo Zhao, Zeqiang Lai, Qingxiang Lin 等
提出基于大语言模型的平衡检索增强生成(Balanced RAG)框架,有效应对极端类别不平衡,提升虚假信息检测性能。
Nikos Kanakaris, Heng Ping, Xiongye Xiao 等
Zep采用Graphiti知识图谱,动态融合会话与业务数据,性能优于MemGPT,达94.8%。
Preston Rasmussen, Pavlo Paliychuk, Travis Beauvais 等
研究探讨内在奖励对强化学习探索的影响,发现State Count在低维表现最佳。
Aya Kayal, Eduardo Pignatelli, Laura Toni
提出线性扩展的因果发现框架,基于动力社区检测,适用于高维时间序列。
Matteo Allione, Vittorio Del Tatto, Alessandro Laio
提出基于子词模型的字符预测算法,提升AAC字符预测准确率,结合领域适应显著改善简单对话文本表现。
Dylan Gaines, Keith Vertanen
提出One-D-Piece,支持1-256变长图像标记,结合Tail Token Drop实现高效质量可控压缩,超越JPEG/WebP。
Keita Miwa, Kento Sasaki, Hidehisa Arai 等
GVMGen利用层次注意机制实现视频与音乐的高相关性生成,超越前沿模型。
Heda Zuo, Weitao You, Junxian Wu 等
FAST利用离散余弦变换实现机器人动作序列的高效编码,训练高频率复杂任务性能优越。
Karl Pertsch, Kyle Stachowicz, Brian Ichter 等
提出基于奖励引导的推断时对齐方法,结合SMC、价值采样等技术,提升扩散模型在蛋白质设计中的性能。
Masatoshi Uehara, Yulai Zhao, Chenyu Wang 等
本研究综述了大规模语言模型(LLMs)在电子设计自动化(EDA)中的应用,涵盖模型架构、规模影响及定制技术。
Jingyu Pan, Guanglei Zhou, Chen-Chia Chang 等
WMamba结合小波分析与动态轮廓卷积,提升面部伪造检测性能,达SOTA水平。
Siran Peng, Tianshuo Zhang, Li Gao 等
提出模糊全外连接(Fuzzy Full Disjunction),结合模糊匹配提升数据湖表格整合效果,实验显示效率几乎不变。
Aamod Khatiwada, Roee Shraga, Renée J. Miller
Agentic RAG通过自主AI代理实现动态检索和生成,提升实时响应能力。
Aditi Singh, Abul Ehtesham, Saket Kumar 等
提出MMDocIR基准,结合页面和布局层面多模态检索,显著优于文本检索,推动长文档理解。
Kuicai Dong, Yujing Chang, Xin Deik Goh 等
VRS-HQ利用多模态大模型的层级令牌实现视频推理分割,提升J&F得分超越VISA。
Sitong Gong, Yunzhi Zhuge, Lu Zhang 等
MiniMax-01系列采用Lightning Attention与MoE,参数达4560亿,支持长达百万级上下文,性能媲美GPT-4。
MiniMax, Aonian Li, Bangwei Gong 等
TempoGPT通过量化时间嵌入,提升多模态时间序列推理能力,显著优于现有模型。
Haochuan Zhang, Chunhua Yang, Jie Han 等
利用 conformal prediction 提供深度学习模型在精准除草中的90%以上置信保证。
Paul Melki, Lionel Bombrun, Boubacar Diallo 等