GLAD: Global-Local View Alignment and Background Debiasing for Unsupervised Video Domain Adaptation with Large Domain Gap
GLAD结合全局-局部视图对齐与背景去偏,显著改善大域差异下的视频无监督域适应。
Hyogun Lee, Kyungho Bae, Seong Jong Ha 等
GLAD结合全局-局部视图对齐与背景去偏,显著改善大域差异下的视频无监督域适应。
Hyogun Lee, Kyungho Bae, Seong Jong Ha 等
提出循环变换器(Looped Transformer)以模拟迭代学习算法,参数少于10%,性能媲美标准变换器。
Liu Yang, Kangwook Lee, Robert Nowak 等
提出同步多视角扩散方法,实现基于文本的3D纹理一致性合成。
Yuxin Liu, Minshan Xie, Hanyuan Liu 等
提出层次关系头和常识验证,显著提升场景图生成性能,平均提升R@50达10%以上。
Bowen Jiang, Zhijun Zhuang, Shreyas S. Shivakumar 等
提出结构感知的检索增强语言模型ATLANTIC,结合图神经网络提升科学文献的相关性和信实性。
Sai Munikoti, Anurag Acharya, Sridevi Wagle 等
PF-LRM是一种无需预设姿态的3D重建模型,能在1.3秒内实现多视角姿态与形状预测。
Peng Wang, Hao Tan, Sai Bi 等
FinanceBench评估LLMs财务问答性能,81%模型在检索系统中答错或拒答。
Pranab Islam, Anand Kannappan, Douwe Kiela 等
AutoStory利用大语言模型进行布局规划,结合扩散模型实现多样高质故事图像生成,极大简化人机交互。
Wen Wang, Canyu Zhao, Hao Chen 等
提出LEO,基于3D视觉-语言对齐与指令微调的多模态通用智能体,显著提升3D场景理解与操作能力。
Jiangyong Huang, Silong Yong, Xiaojian Ma 等
稀疏OSNAP以s=O(log⁴d)实现m=(1+θ)d的常数失真OSE。
Shabarish Chenakkod, Michał Dereziński, Xiaoyu Dong 等
提出AgentMonitor安全框架,基于对AutoGPT的实测,F1达89.4%。
Silen Naihin, David Atkinson, Marc Green 等
提出歌曲描述数据集(SDD),用于音乐与语言模型评估,包含1106条高质量音频描述。
Ilaria Manco, Benno Weck, SeungHeon Doh 等
ARES:自动化评估框架,提升RAG系统评估精度,减少人工标注。
Jon Saad-Falcon, Omar Khattab, Christopher Potts 等
提出MMC-Instruction数据集和MMCA模型,显著提升图表理解能力。
Fuxiao Liu, Xiaoyang Wang, Wenlin Yao 等
提出衡量对话中的“基础行为”指标,发现大模型生成的“理解行为”明显少于人类,训练偏好数据降低了“理解行为”的频率。
Omar Shaikh, Kristina Gligorić, Ashna Khetan 等
本研究将人类反馈融入神经机器翻译,通过数据过滤、RL训练和重排序提升翻译质量。
Miguel Moura Ramos, Patrick Fernandes, António Farinhas 等
GRASP基准评估多模态LLM的语言落地和物理理解能力,发现其在直觉物理测试中表现不佳。
Serwan Jassim, Mario Holubar, Annika Richter 等
HeLM通过行证据高亮与摘要模块,基于LLaMA2实现表格到文本的提升,ROUGE/ BLEU达SOTA。
Junyi Bian, Xiaolei Qin, Wuhe Zou 等
本研究系统评估对话摘要模型在自然变异下的鲁棒性,发现Instruction-tuned模型更敏感。
Ankita Gupta, Chulaka Gunasekara, Hui Wan 等
UFOGen通过扩散GAN实现超快一步文本到图像生成,显著降低计算成本。
Yanwu Xu, Yang Zhao, Zhisheng Xiao 等