ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
ELLA通过TSC模块将LLM与扩散模型结合,实现语义对齐提升。
Xiwei Hu, Rui Wang, Yixiao Fang 等
ELLA通过TSC模块将LLM与扩散模型结合,实现语义对齐提升。
Xiwei Hu, Rui Wang, Yixiao Fang 等
通过组合泛化提高机器人操作数据收集效率,策略成功率达77.5%。
Jensen Gao, Annie Xie, Ted Xiao 等
mmPlace利用中频信号生成范围方位热图,结合旋转平台实现鲁棒场所识别,达87.37% recall@1。
Chengzhen Meng, Yifan Duan, Chenming He 等
提出基于Token级不确定性量化的事实核查方法(CCP),在7个模型和4种语言中显著提升准确率。
Ekaterina Fadeeva, Aleksandr Rubashevskii, Artem Shelmanov 等
提出CAT模型,通过引入线索聚合器和AI辅助偏好优化,显著提升动态音视频场景中的问答性能。
Qilang Ye, Zitong Yu, Rui Shao 等
TextMonkey: 无OCR大模型,提升文档理解,OCRBench得分561。
Yuliang Liu, Biao Yang, Qiang Liu 等
基于RL的H2O框架实现RGB摄像头实时人形全身远程操控,成功模拟多场景动作。
Tairan He, Zhengyi Luo, Wenli Xiao 等
采用回归分析验证审稿报告长度(≥947字)与引用数正相关,揭示审稿质量影响出版影响力。
Abdelghani Maddi, Luis Miotti
本文综述了可控生成的文本到图像扩散模型,分析了DDPMs的控制机制。
Pu Cao, Feng Zhou, Qing Song 等
TTPXHunter利用域特定BERT模型自动提取193类TTP,提升F1达97.09%。
Nanda Rani, Bikash Saha, Vikas Maurya 等
Design2Code基准测试多模态代码生成在真实网页中的表现,模型在视觉元素召回和布局生成方面仍有差距。
Chenglei Si, Yanzhe Zhang, Ryan Li 等
MathScale通过主题提取与概念图构建,生成200万数学推理问答,显著提升LLMs数学能力。
Zhengyang Tang, Xingxing Zhang, Benyou Wang 等
本综述分析了90余篇论文,探讨大规模语言模型中的文化表现,提出文化的代理维度及 probing 方法,揭示研究的局限与未来方向。
Muhammad Farid Adilazuarda, Sagnik Mukherjee, Pradhyumna Lavania 等
CoAT方法提升GUI代理零样本预测,AITZ数据集支持。
Jiwen Zhang, Jihao Wu, Yihua Teng 等
提出基于异质处理效应的目标用户攻击模型UBA,利用三阶路径数估算攻击难度,优化虚假用户预算分配。
Wenjie Wang, Changsheng Wang, Fuli Feng 等
Caduceus模型通过双向和RC等变性提升DNA序列建模性能。
Yair Schiff, Chia-Hsiang Kao, Aaron Gokaslan 等
提出基于堆叠因子分解机的Wukong架构,实现推荐模型的可扩展性和两阶数量级的性能提升。
Buyun Zhang, Liang Luo, Yuxin Chen 等
提出探索驱动的轨迹优化方法ETO,通过学习失败轨迹提升LLM智能体性能,实验显示优于基线。
Yifan Song, Da Yin, Xiang Yue 等
提出测度预条件化技术,通过γ-收敛改善参数模型与迁移学习的收敛性。
Joaquín Sánchez García
提出Key-Point-Driven Data Synthesis(KPDDS),构建800K+数学推理问答数据集,显著提升模型性能。
Yiming Huang, Xiao Liu, Yeyun Gong 等