Large Language Models as User-Agents for Evaluating Task-Oriented-Dialogue Systems
使用大型语言模型作为用户代理评估任务导向对话系统,提升多样性和任务完成率。
Taaha Kazi, Ruiliang Lyu, Sizhe Zhou 等
使用大型语言模型作为用户代理评估任务导向对话系统,提升多样性和任务完成率。
Taaha Kazi, Ruiliang Lyu, Sizhe Zhou 等
EgoVid-5M以500万片段和EgoDreamer实现文本—运动联合的第一人称视频生成。
Xiaofeng Wang, Kang Zhao, Feng Liu 等
GaussianAnything利用点云结构潜在空间实现多模态3D生成,支持交互编辑。
Yushi Lan, Shangchen Zhou, Zhaoyang Lyu 等
Spider 2.0框架评估语言模型在企业级文本到SQL工作流中的表现,仅解决21.3%的任务。
Fangyu Lei, Jixuan Chen, Yuxiao Ye 等
通过合成上下文评估语言模型对不明确查询的响应,发现上下文能显著改变评估结论。
Chaitanya Malaviya, Joseph Chee Chang, Dan Roth 等
提出连续记忆Factoids的框架,采用REMIX策略显著缓解模型遗忘。
Howard Chen, Jiayi Geng, Adithya Bhaskar 等
RFG以随机权重扰动替代反向传播,PDE回归误差最低达0.0347并降低约66%训练计算。
Ruyin Wan, Qian Zhang, George Em Karniadakis
DNCIT将深度图像嵌入与非参数CIT结合,在UK Biobank MRI中控制混杂并验证人格—脑影像关系的零结果。
Marco Simnacher, Xiangnan Xu, Hani Park 等
提出Image2Text2Image框架,利用扩散模型无需参考标注评估图像描述质量。
Jia-Hong Huang, Hongyi Zhu, Yixian Shen 等
采用多模态自监督学习提升心血管疾病预测,模型在有限标注数据下实现7.6%性能提升。
Francesco Girlanda, Olga Demler, Bjoern Menze 等
提出了一种名为Run-Length Tokenization (RLT)的方法,加速视频Transformer训练30%,准确率仅下降0.1%。
Rohan Choudhury, Guanglei Zhu, Sihan Liu 等
本研究评估17个LLMs在长上下文中追踪多线程信息的能力,发现模型表现随上下文增长而下降,但多线程追踪表现良好。
Jonathan Roberts, Kai Han, Samuel Albanie
提出SG-I2V,无需微调即可通过预训练扩散模型实现目标轨迹控制。
Koichi Namekata, Sherwin Bahmani, Ziyi Wu 等
提出DINO-WM,通过预训练视觉特征实现零样本规划,利用离线轨迹学习环境动态,显著优于现有方法。
Gaoyue Zhou, Hengkai Pan, Yann LeCun 等
FrontierMath基准测试复杂数学问题,模型解答率不足2%,揭示AI与人类数学能力差距。
Elliot Glazer, Ege Erdil, Tamay Besiroglu 等
提出自校准列表式重排序方法SCaLR,利用显式相关性评分提升效率与全局比较能力。
Ruiyang Ren, Yuhao Wang, Kun Zhou 等
SimpleQA基准测试评估语言模型回答简短事实性问题的能力,挑战性高,易于评分。
Jason Wei, Nguyen Karina, Hyung Won Chung 等
长上下文RAG提升LLM性能,但仅少数模型在64k以上保持准确。
Quinn Leng, Jacob Portes, Sam Havens 等
利用大型语言模型的机器人可提升医疗效率,解决老龄化和人手短缺问题。
Souren Pashangpour, Goldie Nejat
本报告分析通用AI能力快速提升的技术路径与风险管理,强调规模扩展与模型解释的局限。
Yoshua Bengio, Sören Mindermann, Daniel Privitera 等