Integrating Large Language Models into Text Animation: An Intelligent Editing System with Inline and Chat Interaction
提出基于LLM的文本动画编辑系统,通过内联建议和对话交互提升非专业用户创作效率。
Bao Zhang, Zihan Li, Zhenglei Liu 等
提出基于LLM的文本动画编辑系统,通过内联建议和对话交互提升非专业用户创作效率。
Bao Zhang, Zihan Li, Zhenglei Liu 等
提出ClaimSpect,基于检索增强的层次化分析框架,有效解构复杂主张,识别多角度证据。
Priyanka Kargupta, Runchu Tian, Jiawei Han
研究揭示LLMs在字符级拼写任务中的复杂性,发现其依赖中高层Transformer层重构字符信息。
Tatsuya Hiraoka, Kentaro Inui
DoublyAware通过双重不确定性分解提升人形机器人运动学习的样本效率和鲁棒性。
Khang Nguyen, An T. Le, Jan Peters 等
StepProof通过逐步验证自然语言数学证明,提高验证成功率和效率。
Xiaolin Hu, Qinghua Zhou, Bogdan Grechuk 等
DiMo-GUI通过模态分离和动态区域缩放,提升GUI定位精度,无需额外训练。
Hang Wu, Hongkai Chen, Yujun Cai 等
用Rectified Flow把3D手部轨迹变成声音,听感常与真声难分。
Yiming Dou, Wonseok Oh, Yuqing Luo 等
Uni-DPO通过动态调整样本权重提升LLM性能,在Arena-Hard上超越Claude 3 Opus 6.7分。
Shangpin Peng, Weinong Wang, Zhuotao Tian 等
提出双体积包装策略实现高效部分级3D生成,无需分割先验。
Jiaxiang Tang, Ruijie Lu, Zhaoshuo Li 等
PersonaLens通过多任务、多域用户画像和LLM代理,系统评估个性化在任务导向对话中的表现。
Zheng Zhao, Clara Vania, Subhradeep Kayal 等
提出R2SE框架,通过硬案例识别与强化微调提升端到端自主驾驶性能。
Haochen Liu, Tianyu Li, Haohan Yang 等
揭示RL中KL梯度估计的三大误区,强调正确实现方法。
Yunhao Tang, Rémi Munos
提出子空间约束随机坐标下降(SC-RCD)算法,有效解决大规模正半定线性系统,抗大谱外特征,利用Nyström低秩逼近提升收敛。
Jackie Lok, Elizaveta Rebrova
LPO通过信息熵和动态距离奖励优化GUI交互位置,显著提升精度。
Jiaqi Tang, Yu Xia, Yi-Feng Wu 等
e3通过链式探索训练,提升LLMs在超出训练预算的推理性能,达成2倍推理长度的外推能力。
Amrith Setlur, Matthew Y. R. Yang, Charlie Snell 等
多实例学习模型在不同器官任务上迁移表现优异,提升9.8%。
Daniel Shao, Richard J. Chen, Andrew H. Song 等
提出基于信任参数λt的抗干扰多机器人协作协议,确保恶意机器人影响下的系统鲁棒性。
Luca Ballotta, Áron Vékássy, Stephanie Gil 等
比较自回归解码和条件流匹配在文本到音乐生成中的表现。
Or Tal, Felix Kreuk, Yossi Adi
提出4DGT基于4D高斯变换器的动态场景重建模型,完全在真实单目视频上训练,显著提升重建速度和效果。
Zhen Xu, Zhengqin Li, Zhao Dong 等
提出Self Forcing,通过自回归展开训练,解决视频生成中的暴露偏差,实现实时流媒体生成,性能优于传统方法。
Xun Huang, Zhengqi Li, Guande He 等