UP-NRPA: User Portrait based Nested Rollout Policy Adaptation for Planning with Large Language Models in Goal-oriented Dialogue Systems
UP-NRPA通过用户画像和嵌套回滚策略自适应,实现对目标导向对话系统的动态策略规划,谈判成功率提升56.41%。
Hui Wang, Fafa Zhang, Meng Liu 等
UP-NRPA通过用户画像和嵌套回滚策略自适应,实现对目标导向对话系统的动态策略规划,谈判成功率提升56.41%。
Hui Wang, Fafa Zhang, Meng Liu 等
AutoSOTA通过多代理架构实现AI模型自动化优化,平均每篇论文5小时发现105个新SOTA模型。
Yu Li, Chenyang Shao, Xinyang Liu 等
提出五维审计框架,强调审计能力是实现责任追究的前提。
Yi Nian, Aojie Yuan, Haiyue Zhang 等
MO-RiskVAE通过调节潜变量正则化和结构,提升多发性骨髓瘤生存风险预测性能。
Zixuan Chen, Heng Zhang, YuPeng Qin 等
利用半结构化AI访谈和互动可视化,增强集体决策的程序正当性与信任。
Suyash Fulay, Prerna Ravi, Emily Kubin 等
提出基于后果敏感压缩的支持充分性机制,优化信念仲裁中的资源利用。
Mark Walsh
Vero是一个开源的视觉推理RL方法,使用Vero-600K数据集提升视觉推理性能。
Gabriel Sarch, Linrong Cai, Qunzhong Wang 等
RAR框架通过检索增强与强化学习结合,提升推荐性能与事实性,在电影推荐基准上超越现有方法。
Zhenrui Yue, Honglei Zhuang, Zhen Qin 等
ClawArena通过多源冲突推理、动态信念修正和隐性个性化,评估在演变信息环境中AI代理的表现,涵盖12场景337轮次。
Haonian Ji, Kaiwen Xiong, Siwei Han 等
提出AAC算法,通过动作熵动态调整动作块大小,提升机器人操作任务成功率达2.3%。
Yuanchang Liang, Xiaobo Wang, Kai Wang 等
提出基于模型的全身舞蹈生成与控制框架,结合MoCap、QP、TO和MPC实现动态平衡与表现。
Shibowen Zhang, Jiayang Wu, Guannan Liu 等
SODA为大模型黑盒蒸馏提出半在策略方法,训练速度提升10倍,性能优异。
Xiwen Chen, Jingjing Wang, Wenhui Zhu 等
结合自然语言推理与形式验证的自动定理证明框架,解决研究级数学难题,自动化程度高。
Haocheng Ju, Guoxiong Gao, Jiedong Jiang 等
CountsDiff为自然数扩散模型,结合生物计数和图像生成,采用p(t)调度和逆过程非单调性。
Renzo G. Soatto, Anders Hoel, Greycen Ren 等
提出一种基于半参数效率理论的偏差机器学习框架,用于在运行时混杂条件下的反事实预测区间构建。
Keith Barnatchez, Kevin P. Josey, Rachel C. Nethery 等
本研究综述了从视频学习机器人操控接口的方法,提出三种接口:直接视频-动作策略、潜在动作方法、显式视觉接口。
Linfang Zheng, Zikai Ouyang, Chen Wang 等
SymphoMotion通过联合控制相机轨迹与物体动态,实现高一致性视频生成。
Guiyu Zhang, Yabo Chen, Xunzhi Xiang 等
提出SMTPO框架,结合多任务微调与强化学习优化多轮偏好,提升LLM推荐性能。
Xingyuan Xiang, Xiangchen Pan, Wei Wei
提出Sim2Real-AD框架,结合几何观察桥、物理感知映射,实现VLM引导RL的零-shot实车迁移。
Zilin Huang, Zhengyang Wan, Zihao Sheng 等
提出层级规划与潜在世界模型结合的HWM,实现视觉任务的长远规划与零样本操控。
Wancong Zhang, Basile Terver, Artem Zholus 等