MobiDiff: Semantic-Aware Multi-Channel Discrete Diffusion for Human Mobility Data Generation
MobiDiff通过多通道离散扩散生成高效且隐私保护的人类移动数据。
Rongchao Xu, Lin Jiang, Dahai Yu 等
MobiDiff通过多通道离散扩散生成高效且隐私保护的人类移动数据。
Rongchao Xu, Lin Jiang, Dahai Yu 等
研究发现,LLM生成的技能在数据科学工作流中未显著提升表现。
Wei-Jung Huang
提出EVOSOP,通过迭代合成和优化SOP提升LLM代理的任务成功率。
Haipeng Ding, Yuexiang Xie, Zhewei Wei 等
结合无监督字典学习,提出端到端自主驾驶模型的概念解释框架,提升透明度和性能。
Franz Motzkus, Sebastian Bernhard
TurnOPD通过引入逐轮预算策略,提升长时序智能体的在策略蒸馏中的效率,显著改善验证准确率。
Yuhang Zhou, Kai Zheng, Haoling Li 等
提出Heading-Specific Activation Steering,通过提取偏导向向量控制模型工具调用行为,验证其在五个开源模型中的有效性。
Yuqi Chen, Vincent Siu, Yang Liu 等
提出一种将内存引入语言代理推理循环的方法,显著提高任务效率和准确性。
Yusuf Khan, Carlo Lipizzi
本研究提出M3Bench基准,评估医疗视觉语言模型的模型编辑效果,涵盖可靠性、局部性和泛化性,涉及16,276个临床相关问题。
Guli Zhu, Chenwei Wu, Liyue Shen
提出MetaSkill-Evolve,通过两级元技能递归自我提升,提升任务技能+23.54点。
Zefeng Wang, Minxi Yan, Jinhe Bi 等
EvoAgentBench通过能力转移评估代理自我进化,涵盖四个领域,揭示自动方法的局限性。
Xingze Gao, Chuanrui Hu, Hongda Chen 等
提出LLM作为导师框架,通过pairwise比较和原子约束递增难度,提升非可验证RL性能。
Yujin Kim, Namgyu Ho, Sangmin Hwang 等
研究探讨GUI代理对像素与结构的依赖,提出Perception-Fusion Gap指标。
Guijia Zhang, Yuxun Chen, Yuheng Qi 等
Agentic IoT通过自主AI代理实现IoT的认知转型,提升实时推理和自适应规划能力。
Rümeysa Hilal Sevinç, Bahaeddin Türkoğlu, İbrahim Kök
BRAID将多模态推理作为统一马尔可夫决策过程,通过联合优化文本与图像生成,显著提升多轮交互性能。
Zican Hu, Xuyang Hu, Yiming Liu 等
提出跨调查迁移框架,零样本LLM在未见项目上达到52%准确率,接近监督模型。
Chan-Tung Ku, Chan Hsu, Pei-Cing Huang 等
提出Raven-Agent,基于明确的交易层实现自主预测市场交易,达成唯一正收益。
Yishu Wang, Yuxuan Wang, Jiaqi Deng 等
Oyster-II以Zero-RL和SERL提升安全泛化,长查询安全较联合训练高14.65%。
Jiyang Guan, Yong Xie, Jun Chen 等
提出EXT++和PPR优化超图RAG,显著提升事实提取与片段检索效果。
Houda Khrouf, Pedro Fillastre, Sebastiao Correia
提出EvoPolicyGym,评估自主策略演化,在16个交互环境中GPT-5.5表现优异。
Zhilin Wang, Han Song, Runzhe Zhan 等
MAVEN框架通过动态证据状态奖励提升长上下文推理性能,在LongBench v2上提高3.5%。
Ya Gao, Pekka Marttinen