ReflecTool: Towards Reflection-Aware Tool-Augmented Clinical Agents
ReflecTool框架在医学领域中提升了临床代理的工具使用能力,实验中超越纯LLM超过10分。
Yusheng Liao, Shuyang Jiang, Yanfeng Wang 等
ReflecTool框架在医学领域中提升了临床代理的工具使用能力,实验中超越纯LLM超过10分。
Yusheng Liao, Shuyang Jiang, Yanfeng Wang 等
LongVU采用时空自适应压缩,利用DINOv2和跨模态查询,有效处理长视频,提升理解性能。
Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao 等
利用Discogs元数据构建190万版本大数据集,提升音乐版本识别性能。
R. Oguz Araz, Xavier Serra, Dmitry Bogdanov
PyramidDrop通过逐层削减视觉冗余,提升LVLM训练和推理效率,达成40%训练时间和55%推理FLOPs加速。
Long Xing, Qidong Huang, Xiaoyi Dong 等
提出VoiceBench基准,利用多场景语音数据评估LLM语音助手性能,揭示现有模型在真实环境中的局限。
Yiming Chen, Xianghu Yue, Chen Zhang 等
双部Token Embedding以共享语义加随机区分,在LTLRandom35上达95.94%正确率并支持扩展词表。
İlker Işık, Ramazan Gokberk Cinbis, Ebru Aydin Gol
利用已知群组不变性改进贝叶斯优化样本效率,提出不变核方法。
Theodore Brown, Alexandru Cioba, Ilija Bogunovic
提出Scene Language,通过程序、词汇和嵌入描述场景结构、语义和身份,实现无训练推断与高保真场景生成。
Yunzhi Zhang, Zizhang Li, Matt Zhou 等
TIPS结合空间感知,通过合成描述和自监督技术提升图像理解能力。
Kevis-Kokitsi Maninis, Kaifeng Chen, Soham Ghosh 等
提出API调用和混合代理,API代理在WebArena上提升24.0%,成功率达38.9%。
Yueqi Song, Frank Xu, Shuyan Zhou 等
提出Reflection-Bench,基于认知心理学评估大模型的认知主体性,涵盖七个维度,揭示模型在元反思等方面的局限。
Lingyu Li, Yixu Wang, Haiquan Zhao 等
本研究利用ALTI方法分析大规模语言模型在机器翻译中的上下文贡献,揭示源文本和示例位置偏差。
Emmanouil Zaranis, Nuno M. Guerreiro, André F. T. Martins
提出TMCHT任务与ARCJ方法,有效攻击多代理系统,提升成功率达52.93%。
Tianyi Men, Pengfei Cao, Zhuoran Jin 等
通过三项实验评估大模型对论元角色的敏感性,发现模型能区分合理与不合理的动词,但缺乏人类的选择性模式。
Eun-Kyoung Rosa Lee, Sathvik Nair, Naomi Feldman
利用可微模拟训练四旋翼控制,显著提升样本效率,秒级恢复,结合简化模型与视觉特征。
Johannes Heeg, Yunlong Song, Davide Scaramuzza
通过蕴涵调优提升密集段落检索,实验显示在NQ数据集上提高3%。
Lu Dai, Hao Liu, Hui Xiong
MiCEval提出多模态链式推理评价框架,基于描述和推理步骤的自动化评估,显著优于现有方法。
Xiongtao Zhou, Jie He, Lanyu Chen 等
GenEOL利用LLMs生成多样句子变换,通过平均增强语义表示,显著优于现有无训练句向量方法。
Raghuveer Thirukovalluru, Bhuwan Dhingra
JAMUN在平滑噪声空间中结合行走-跳跃采样,实现蛋白质构象快速模拟。
Ameya Daigavane, Bodhi P. Vani, Darcy Davidson 等
基于高斯过程的因果干预函数不确定性量化方法,提升了闭式后验矩和覆盖校准。
Hugh Dance, Peter Orbanz, Arthur Gretton