Algorithmic Fragility and Persona Bias in LLM-Generated Autistic Communication
研究揭示LLM在自闭症交流生成中的算法脆弱性和角色偏见,使用多代理定性分析框架。
Naba Rizvi, Mohammed Rizvi, Harper Strickland 等
研究揭示LLM在自闭症交流生成中的算法脆弱性和角色偏见,使用多代理定性分析框架。
Naba Rizvi, Mohammed Rizvi, Harper Strickland 等
Anchor利用约束优化实现任务生成,解决工商业流程中的artifact drift问题。
Maksim Ivanov, Abhijay Rana
提出AgingBench,基于四种机制评估长寿智能体的可靠性与修复策略。
Jianing Zhu, Yeonju Ro, John Robertson 等
统一神经网络缩放定律(UNSL)精准建模多维度同时变化下的深度学习性能,提升预测准确度超过10%。
Ethan Caballero, Priyank Jaini, David Krueger 等
提出LoopMDM,通过选择性循环早中层Transformer层,显著提升训练效率和推理性能,节省3.3倍FLOPs。
Sanghyun Lee, Chunsan Hong, Seungryong Kim 等
StakeBench框架通过市场承诺评估语言理解,包含560,876条评论和四个诊断任务。
Yunhua Pei, Jingyu Hu, Yiwei Shi 等
本文提出三层崩溃模型,诊断自动研究系统中的工作流闭合非科学闭合问题。
Shuai Wang, Xinyuan Tian, Pangpang Liu 等
提出CoAD框架融合分类与重建,利用软掩码提升时间序列异常检测性能。
Qideng Tang, Dai Chaofan, Wubin Ma 等
提出EQA-Decision,覆盖静态场景构建、空间理解、任务动态推理与即时决策,含超400万问答对。
Xicheng Gong, Qiwei Li, Peiran Xu 等
FEP-Diff通过自由能原理在部分可观测条件下实现认知合理的轨迹预测。
Yanping Wu, Ji Zhang, Hao Chen 等
MIND模型通过显式建模数据流形几何,在ImageNet上实现了2.06的FID。
Duoduo Xue, Zhiyu Zhu, Junhui Hou
DecoR通过查询分解与历史匹配优化LLM路由,提升准确率并降低推理成本。
Bo Lv, Jingbo Sun
TapSampling用Action-VAE采样与任务进度验证器选择动作,使CALVIN多策略及真实机器人成功率提升。
Sizhe Zhao, Shengping Zhang, Shuo Yang 等
BrickAnything利用几何条件和结构感知的Tokenization生成可建造的砖块结构,显著提升稳定性和几何保真。
Zhengyang Ni, Feng Yan, Yu Guo 等
通过文本指向方法解决视觉语言模型的绑定问题,提高多对象任务表现。
Udith Haputhanthri, Declan Campbell, Rim Assouel 等
提出轻量级置信感知语言模型用于自动驾驶决策,达成SOTA性能。
Ruoyu Yao, Ruiguo Zhong, Pei Liu 等
引入Hamiltonian启发的局部算子结构MixT,有效压缩大规模语言模型参数。
Ying Lu, Peng-Fei Zhou, Qi-Xuan Fang 等
该研究提出了一种干扰感知实验设计框架,选择在广告、推荐系统中的实验设计,Criteo广告上风险1.295。
Prashant Shekhar, Caroline Howard
Mimir为多语言概念建模,采用1.6B参数,训练语料达388亿句,突破Token向概念的粒度转变。
Elio Musacchio, Lucia Siciliani, Pierpaolo Basile
Meta-Agent以构建与执行双重验证,将任务成功率提升至平均82.7%。
Andy Xu, Yu-Wing Tai