Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints
本研究揭示黑箱大模型观察者在共享端点上的测量不稳定性,验证未达预注册门槛。
Haoyaun Zhu, Jie Zhang
本研究揭示黑箱大模型观察者在共享端点上的测量不稳定性,验证未达预注册门槛。
Haoyaun Zhu, Jie Zhang
采用Ostrom治理原则,分析100智能体研究群体中作弊与举报行为的演化机制。
Davide Paglieri, Logan Cross, Tim Genewein 等
提出SIGNBALANCE,解决GRPO中猜测带来的虚假优势,提升数学和搜索任务表现。
Jiamian Wang, Samyadeep Basu, Koustava Goswami 等
引入预测状态匹配训练目标,提升Web代理的判别能力和任务成功率。
Kelvin Li, Dhruv Pendharkar, Anish Pahilajani 等
提出AICOME框架,通过 respondent-level AI测量恢复个体与群体效应,验证CFPS数据。
Wenxin Jiang, Xuyang Wang, Yuxiao Wu
SafeEvolve通过轨迹经验实现外部护具与策略的协同演化,显著提升安全性。
Qinghua Mao, Wanying Qu, Dadi Guo 等
提出基于测量的子网络选择方法,通过结构压缩和检索引导微调,实现工厂边缘设备高效部署,模型大小与性能解耦。
Vasileios Rizeakos, Georgios Paisios, Alexandros Machairas 等
SALA框架通过动态时间规整实现语义对齐,提升复杂推理的上下文学习效果,平均性能提升5%。
Zhao Ji, Wenqing Chen, Zhixuan Chu 等
引入SCILAWS-BENCH,利用真实科学数据评估LLMs发现科学定律能力,涵盖118题,291条潜在定律。
Yiming Huang, Ziche Liu, Zhuohang Wu 等
EdiTikZ通过DaEdiTikZ数据集和强化学习实现科学图表编辑,9B模型超越GPT-5.6-Sol。
Christian Greisinger, Zhixue Zhao, Steffen Eger
FigTree通过递归SVG程序生成科学图表,显著提升编辑性和质量。
Yepeng Liu, Dasen Dai, Chengzhi Liu 等
引入失效合约协议层,通过版本戳和缓存提示提高缓存建议的有效性和合规性。
Michael Wu, Arquimedes Canedo
ReDeck通过逐步渲染反馈优化幻灯片生成,提升空间准确性和设计质量。
Muzhao Tian, Zezi Zeng, Yifan Yang 等
提出自适应结构化未结构化数据的代理式数据破解,显著降低推理成本。
Milad Rezaei Hajidehi, Qitong Wang, Stratos Idreos
提出了答案探测引导的树搜索(APTS),在三个推理任务上提高了解决方案的多样性。
Yi Fang, Que Shen, Chengpeng Li 等
RACER以强化学习和四智能体协作提升KG推理,平均性能提高约5%。
Yuwei Lou, Hao Hu, Yuzhou Jiang 等
GCJR以图约束联合回放恢复最小修复族,在90个受控案例中达到1.000 FEM并节省55.1%回放。
Bingjie Li, Yumeng Song, Zhongming Yao 等
提出Logos,基于ROS架构实现跨进程代理,利用append-only transcript确保容错和可逆性。
Hanzhang Jia, Liheng Zeng, Hao Cheng 等
InstructMesh通过区域选择和目标操作,基于潜在空间实现生成3D模型的选择性修复,提升制造适用性。
Faraz Faruqi, Ahmed Katary, Demircan Tas 等
本文提出五类ASR错误模拟框架,评估其对Embodied AI安全的影响,发现不同错误类型对安全风险影响显著不同。
Sihan Jia, Oliver Lemon