Measuring What a Specification Determines: A Formal Semantic-Block Model and an Execution-Judged Benchmark
引入形式语义块模型和执行评估基准,提升规范质量评估独立性。
Oleg Grynets, Dmytro Kostetskyi, Vasyl Lyashkevych
引入形式语义块模型和执行评估基准,提升规范质量评估独立性。
Oleg Grynets, Dmytro Kostetskyi, Vasyl Lyashkevych
HiRA-CAM通过多层区域一致性增强CNN的细粒度空间解释,优于LayerCAM和Grad-CAM。
Manasi Nerurkar, Ali A. Minai
提出公平感知网络嵌入方法,分类为光谱、随机游走、图神经网络等,解决社会偏见问题。
Ella Has, Harshith Kumar Yadav, Gaurav Dixit 等
SPADE采用自我对弈机制,利用LLM生成可执行环境并优化环境设计,提升多任务性能,平均提升5.3%。
Bo Liu, Simon Yu, Yiding Jiang 等
提出PartialBiGrasp,通过卷积占据网络在部分点云上推断隐藏局部几何,实现稳健双臂抓取。
Ayush Kaura, Vignesh Vembar, Md Faizal Karim 等
提出Group-Calibrated On-Policy Distillation(GC-OPD),在长上下文推理中通过响应级验证器奖励校准偏差,提升五项基准平均分从29.08提升至40.47。
Zhu Zhang, Jixun Wang, Xiaoang Xu 等
Outcome Monitors提高ToolMaze完成率至28.1%,显著改善工具故障恢复。
Sugam Panthi, Rabab Abdelfattah
MDTIM模型通过离散化时间序列实现更高效的插补,提升了30%的准确性。
Dongbin Kim, Seungyun Lee, Geonwoo Shin 等
JANUS是一种多模态神经采样器,能在无序材料中以极少能量评估重现平衡态。
Denis Blessing, Mouyang Cheng, Maximilian Schebek 等
提出DistScan,通过预NMS预测分布偏移检测目标检测模型中的后门,准确率达97.22%。
Longtian Wang, Zhengyu Zhao, Chenhao Lin 等
提出DA-WAM,通过动作条件未来潜在表示与轨迹评分结合,实现自主驾驶场景的决策对齐,显著优于现有方法。
Ruiguo Zhong, Benshan Ma, Xiaolong Chen 等
本文通过对大规模语言模型(LLM)后训练轨迹的实证分析,发现其策略锁定在初始阶段,缺乏在执行中自主策略重评机制,影响AI自我改进能力。
Joy Jia Yin Lim, Xin Huang, Hao Peng 等
SiConMo在ADE20K仅0.6 GFLOPs达34.8 mIoU,以瓶颈融合局部与全局上下文。
Mian Muhammad Naeem Abid, Nancy Mehta, Zongwei Wu 等
引入Penrose张量符号的图示法,映射PyTorch einsum,提升可解释性与重现性。
Pietro Barbiero
可验证弃权机制使AI在城市供水网络漏诊中更负责任,550事件中214准确。
Tianwei Mu, Yue Wang, Mingzhe Yuan 等
提出数据共观(co-observation)作为持续学习的第三关键因素,系统分析其对模型泛化的影响。
Timm Hess, Abhishek Jha, Gido M. van de Ven 等
RP1通过学习多步计划优化规则,在视觉导航和机器人任务中实现了比手工设计搜索算法更优的性能,使用千倍更少的模型滚动。
Armin Sommer, Jannik Schilling
LabDex通过层次化任务架构评估实验室灵巧操作,验证了其在真实和模拟环境中的有效性。
Zhipeng Tang, Sihang Chen, Sha Zhang 等
提出DAEI,结合残差去噪自编码器,有效反演噪声保护文本嵌入,BLEU提升154%。
Yubo Wang, Shujie Cui, James Bailey 等
VA-Judger基于人类偏好反馈,采用链式推理和维度强化学习,显著提升视频音频生成的符合度。
Yinming Huang, Shuyuan Tu, Xi Yan 等