Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation
CRYSTAL基准评估多模态推理透明性,提出Match F1和Ordered Match F1,揭示现有模型的系统性缺陷。
Wayner Barrios, SouYoung Jin
CRYSTAL基准评估多模态推理透明性,提出Match F1和Ordered Match F1,揭示现有模型的系统性缺陷。
Wayner Barrios, SouYoung Jin
SldprtNet是一个包含24.2万工业零件的大规模多模态数据集,用于语义驱动的CAD建模。
Ruogu Li, Sikai Li, Yao Mu 等
通过学习先验模型实现零超参数的多角分析,验证成本降低10倍。
Wei W. Xing, Kaiqi Huang, Jiazhan Liu 等
线性化注意力机制中的影响可塑性:非收敛NTK动态的双重影响。
Jose Marie Antonio Miñoza, Paulo Mario P. Medina, Sebastian C. Ibañez
InterEdit通过语义感知计划令牌对齐和交互感知频率令牌对齐,实现多人人体3D动作编辑。
Yebin Yang, Di Wen, Lei Qi 等
DDIM反向链作为分区迭代函数系统,提供去噪扩散模型的统一设计语言。
Ann Dooms
WALAR方法利用单语数据提升低资源语言翻译能力,超越LLaMAX模型。
Yifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa 等
提出PCA扫掠方法,优化SSD中的维度选择,提升解释性和稳定性。
Hubert Plisiecki, Maria Leniarska, Jan Piotrowski 等
在神经形态硬件上实现联邦少样本学习,使用FedUnion策略保持77.0%准确率。
Steven Motta, Gioele Nanni
OpenSWE通过多代理合成管道创建45,320个可执行Docker环境,提升SWE代理训练效率。
Dayuan Fu, Shenyu Wu, Yunze Wu 等
通过结构化蒸馏方法,将个性化代理记忆的代币数量减少11倍,同时保留检索能力。
Sydney Lewis
通过新颖的主动防御方法,显著降低操控器在网络攻击下的末端偏差。
Gabriele Gualandi, Alessandro V. Papadopoulos
通过资源优先的路径碎片化方法,提升农业环境中多机器人路径规划效率,达到95%的任务吞吐率。
James R. Heselden, Gautham P. Das
Long-form RewardBench评估长文本生成的奖励模型,揭示当前模型在长文本奖励建模方面的不足。
Hui Huang, Yancheng He, Wei Liu 等
RoboStream利用时空融合标记和因果图实现机器人长时域操作的持久记忆与推理,达成90.5%成功率。
Yuzhi Huang, Jie Wu, Weijue Bu 等
MotionAnymesh通过物理约束的关节估计和运动优化,将静态3D网格转换为模拟就绪的数字孪生。
WenBo Xu, Liu Liu, Li Zhang 等
AMRO-S通过蚁群优化实现高效可解释的多智能体LLM路由,提升4.7倍速度。
Xudong Wang, Chaoning Zhang, Jiaquan Zhang 等
HMS-BERT通过多任务自训练实现多语言多标签网络欺凌检测,宏F1达到0.9847。
Zixin Feng, Xinying Cui, Yifan Sun 等
通过混合累积量模型,研究扩散模型从简单到复杂学习数据统计的机制。
Lorenzo Bardone, Claudia Merger, Sebastian Goldt
引入Hessian相对均匀连续性条件,简化分布式镜像下降分析,覆盖更广泛的核函数。
Junwen Qiu, Ziyang Zeng, Leilei Mei 等