VisualMRC: Machine Reading Comprehension on Document Images
提出VisualMRC数据集及基于视觉布局的扩展Seq2Seq模型,提升文档理解能力。
Ryota Tanaka, Kyosuke Nishida, Sen Yoshida
提出VisualMRC数据集及基于视觉布局的扩展Seq2Seq模型,提升文档理解能力。
Ryota Tanaka, Kyosuke Nishida, Sen Yoshida
通过H-LIP步态合成和步进稳定化实现3D欠驱动双足行走,实验展示高鲁棒性。
Xiaobin Xiong, Aaron Ames
提出WebSRC数据集,结合HTML结构与视觉特征,提升网页问答理解能力。
Xingyu Chen, Zihan Zhao, Lu Chen 等
提出多轮对话策略与偏好引导技术,提升CRS性能,实验显示准确率提升15%。
Chongming Gao, Wenqiang Lei, Xiangnan He 等
通过使用噪声负样本进行训练,提出了一种密集异常检测和开放集识别方法,在WildDash 1上表现出色。
Petra Bevandić, Ivan Krešo, Marin Oršić 等
提出pQRNN,参数极少的多语言任务专用模型,达95.9%教师性能,参数缩减350倍。
Prabhu Kaliamoorthi, Aditya Siddhant, Edward Li 等
本研究评估LIME、SHAP和TreeInterpreter在金融欺诈检测中的实际应用效果,发现解释反而降低准确率。
Sérgio Jesus, Catarina Belém, Vladimir Balayan 等
本论文提出通过微调预训练多语模型的词嵌入,结合无监督目标提升多语种词对齐性能,显著优于现有方法。
Zi-Yi Dou, Graham Neubig
EMMA在MESSENGER中通过文本—实体联合注意力实现零样本泛化,测试胜率较基线高40%,但最难阶段仅10%。
Austin W. Hanjie, Victor Zhong, Karthik Narasimhan
提出LbW框架,通过无监督人-机器人翻译和关键点检测,实现单视频模仿学习,显著优于SOTA(五任务)。
Haoyu Xiong, Quanzhou Li, Yun-Chun Chen 等
MP3提出端到端无地图驾驶模型,利用在线场景表示实现安全、可解释的自主决策。
Sergio Casas, Abbas Sadat, Raquel Urtasun
提出社会价值对齐的新框架,结合公平性与AI安全,强调多元价值的全球适配。
Iason Gabriel, Vafa Ghazavi
提出Switch Transformer,通过单专家路由实现 trillion 级参数模型,训练速度提升7倍。
William Fedus, Barret Zoph, Noam Shazeer
NequIP采用E(3)-等变卷积实现高效、精确的原子间势能学习,训练数据比传统模型少三个数量级。
Simon Batzner, Albert Musaelian, Lixin Sun 等
LightLayers通过矩阵分解减少参数,达成在CIFAR-10上仅用1/3参数的高效模型。
Debesh Jha, Anis Yazidi, Michael A. Riegler 等
提出了一种端到端工作流,通过版本识别系统实现68%的现场音乐元数据识别。
Furkan Yesiler, Emilio Molina, Joan Serrà 等
提出基于等式饱和的张量图超优化方法TENSAT,实现16%性能提升,优化时间缩短48倍。
Yichen Yang, Phitchaya Mangpo Phothilimtha, Yisu Remy Wang 等
本论文提出基于结构光的立体匹配方法,利用深度学习实现端oscopy深度估计,平均误差低于3mm。
Max Allan, Jonathan Mcleod, Congcong Wang 等
本研究提出基于词源分割的BERT模型DelBERT,显著提升复杂词语的语义理解能力。
Valentin Hofmann, Janet B. Pierrehumbert, Hinrich Schütze
本研究提出BanglaBERT,基于ELECTRA的低资源Bangla预训练模型,利用27.5GB数据,在四项NLU任务中刷新SOTA。
Abhik Bhattacharjee, Tahmid Hasan, Wasi Uddin Ahmad 等