Stable Flow: Vital Layers for Training-Free Image Editing
Stable Flow用vital layers+注意力注入实现训练免费稳定编辑
Omri Avrahami, Or Patashnik, Ohad Fried 等
Stable Flow用vital layers+注意力注入实现训练免费稳定编辑
Omri Avrahami, Or Patashnik, Ohad Fried 等
DINO-X模型在开放世界物体检测中表现最佳,COCO上达56.0 AP。
Tianhe Ren, Yihao Chen, Qing Jiang 等
本文通过MorphScore评估22种语言的词形对齐,发现数据规模比形态复杂性更影响模型性能。
Catherine Arnett, Benjamin K. Bergen
提出容量限制下的近似算法,针对子模和子加性偏好,分别实现6+ε和1.33倍近似。
Salil Gokhale, Harshul Sagar, Rohit Vaish 等
Hymba采用混合头架构,结合Transformer注意力机制与状态空间模型(SSM),实现参数紧凑、性能优越,超越同类小模型。
Xin Dong, Yonggan Fu, Shizhe Diao 等
提出极端稀疏训练方法EAST,结合动态ReLU、权重共享和循环稀疏,实现99.99%稀疏下的性能突破。
Andy Li, Aiden Durrant, Milan Markovic 等
提出CAFE数据集,结合阿尔及利亚方言、法语、英语的自发语料,优化ASR性能。
Houssam Eddine-Othman Lachemat, Akli Abbas, Nourredine Oukas 等
提出轻量化在线召回模型的缩放定律,利用离线指标R/R*预测在线收益。
Yunli Wang, Zhen Zhang, Zixuan Yang 等
Video-RAG结合外部视觉对齐文本,无需训练,提升长视频理解,平均性能提升2.8%。
Yongdong Luo, Xiawu Zheng, Guilin Li 等
提出RONAR系统,基于大模型实现机器人多模态体验的自然语言描述,提升故障分析效率。
Zihan Wang, Brian Liang, Varad Dhat 等
提出基于LLM的Geo-Time Re-ranking模型,在LEO数据集上实现相似事件推荐性能提升。
Yuanyuan Tian, Wenwen Li, Lei Hu 等
提出基于后验回归的低方差估计方法,提升少标签条件下的PPI性能。
Benjamin Eyre, David Madras
通过扩展线性RNN的特征值范围至[-1,1],实现状态追踪能力的突破,提升模型在奇偶性等任务中的表现。
Riccardo Grazzi, Julien Siems, Arber Zela 等
通过附加逻辑训练(ALT)和FLD×2语料库,提升LLaMA-3.1-70B的推理能力,逻辑推理基准提高30分。
Terufumi Morishita, Gaku Morio, Atsuki Yamaguchi 等
利用大规模用户日志分析Tetun低资源MT,揭示用户需求与领域偏好。
Raphael Merx, Adérito José Guterres Correia, Hanna Suominen 等
提出针对视觉-语言-动作模型的对抗攻击,成功降低机器人任务成功率达100%。
Taowen Wang, Cheng Han, James Chenhao Liang 等
提出RandSymKL方法,结合对称KL和交叉熵,有效减轻孟加拉语分类任务中的外在性别偏见。
Sajib Kumar Saha Joy, Arman Hassan Mahy, Meherin Sultana 等
USP-Gaussian方法通过统一尖峰图像重建、姿态校正和高斯喷溅,实现了更高精度的3D重建。
Kang Chen, Jiyuan Zhang, Zecheng Hao 等
本研究评估预训练视觉表示(PVR)在模型基础强化学习(MBRL)中的效果,发现其在样本效率和泛化能力方面表现不佳。
Moritz Schneider, Robert Krug, Narunas Vaskevicius 等
本研究利用基于自我报告的LLM生成代理,结合访谈和问卷数据,能在无需任务特定训练的情况下,模拟个体多维行为与态度,达成83-86%的预测准确率。
Joon Sung Park, Carolyn Q. Zou, Jonne Kamphorst 等