Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier
Aya Expanse为8B/32B多语模型,结合数据套利、偏好训练和模型合并,性能超越同类模型。
John Dang, Shivalika Singh, Daniel D'souza 等
Aya Expanse为8B/32B多语模型,结合数据套利、偏好训练和模型合并,性能超越同类模型。
John Dang, Shivalika Singh, Daniel D'souza 等
提出Relign框架,通过可靠性对齐显著减少工具幻觉,提升任务可靠性。
Hongshen Xu, Zichen Zhu, Lei Pan 等
Monet通过单义专家混合提升Transformer的可解释性,专家数量达262,144。
Jungwoo Park, Young Jin Ahn, Kee-Eung Kim 等
提出NoiseRefine,通过噪声映射实现无指导高质量图像生成,训练仅用5万文本-图像对。
Donghoon Ahn, Jiwon Kang, Sanghyun Lee 等
大语言模型驱动的社会模拟研究,分类为个体、场景和社会模拟。
Xinyi Mou, Xuanwen Ding, Qi He 等
MIDI将预训练的单图3D模型扩展为多实例扩散模型,实现多物体空间关系的高效生成。
Zehuan Huang, Yuan-Chen Guo, Xingqiao An 等
PaliGemma 2结合SigLIP-So400m编码器和Gemma 2模型,训练多尺寸多任务,显著提升多模态迁移性能。
Andreas Steiner, André Susano Pinto, Michael Tschannen 等
提出BTimer,一种基于弹壳时间的动态场景单目视频实时重建模型,实现150ms内高质量场景重建。
Hanxue Liang, Jiawei Ren, Ashkan Mirzaei 等
Mimir通过融合文本编码器和大语言模型,提升视频扩散模型的文本理解能力。
Shuai Tan, Biao Gong, Yutong Feng 等
提出Pragmatic Metacognitive Prompting(PMP),利用语言学 pragmatics 和反思策略,显著提升LLMs在讽刺检测中的表现,GPT-4o在MUStARD和SemEval2018上达成SOTA。
Joshua Lee, Wyatt Fong, Alexander Le 等
HunyuanVideo为开源大规模视频生成模型,参数超13亿,性能媲美行业顶尖闭源模型。
Weijie Kong, Qi Tian, Zijian Zhang 等
提出最优的硬币投注算法用于均值估计,证明其在e变量框架中的最优性。
Eugenio Clerico
提出基于Transformer的多模态医学基础模型,提升多器官多模态数据融合性能。
Kai Sun, Siyan Xue, Fuchun Sun 等
UNIFY构建统一基于PG的索引,支持多策略融合,实现高维向量的范围过滤近似最近邻搜索。
Anqi Liang, Pengcheng Zhang, Bin Yao 等
双曝光立体技术扩展动态范围3D成像,提升深度估计准确性。
Juhyung Choi, Jinnyeong Kim, Seokjun Choi 等
SceneFactor利用因式分解的潜在扩散模型实现可控大规模3D场景生成与编辑。
Alexey Bokhovkin, Quan Meng, Shubham Tulsiani 等
Commit0通过交互式反馈挑战AI从零构建库,验证单元测试达成率有限。
Wenting Zhao, Nan Jiang, Celine Lee 等
LamRA利用大规模多模态模型实现多任务检索与重排序,显著提升零样本性能。
Yikun Liu, Pingan Chen, Jiayin Cai 等
提出结构化潜在(SLAT)表示的3D生成方法,结合稀疏网格与多视角特征,实现多格式输出,训练参数达20亿。
Jianfeng Xiang, Zelong Lv, Sicheng Xu 等
通过几何信息提升AI模型在艺术图像中的特征提取与生成能力,使用PACS数据集。
Mridula Vijendran, Jingjing Deng, Shuang Chen 等