LTX-2: Efficient Joint Audio-Visual Foundation Model
LTX-2采用非对称双流Transformer架构,结合多模态交叉注意力,实现高效同步音视频生成,参数规模达14B(视频)和5B(音频)。
Yoav HaCohen, Benny Brazowski, Nisan Chiprut 等
LTX-2采用非对称双流Transformer架构,结合多模态交叉注意力,实现高效同步音视频生成,参数规模达14B(视频)和5B(音频)。
Yoav HaCohen, Benny Brazowski, Nisan Chiprut 等
MedDialogRubrics通过多代理系统评估LLM的多轮诊断能力,包含5200例患者案例。
Lecheng Gong, Weimin Fang, Ting Yang 等
LOST-3DSG利用词向量实现轻量级开放词汇3D场景图,提升动态环境中的物体追踪效率。
Sara Micol Ferraina, Michele Brienza, Francesco Argenziano 等
VLM4VLA通过少参数微调,将通用VLM转为机器人控制模型,性能优于复杂架构。
Jianke Zhang, Xiaoyu Chen, Qiuyue Wang 等
DGA-Net通过深度提示和图锚引导提升伪装物体检测性能,超越现有方法。
Yuetong Li, Qing Zhang, Yilin Zhao 等
Falcon-H1R通过混合模型实现高效推理,参数仅7B,性能超越更大模型。
Falcon LLM Team, Iheb Chaabane, Puneesh Khanna 等
提出了延迟承诺解码(DCD),提高扩散语言模型生成准确率1.73%。
Yingte Shu, Yuchuan Tian, Chao Xu 等
提出隐状态中毒攻击(HiSPA),利用短输入触发器在Mamba模型中实现信息篡改,显著削弱模型的长文本检索能力。
Alexandre Le Mercier, Chris Develder, Thomas Demeester
提出特征依赖噪声模型,在DMControl和Meta-world中进行测试,发现无显式去噪的PbRL方法表现更优。
Yuxuan Li, Harshith Reddy Kethireddy, Srijita Das
OpenRT框架支持37种攻击策略,评估20个MLLM模型,平均攻击成功率达49.14%。
Xin Wang, Yunhao Chen, Juncheng Li 等
提出ReToK,通过冗余Token填充和层级语义正则化,显著改善灵活图像Tokenizer的生成性能。
Zixuan Fu, Lanqing Guo, Chong Wang 等
SWE-Lego采用轻量化SFT,结合数据增强与测试时扩展,达成软件问题解决新高。
Chaofan Tao, Jierun Chen, Yuxin Jiang 等
提出异质再生产框架,解决大模型中的同质化问题,强调多样性在AI安全中的核心作用。
Ian Rios-Sialer
ScienceDB AI利用LLM实现科学数据集推荐,提升30%准确率。
Qingqing Long, Haotian Chen, Chenyang Zhao 等
利用DMFT分析高维随机矩阵驱动的动力学系统,揭示学习与泛化机制。
Blake Bordelon, Cengiz Pehlevan
提出Fusion-SSAT,通过特征融合提升深伪检测的泛化能力,实验证明优于SOTA方法。
Shukesh Reddy, Srijan Das, Abhijit Das
SpaceTimePilot模型实现动态场景的时空生成渲染,支持独立控制相机视角和运动序列。
Zhening Huang, Hyeonho Jeong, Xuelin Chen 等
采用OpenForesight数据集,结合检索与强化学习,训练OpenForecaster 8B模型提升未来预测准确性。
Nikhil Chandak, Shashwat Goel, Ameya Prabhu 等
提出mHC,通过投影到双随机矩阵流形,恢复残差连接的恒等映射,提升大规模训练稳定性。
Zhenda Xie, Yixuan Wei, Huanqi Cao 等
提出Encyclo-K,通过动态组合知识陈述进行大模型评估,解决数据污染和多知识点理解难题。
Yiming Liang, Yizhi Li, Yantao Du 等