DuoGen: Towards General Purpose Interleaved Multimodal Generation
DuoGen框架通过数据策划和架构设计,实现通用交错多模态生成,提升文本质量和图像一致性。
Min Shi, Xiaohui Zeng, Jiannan Huang 等
DuoGen框架通过数据策划和架构设计,实现通用交错多模态生成,提升文本质量和图像一致性。
Min Shi, Xiaohui Zeng, Jiannan Huang 等
PLADIC利用预训练视频扩散模型实现多物体身份保持与布局控制。
Gemma Canet Tarrés, Manel Baradad, Francesc Moreno-Noguer 等
提出基于风险管理原则的AI安全基准改进策略,涵盖210个评估工具,强调测量的概率性和有效性。
Cheng Yu, Severin Engelmann, Ruoxuan Cao 等
提出DC-CoT,通过RL训练实现任务子模块的并行推理,降低35-40%的最长路径长度。
Arvind Mahankali, Kaiyue Wen, Tengyu Ma
提出SIDP,通过自我模仿提升视觉导航中的路径规划效率与鲁棒性,推理速度提升2.5倍。
Runhua Zhang, Junyi Hou, Changxu Cheng 等
通过嵌入维度和分布收敛理解泛化,使用Wasserstein距离和Lipschitz常数。
Junjie Yu, Zhuoli Ouyang, Haotian Deng 等
提出FaceDefense,通过方向性属性编辑与Diffusion损失实现隐形抗脸换技术,提升防御效果。
Yilong Huang, Songze Li
FNF方法通过功能网络活动一致性检测LLM来源,样本效率高,鲁棒性强。
Yiheng Liu, Junhao Ning, Sichen Xia 等
提出TABROUGE,基于LCS的无训练确定性状态奖励,提升表格推理准确率26.7个百分点。
Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He 等
研究发现自进化大语言模型(LLM)在处理原始经验时表现更忠实,但对压缩经验的利用存在显著不足。
Weixiang Zhao, Yingshuo Wang, Yichen Zhang 等
利用Gemini深度思考模型,系统评估700个“开放”埃尔德什问题中的13个,结合AI验证与专家评审,揭示问题状态与AI局限。
Tony Feng, Trieu Trinh, Garrett Bingham 等
提出黑箱评估无法保障模型更新后对齐,理论证明参数越大越易隐藏潜在偏差。
Yavuz Bakman, Duygu Nur Yaldiz, Eleni Triantafillou 等
提出Vision-DeepResearch,通过多轮、多实体、多尺度视觉文本搜索,增强多模态大模型的深度研究能力,支持数十步推理与数百次引擎交互。
Wenxuan Huang, Yu Zeng, Qiuchen Wang 等
提出SUSTAINSCORE衡量指令遵循对任务解决的干扰,实验显示性能显著下降。
Yunjia Qi, Hao Peng, Xintong Shi 等
PLANING采用三角-高斯混合表示,实现流式3D重建,提升速度与精度。
Changjian Jiang, Kerui Ren, Xudong Li 等
Leviathan通过引入LEV层实现输入输出解耦,提升模型在200M-1.2B参数规模下的性能,减少81%稀有词困惑。
Reza T. Batley, Sourav Saha
提出机制性框架,将持续学习中的遗忘理解为特征编码变换,结合几何分析和Vision Transformer实证。
Sergi Masip, Gido M. van de Ven, Javier Ferrando 等
提出STARS(斯蒂弗尔激活引导)在推理时实现多样生成,优化激活空间体积,提升多路径探索能力。
Dongxuan Zhu, Ly Tran Ho Khanh, Andy Yat-Ming Cheung 等
引入基于大规模多模态生成模型的认知摩擦指标,利用幻觉检测空间设计中的半符号歧义。
Javier Argota Sánchez-Vaquerizo, Luis Borunda Monsivais
提出OVD:基于轨迹匹配的对策,显著降低内存消耗,提升Web问答和数学推理性能。
Jing Xiong, Hui Shen, Shansan Gong 等