coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation
coDrawAgents框架通过多智能体协作显著提升文本到图像生成的组合性和属性一致性,在GenEval上达94%的整体得分。
Chunhan Li, Qifeng Wu, Jia-Hui Pan 等
coDrawAgents框架通过多智能体协作显著提升文本到图像生成的组合性和属性一致性,在GenEval上达94%的整体得分。
Chunhan Li, Qifeng Wu, Jia-Hui Pan 等
NanoVDR通过蒸馏2B视觉语言检索器为视觉文档检索提供了一个70M的文本编码器,保留了95.1%的教师质量。
Zhuchenyang Liu, Yao Zhang, Yu Xiao
OARS框架通过COMPASS奖励实现实时图像超分辨率,提升视觉感知和保真度。
Shijie Zhao, Xuanyu Zhang, Bin Chen 等
提出EISAM优化框架,显著提升长尾项目推荐性能。
Jiaming Zhang, Yuyuan Li, Xiaohua Feng 等
提出一种基于SRAM的CIM加速器,优化线性衰减尖峰神经网络,能效提高15.9至69倍。
Hongyang Shang, Shuai Dong, Yahan Yang 等
VecMol通过向量场表示生成3D分子,避免显式图生成,提升几何化学一致性。
Yuchen Hua, Xingang Peng, Jianzhu Ma 等
AnchorRec通过锚点对齐防止多模态推荐系统中的位置崩溃,提升推荐准确率。
Yonghun Jeong, David Yoon Suk Kang, Yeon-Chang Lee
FGTR通过层次化LLM推理实现细粒度多表检索,在Spider和BIRD数据集上分别提升F_2指标18%和21%。
Chaojie Sun, Bin Cao, Tiantian Li 等
VGGT-World通过预测冻结GFM特征的时序演变,显著提升深度预测性能,参数仅0.43B,速度提升3.6-5倍。
Xiangyu Sun, Shijie Wang, Fengyi Zhang 等
本文提出了批量核化带宽问题的改进和扩展,优化了批次数量和后悔界限。
Chenkai Ma, Keqin Chen, Jonathan Scarlett
VLM4Rec通过大规模视觉语言模型实现多模态推荐的语义表示,提升推荐性能。
Ty Valencia, Burak Barlas, Varun Singhal 等
InterDeepResearch通过交互式深度研究实现人机协作的信息检索,提升研究过程的可观察性和实时可控性。
Bo Pan, Lunke Pan, Yitao Zhou 等
提出DeepCommit,重建可验证的Milestone DAG,用于评估AI在连续软件演化中的表现。
Gangda Deng, Zhaoling Chen, Zhongming Yu 等
TRACE结合知识图谱和LLM实现可解释的股票预测,在S&P 500上达到55.1%准确率。
Qianggang Ding, Haochen Shi, Luis Castejón Lozano 等
本研究利用词频比分析,揭示大型语言模型在个性化写作反馈中存在的刻板偏见,特别是在学生身份属性条件下的词汇偏移。
Mei Tan, Lena Phalen, Dorottya Demszky
提出交替梯度流效用(AGF),在ImageNet-1K上实现75%压缩时避免结构崩溃。
Tianhao Qian, Zhuoxuan Li, Jinde Cao 等
MamTra结合Mamba和Transformer,减少推理显存使用34%,仅用2%数据训练。
Tan Dat Nguyen, Sangmin Bae, Joon Son Chung 等
研究通过dropout修剪全连接神经网络,揭示了三种相位:eumentia、dementia和amentia。
Haining Pan, Nakul Aggarwal, J. H. Pixley
VQQA利用多智能体问答机制,通过语义梯度优化视频生成,提升质量达+11.57%。
Yiwen Song, Tomas Pfister, Yale Song
EVATok通过自适应长度视频标记化实现高效视觉自回归生成,平均节省24.4%标记。
Tianwei Xiong, Jun Hao Liew, Zilong Huang 等