Toward Real-world Text Image Forgery Localization: Structured and Interpretable Data Synthesis
提出基于傅里叶级数的篡改合成框架FSTS,有效模拟真实场景中的隐性篡改参数,提升文本图像篡改定位模型的泛化能力。
Zeqin Yu, Haotao Xie, Jian Zhang 等
提出基于傅里叶级数的篡改合成框架FSTS,有效模拟真实场景中的隐性篡改参数,提升文本图像篡改定位模型的泛化能力。
Zeqin Yu, Haotao Xie, Jian Zhang 等
PCRS-TKA通过树状知识和预训练模型提升对话推荐,显著优于基线。
Yongwen Ren, Chao Wang, Peng Du 等
ReaSon利用因果信息瓶颈优化关键帧选择,显著提升视频理解性能。
Yuan Zhou, Litao Hua, Shilong Jin 等
VISAGNN通过动态考虑历史嵌入的陈旧性,有效提升大规模图神经网络训练效率与性能。
Rui Xue
用对称稀疏网格与Glynn公式构造网络,实现误差O(m^-1)且维度因子仅多项式增长。
Yulong Lu, Tong Mao, Jinchao Xu 等
提出LLMLagBench,利用变点检测识别大模型训练的时间边界,实测多模型偏差显著。
Piotr Pęzik, Konrad Kaczyński, Maria Szymańska 等
BudgetLeak通过生成预算侧信道进行RAG系统成员推断,实验显示准确率达98.2%。
Hao Li, Jiajun He, Guangshuo Wang 等
GCAgent通过结构化记忆模型提升长视频理解,达23.5%准确率提升。
Jeong Hun Yeo, Sangyun Chung, Sungjune Park 等
CPIP以Boltzmann–Gibbs耦合构造成本感知政策,并用EIF一步估计提升稳定性。
Johan de Aguas
提出GAD框架,通过对抗训练实现黑盒LLM的无参数知识蒸馏,Qwen2.5-14B在GPT-5-Chat上表现接近。
Tianzhu Ye, Li Dong, Zewen Chi 等
提出LongComp模型,通过场景因子化提升自主驾驶轨迹零样本泛化能力,减少OOD性能差距至2.8%。
Benjamin Stoler, Jonathan Francis, Jean Oh
MonkeyOCR v1.5通过视觉一致性强化学习和两阶段管道实现复杂文档解析,OmniDocBench性能提升2.34%。
Jiarui Zhang, Yuliang Liu, Zijun Wu 等
ADI-20数据集扩展了ADI-17,使用ECAPA-TDNN和Whisper模型进行阿拉伯方言识别。
Haroun Elleuch, Salima Mdhaffar, Yannick Estève 等
提出随机批采样Kaczmarz方法,获得尺度不变的线性收敛保证。
Dong-Yue Xie, Xi Yang
InTRO通过令牌级探索和自反馈提升LLM推理准确性与简洁性,解决单一“黄金”路径限制。
Mingye Zhu, Yi Liu, Zheren Fu 等
MoFa框架融合多维优化特征与容错模型,提升LLM预训练性能预测精度。
Lu Zhao, Rong Shi, Shaoqing Zhang 等
AHA!利用3D高斯喷射实现多场景中的人类动画,提升了几何一致性和自由视角渲染。
Aymen Mir, Jian Wang, Riza Alp Guler 等
C$^3$TG通过冲突感知和协作控制实现多维文本生成,显著提升属性准确率。
Yu Li, Zhe Yang, Yi Huang 等
VeM生成与视频语义、时间、节奏对齐的音乐,提升视听体验。
Xinyi Tong, Yiran Zhu, Jishang Chen 等
提出HardFlow,通过轨迹优化实现流匹配模型的硬约束采样,确保终点满足约束。
Zeyang Li, Kaveh Alim, Navid Azizan