From Deterministic to Generative Deep Learning for Urban Air Quality Reconstruction from Sparse Observations
使用扩散生成框架从稀疏观测中重建城市空气质量,模型在巴黎数据集上表现优异。
Abhishek A. Sabnis, Mihai Mitrea, Lya Lugon 等
使用扩散生成框架从稀疏观测中重建城市空气质量,模型在巴黎数据集上表现优异。
Abhishek A. Sabnis, Mihai Mitrea, Lya Lugon 等
提出人机交互流程,基于SciSummNet数据集,利用GPT-4o-mini生成科学摘要简化版本,结合专家编辑提升领域术语和科学准确性。
Kyuri Im, Michael Färber
MemSFT通过外部参数记忆缓解模型微调中的对齐税,提升领域性能且保持通用能力。
Jiarui Wang, Xiang Shi, Jiaqi Cao 等
CORF-GS通过光学-RF高斯分布联合优化,实现实时无线辐射场重建,速度提升6.4倍。
Jinya Zhang, Jiajia Guo, Chao-Kai Wen 等
Argus-Unified利用预训练VLM,采用混合视觉Token实现图像理解与生成,成本低达$2000。
Weiming Zhuang, Jiabo Huang, Jingtao Li 等
I2VShield通过生成对抗攻击保护隐私,减少计算成本,提升DiT模型防御效果。
Yimao Guo, Zuomin Qu, Wei Lu
TRWH结合LLMs文本特征与异构图,通过随机游走提升稀疏推荐性能。
He Ma, Chen Liu
CLBench-V评估多模态上下文学习,最佳模型得分仅0.2847。
Lai Wei, Chengqi Li, Jiapeng Li 等
提出无指令对齐的音频-语言模型,仅训练轻量投影器,性能媲美或超越大量后训练模型。
Xuanru Zhou, Yiwen Shao, Jiahong Li 等
本研究复现并扩展Contrastive Decoding(CD)在MLLM中减轻对象幻觉的效果,发现其提升多为虚假。
Arnav Bendre, Guneesh Gupta, Kavish Grover 等
PreDiff-LM采用混合注意力机制,结合预训练离散掩码扩散模型,显著提升无条件困惑度,从34.1降至28.7。
Zhengtao Yao, Runhao Li, Xupeng Chen 等
利用序数模式和信息熵分析14家秘鲁新闻源的文本结构,分类准确率达99%。
Cynthia Z. Zhou-Lin, José L. Herrera-Diestra, Luciano Stucchi
PerceptionBench评估多模态大语言模型的视觉感知能力,16个模型最高准确率仅59.7%。
Zichao Lin, Yifeng Xie, Bowen Qu 等
Mage-VL通过Codec驱动的稀疏编码,显著提升实时多模态流感知效率,减少75%视觉Token,达成3.5倍速度提升。
Senqiao Yang, Kaichen Zhang, Zhaoyang Jia 等
提出基于帕累托前沿AUC的效率评估,比较多种搜索算法,创新性引入流动搜索策略。
Haiqian Yang, Yuan Cao
提出PARED,通过特征空间逆强化学习实现AI行为对人类示范的隐式奖励提取。
Michał Wiliński, Liu Leqi, Chirag Nagpal
CameraAnything通过Plücker光线和3D RoPE实现多维摄像机参数联合控制,支持视角、焦距、分辨率变换。
Yixuan Li, Yanhong Zeng, Ka Leong Cheng 等
仅微调末三层ViT并采用HYBRID16,2B模型16帧达68.8%时序mIoU。
Jiameng Zhang, Srikanth Madikeri
HG-CRC以层级校准和Bonferroni控制群组风险;ARC上违规率0%、WGER=0。
Murilo Salem, Luísa Böhm, Daniel Pontes 等
FlowCTS以连续轨迹监督替代KL-OPD,GenEval达0.93、OCR达0.92、PickScore达23.06。
Kaiyang Ye, Yuan Ge, Junxiang Zhang 等