WithAnyone: Towards Controllable and ID Consistent Image Generation
WithAnyone模型通过对比损失和MultiID-2M数据集实现可控且身份一致的图像生成。
Hengyuan Xu, Wei Cheng, Peng Xing 等
WithAnyone模型通过对比损失和MultiID-2M数据集实现可控且身份一致的图像生成。
Hengyuan Xu, Wei Cheng, Peng Xing 等
ToolPRM通过细粒度内部调用决策评分,提升结构化函数调用的推理性能。
Jianghao Lin, Yuanyuan Shi, Xin Peng 等
xLLM通过解耦架构优化调度与算法,显著提升大模型推理性能与资源利用。
Tongxuan Liu, Tao Peng, Peijun Yang 等
提出AEPO算法,通过动态平衡探索和梯度调控,提升多轮Web代理的训练稳定性和性能。
Guanting Dong, Licheng Bao, Zhongyuan Wang 等
SHaRe-SSM模型在超长序列中表现优异,能效提升52.1倍。
Kartikay Agrawal, Abhijeet Vikram, Vedant Sharma 等
提出生成式通用验证器,基于ViVerBench,提升视觉验证能力8.3点。
Xinchen Zhang, Xiaoying Zhang, Youbin Wu 等
提出基于激活的置信度估计方法,提升LLM在金融等高风险场景的可信性,准确率达95%。
Zhiqi Huang, Vivek Datla, Chenyang Zhu 等
采用FusionNet、SG-LLIE等多模型融合,提升低光图像质量,最高PSNR达26.35。
Xiaoning Liu, Zongwei Wu, Florin-Alexandru Vasluianu 等
LIBERO-Plus通过系统性扰动分析VLA模型的鲁棒性,性能在摄像头视角等变化下从95%降至30%。
Senyu Fei, Siyin Wang, Junhao Shi 等
本文提出Mask-GRPO,将强化学习引入Masked生成模型,显著提升文本到图像生成性能,基于Show-o模型在标准基准上取得优异表现。
Yifu Luo, Xinhao Hu, Keyu Fan 等
DepthVLA通过预训练深度模块增强空间推理,显著提升机器人操控性能。
Tianyuan Yuan, Yicheng Liu, Chenhao Lu 等
使用超网络和适配器的架构,减少参数量,提升仇恨言论检测的视角适应性。
Daniil Ignatev, Denis Paperno, Massimo Poesio
本研究提出模型在辩论中更倾向于支持与自身信念一致的立场,采用序贯与同步两种协议,结果显示模型在偏好一致时更具说服力。
María Victoria Carro, Denise Alejandra Mester, Facundo Nieto 等
EgoSocial利用多模态数据检测社交干预时机,提升OLMM的表现(干预时机准确率提升45.6%)
Xijun Wang, Tanay Sharma, Achin Kulshrestha 等
ExtremBench基准测试揭示LLM在极值问题求解中的差距。
Binxin Gao, Jingjun Han
DriveVLA-W0通过世界建模预测未来图像,利用密集自监督信号显著提升自主驾驶模型的规模化性能,验证在大规模数据集上表现优异。
Yingyan Li, Shuyao Shang, Weisong Liu 等
AnyUp是一种通用特征上采样方法,无需重训练,可适应任何视觉特征,性能领先。
Thomas Wimmer, Prune Truong, Marie-Julie Rakotosaona 等
提出Omni-Detective数据管线和Omni-Captioner模型,提升多模态细粒度感知能力。
Ziyang Ma, Ruiyang Xu, Zhenghao Xing 等
提出Bellman-Wasserstein距离(BWD),用于评估离线RL数据集质量,显著提高预测精度。
Arip Asadulaev, Fakhri Karray, Martin Takac
ReRe利用RLVR优化推荐,结合约束束搜索与奖励增强,显著提升排名性能。
Junfei Tan, Yuxin Chen, An Zhang 等