Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models
Qwen-Audio通过多任务训练和层级标签解决干扰问题,支持30+任务,超越现有模型。
Yunfei Chu, Jin Xu, Xiaohuan Zhou 等
Qwen-Audio通过多任务训练和层级标签解决干扰问题,支持30+任务,超越现有模型。
Yunfei Chu, Jin Xu, Xiaohuan Zhou 等
AMBER: 无需LLM的多维基准测试评估MLLM幻觉,提升可靠性。
Junyang Wang, Yuhang Wang, Guohai Xu 等
LLMs在机器人领域的应用综述,提升了控制、感知和决策能力。
Fanlong Zeng, Wensheng Gan, Zezheng Huai 等
提出上下文一致性训练,解决训练测试中SiMT模型上下文使用不匹配问题,提升BLEU和延迟性能。
Meizhi Zhong, Lemao Liu, Kehai Chen 等
提出FLAMES基准,评估17个主流中文LLM的价值对齐,表现普遍较差。
Kexin Huang, Xiangyang Liu, Qianyu Guo 等
通过微调移除GPT-4的RLHF保护,成功率达95%,仅需340个例子。
Qiusi Zhan, Richard Fang, Rohan Bindu 等
基于GPT-4V(ision)的视觉-语言模型在自动驾驶中的场景理解与推理表现优越。
Licheng Wen, Xuemeng Yang, Daocheng Fu 等
提出RETROFIT-CQs,利用大语言模型从现有本体中自动提取可用的能力问题,提升本体重用性。
Reham Alharbi, Valentina Tamma, Floriana Grasso 等
本研究提出LRM,一种基于变换器的超大规模单图3D重建模型,训练数据涵盖约100万对象,能在5秒内生成高质量3D模型。
Yicong Hong, Kai Zhang, Jiuxiang Gu 等
提出LRP2模块,显著提高多语言模型的事实知识检索准确率。
Shaoyang Xu, Junzhuo Li, Deyi Xiong
提出DARE方法,无需再训练即可融合同源模型参数,提升大规模语言模型能力。
Le Yu, Bowen Yu, Haiyang Yu 等
AnyText采用扩散模型实现多语言视觉文本生成与编辑,训练用3M图像-文本对,显著优于现有方法。
Yuxiang Tuo, Wangmeng Xiang, Jun-Yan He 等
提出一种无示范的分层规划方法,通过EMD空间规划实现零样本可变形物体操作。
Yang You, Bokui Shen, Congyue Deng 等
GPT-4V模型在多模态异常检测中表现出色,尤其在零/一拍场景中。
Yunkang Cao, Xiaohao Xu, Chen Sun 等
提出FETV基准,基于多维类别和时序信息对开源T2V模型进行细粒度评估,揭示自动指标与人类评价偏差。
Yuanxin Liu, Lei Li, Shuhuai Ren 等
提出了一种基于最大均值差异的变量选择方法,提升了分布比较的解释性。
Kensuke Mitsuzawa, Motonobu Kanagawa, Stefano Bortoli 等
RoboGen利用生成模型自动生成多样任务和场景,提升机器人技能学习效率。
Yufei Wang, Zhou Xian, Feng Chen 等
RoboFlamingo利用预训练VLM实现机器人操控,显著优于SOTA,成功率达96.4%。
Xinghang Li, Minghuan Liu, Hanbo Zhang 等
Copilot4D用VQVAE与离散扩散预测点云,1秒和3秒Chamfer距离分别降低超65%和超50%。
Lunjun Zhang, Yuwen Xiong, Ze Yang 等
nvblox利用GPU加速增量式签名距离场(ESDF)计算,提升表面重建177倍,距离场计算31倍,显著改善机器人路径规划性能。
Alexander Millane, Helen Oleynikova, Emilie Wirbel 等