NExT-GPT: Any-to-Any Multimodal LLM
NExT-GPT通过多模态适配器和扩散解码器实现任意模态输入输出,参数调整仅需1%。
Shengqiong Wu, Hao Fei, Leigang Qu 等
NExT-GPT通过多模态适配器和扩散解码器实现任意模态输入输出,参数调整仅需1%。
Shengqiong Wu, Hao Fei, Leigang Qu 等
SignRound方法通过SignSGD优化LLM量化,2位精度提升6.91%-33.22%。
Wenhua Cheng, Weiwei Zhang, Haihao Shen 等
phi-1.5模型以1.3亿参数实现与5倍大模型相当的常识推理能力。
Yuanzhi Li, Sébastien Bubeck, Ronen Eldan 等
通过控制实验测量LLMs(GPT3和InstructGPT)对内容多样性的影响,发现InstructGPT显著降低内容多样性。
Vishakh Padmakumar, He He
提出空间复杂度为˜O(m² + n²)的流式半正定规划内点法,利用核技巧实现快速谱近似。
Zhao Song, Mingquan Ye, Lichen Zhang
提出3D隐式Transporter,实现时间一致的关键点检测,提升非刚性对象理解。
Chengliang Zhong, Yuhang Zheng, Yupeng Zheng 等
提出子空间约束随机Kaczmarz算法,加速低秩系统收敛,适用于结构或外部知识利用。
Jackie Lok, Elizaveta Rebrova
MADLAD-400是涵盖419语言的手工审核多语种单语数据集,结合多阶段过滤提升质量。
Sneha Kudugunta, Isaac Caswell, Biao Zhang 等
SayNav利用大语言模型在新环境中实现动态导航,成功率提高8%。
Abhinav Rajvanshi, Karan Sikka, Xiao Lin 等
ImageBind-LLM通过图像-文本对齐训练实现多模态指令调优,支持音频、3D点云和视频。
Jiaming Han, Renrui Zhang, Wenqi Shao 等
SyncDreamer利用多视角同步扩散模型,从单视图生成多视角一致的3D图像。
Yuan Liu, Cheng Lin, Zijiao Zeng 等
本研究通过SATA和SpikeSim平台,实测发现SNN能效提升远低于估算值,揭示硬件瓶颈。
Abhiroop Bhattacharjee, Ruokai Yin, Abhishek Moitra 等
EGIC结合OASIS-C与ORP,实现低比特率图像生成压缩,超越SOTA。
Nikolai Körber, Eduard Kromer, Andreas Siebert 等
提出CoALA框架,组织语言代理,提升推理和决策能力。
Theodore R. Sumers, Shunyu Yao, Karthik Narasimhan 等
提出轻量化EOAT结合演化策略实现高成功率的机器人乐高拼装与拆卸。
Ruixuan Liu, Yifan Sun, Changliu Liu
CIEM方法通过生成对比问答对来评估VLM幻觉问题,显著提高模型准确性。
Hongyu Hu, Jiyuan Zhang, Minyi Zhao 等
利用核方法分析Ermakov-Zolotukhin正交积分,推导误差公式,提升理论保证。
Ayoub Belhadji
提出Sequential Dexterity,通过正反向策略链优化提升长时序多自由度手部操作成功率。
Yuanpei Chen, Chen Wang, Li Fei-Fei 等
本文通过提示依赖角度分析模型去毒化方法,比较反向微调与强化学习的影响。
Daniel Scalena, Gabriele Sarti, Malvina Nissim 等
研究探讨对齐语言模型的对抗攻击,使用困惑度检测等方法防御。
Neel Jain, Avi Schwarzschild, Yuxin Wen 等