Paxion: Patching Action Knowledge in Video-Language Foundation Models
Paxion通过DVDM目标提升视频语言模型的动作知识理解能力,从50%提高到80%。
Zhenhailong Wang, Ansel Blume, Sha Li 等
Paxion通过DVDM目标提升视频语言模型的动作知识理解能力,从50%提高到80%。
Zhenhailong Wang, Ansel Blume, Sha Li 等
通过平滑损失景观,使用在线SGD实现单指标模型的最优样本复杂度,达到d^{k^*/2}。
Alex Damian, Eshaan Nichani, Rong Ge 等
利用大规模语言模型(LLMs)通过上下文学习(ICL)实现无知识的时间知识图预测,性能媲美SOTA模型。
Dong-Ho Lee, Kian Ahrabian, Woojeong Jin 等
提出PYoCo噪声先验,微调预训练图像扩散模型实现高质量视频生成,性能优于SOTA。
Songwei Ge, Seungjun Nah, Guilin Liu 等
提出DoReMi,通过小模型优化数据域重加权,加速大规模语言模型预训练。
Sang Michael Xie, Hieu Pham, Xuanyi Dong 等
提出基于Jacobi和Gauss-Seidel的并行解码算法,实现Transformer翻译推理速度提升38%,无需模型修改。
Andrea Santilli, Silvio Severino, Emilian Postolache 等
SLiC-HF通过人类反馈校准序列似然性,在TL;DR任务上提升性能。
Yao Zhao, Rishabh Joshi, Tianqi Liu 等
PMC-VQA采用视觉指令调优,构建超大规模医疗VQA数据集,显著提升生成答案的准确性。
Xiaoman Zhang, Chaoyi Wu, Ziheng Zhao 等
PaLM 2以混合目标、计算最优缩放和多语数据,在更小规模上提升推理与翻译表现。
Rohan Anil, Andrew M. Dai, Orhan Firat 等
提出KVQ空间中的意图模型,利用最小二乘解实现高效近似,复杂度与注意力相同。
Marta Garnelo, Wojciech Marian Czarnecki
提出SpecInfer,利用树状推测推理与验证显著加速大规模生成式语言模型服务。
Xupeng Miao, Gabriele Oliaro, Zhihao Zhang 等
OpenVR用Unity+Quest 2远程操控Panda,硬件36.2Hz、仿真71.3Hz。
Abraham George, Alison Bartsch, Amir Barati Farimani
提出SceneGrasp,结合深度学习实现实时多物体3D重建、6DoF姿态估计与密集抓取预测。
Shubham Agrawal, Nikhil Chavan-Dafle, Isaac Kasahara 等
C-Eval评估中国基础模型的多学科多层次能力,GPT-4表现优异。
Yuzhen Huang, Yuzhuo Bai, Zhihao Zhu 等
政治罗盘探测与受控续训显示:偏见从语料经RoBERTa传至仇恨言论和虚假信息任务。
Shangbin Feng, Chan Young Park, Yuhan Liu 等
ULIP-2利用大模型自动生成3D形状描述,实现无标注大规模多模态预训练,提升零-shot分类性能。
Le Xue, Ning Yu, Shu Zhang 等
提出BBT-RGB,结合两阶段无梯度优化、多重Verbalizer和指令搜索,提升黑箱调优性能。
Qiushi Sun, Chengcheng Han, Nuo Chen 等
提出TinyStories数据集,训练参数低于1000万的小模型仍能生成连贯故事,采用GPT-4评分多维能力。
Ronen Eldan, Yuanzhi Li
提出MMG-Ego4D,结合视频、音频、IMU,解决模态缺失和跨模态零样本识别,提升少样本泛化能力。
Xinyu Gong, Sreyas Mohan, Naina Dhingra 等
结合GNC与自适应鲁棒损失函数,解决非线性最小二乘中的鲁棒性与初始化敏感问题。
Kyungmin Jung, Thomas Hitchcox, James Richard Forbes