Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models
本研究提出推理缩放定律,发现较小模型结合高效推理策略在成本与性能上具有Pareto最优。
Yangzhen Wu, Zhiqing Sun, Shanda Li 等
本研究提出推理缩放定律,发现较小模型结合高效推理策略在成本与性能上具有Pareto最优。
Yangzhen Wu, Zhiqing Sun, Shanda Li 等
SAM 2结合流式记忆实现图像与视频的高效提示式分割,性能提升显著。
Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu 等
提出MotionFix数据集和TMED模型,实现基于文本的3D人类运动编辑,利用条件扩散模型提升编辑精度。
Nikos Athanasiou, Alpár Cseke, Markos Diomataris 等
DiscipLink利用大语言模型(LLMs)支持跨学科信息探索,自动生成探索性问题并扩展查询。
Chengbo Zheng, Yuanhao Zhang, Zeyu Huang 等
RFNet+RFFT提升广告图可用率,构建RF1M超百万标注数据
Zhenbang Du, Wei Feng, Haohan Wang 等
OmniParser显著提升GPT-4V在ScreenSpot基准上的表现,使用纯视觉解析UI截图。
Yadong Lu, Jianwei Yang, Yelong Shen 等
通过负注意力分数对齐方法,减少大型语言模型中的负偏差,提升准确率和召回率。
Sangwon Yu, Jongyoon Song, Bongkyu Hwang 等
通过重复采样提升推理覆盖率,模型在多任务中样本数增加至250倍,覆盖率从15.9%升至56%。
Bradley Brown, Jordan Juravsky, Ryan Ehrlich 等
Llama 3采用大规模Transformer,405B参数,支持多模态,性能媲美GPT-4。
Aaron Grattafiori, Abhimanyu Dubey, Abhinav Jauhri 等
MoMa采用模态感知专家混合架构,训练1.4B参数模型实现3.7×FLOPs节省。
Xi Victoria Lin, Akshat Shrivastava, Liang Luo 等
提出基于模型引导的离散扩散校正器,提升采样效率与样本质量。
Yixiu Zhao, Jiaxin Shi, Feng Chen 等
GradCraft通过动态梯度幅值调整和全局方向投影,提升多任务推荐模型的梯度平衡与性能。
Yimeng Bai, Yang Zhang, Fuli Feng 等
提出Meta-Reward机制,利用模型自评自我提升,显著改善Llama-3-8B-Instruct在指令遵循和判断能力上的表现。
Tianhao Wu, Weizhe Yuan, Olga Golovneva 等
提出基于显式生成模型的鲁棒快速适应方法,利用Stackelberg博弈增强任务分布的鲁棒性。
Cheems Wang, Yiqin Lv, Yixiu Mao 等
提出ctPuLSE,结合近讲语音增强与伪标签,提升远场语音增强的泛化能力。
Zhong-Qiu Wang
SETO通过子序列临时操作丰富样本,有效解决数据稀疏问题。
Shu Chen, Jinwei Luo, Weike Pan 等
Nerva利用稀疏矩阵操作实现高效神经网络训练,显著降低时间和内存消耗。
Wieger Wesselink, Bram Grooten, Qiao Xiao 等
提出层次化提示技术,自动生成复杂硬件模块,显著提升LLM设计能力。
Andre Nakkab, Sai Qian Zhang, Ramesh Karri 等
本研究比较RAG与长上下文LLMs,提出Self-Route实现成本优化,性能接近长上下文模型。
Zhuowan Li, Cheng Li, Mingyang Zhang 等
C3T方法在无监督模态适应中提升至少8%的准确率。
Abhi Kamboj, Anh Duy Nguyen, Minh N. Do