Counterfactual Density Estimation using Kernel Stein Discrepancies
提出双重鲁棒核Stein距离估计器,用于模型未归一化密度的反事实分布估计。
Diego Martinez-Taboada, Edward H. Kennedy
提出双重鲁棒核Stein距离估计器,用于模型未归一化密度的反事实分布估计。
Diego Martinez-Taboada, Edward H. Kennedy
系统分析激活补丁方法的指标与技术,强调STR、对数差异和滑动窗口的优劣。
Fred Zhang, Neel Nanda
引入RBRP算法,提供快速、准确的自适应插值分解。
Yijun Dong, Chao Chen, Per-Gunnar Martinsson 等
Show-1结合像素和潜在扩散模型,实现高效文本到视频生成,GPU内存仅15G。
David Junhao Zhang, Jay Zhangjie Wu, Jia-Wei Liu 等
提出基于基准数据学习“路由器”模型,有效提升多任务LLM选择性能,实验在29个数据集上实现显著改进。
Tal Shnitzer, Anthony Ou, Mírian Silva 等
PolarNet利用3D点云与多模态Transformer实现基于自然语言的机器人操作,显著优于2D方法。
Shizhe Chen, Ricardo Garcia, Cordelia Schmid 等
Ragas框架通过无参考指标评估RAG系统的保真性、相关性和上下文焦点。
Shahul Es, Jithin James, Luis Espinosa-Anke 等
RankVicuna为开源7B模型,实现零样本列表式文档重排序,效果媲美GPT-3.5。
Ronak Pradeep, Sahel Sharifymoghaddam, Jimmy Lin
LogGPT采用GPT模型进行日志异常检测,通过预训练与强化学习显著优于SOTA方法。
Xiao Han, Shuhan Yuan, Mohamed Trabelsi
提出SPIRT架构,利用RedisAI实现P2P无服务器容错训练,模型更新时间降低82%。
Amine Barrak, Mayssa Jaziri, Ranim Trabelsi 等
本研究比较三种机器人控制架构(CPG、ANN、DRL)结合不同学习机制(RevDE、PPO),发现ANN+RevDE表现最佳。
Jie Luo, Jakub Tomczak, Karine Miras 等
本文提出多模态学习在某些任务中能指数级超越单模态,基于两半空间交集问题的构造。
Zhou Lu
本研究评估了GPT-3.5、LLaMA-2-13b-chat和Claude-2在孟加拉语多任务零-shot性能,发现大部分任务表现不佳。
Mohsinul Kabir, Mohammed Saidul Islam, Md Tahmid Rahman Laskar 等
GELLO利用低成本3D打印结构实现机器人操控的直观远程,提升示范效率。
Philipp Wu, Yide Shentu, Zhongke Yi 等
提出基于元启发式的神经网络模型,用于移动应用能耗预测,能处理缺失值,优化超参数。
Seyed Jalaleddin Mousavirad, Luís A. Alexandre
提出多模态学习理论,证明其在样本复杂度上优于单模态,提升界限至O(√n)。
Zhou Lu
TinyCLIP通过 affinity mimicking 和 weight inheritance,将CLIP模型压缩50%,保持性能。
Kan Wu, Houwen Peng, Zhenghong Zhou 等
LLMs在训练“A是B”时无法自动学习“B是A”,即使在GPT-4中也存在此问题。
Lukas Berglund, Meg Tong, Max Kaufmann 等
MetaMath通过自举数学问题提升LLMs数学推理能力,MetaMath-7B在GSM8K上达66.4%。
Longhui Yu, Weisen Jiang, Han Shi 等
SALSA-CLRS扩展CLRS基准,提升算法推理的可扩展性和稀疏性。
Julian Minder, Florian Grötschla, Joël Mathys 等