$π_0$: A Vision-Language-Action Flow Model for General Robot Control
基于预训练视觉-语言模型的流匹配架构,实现多机器人多任务的零样本控制。
Kevin Black, Noah Brown, Danny Driess 等
基于预训练视觉-语言模型的流匹配架构,实现多机器人多任务的零样本控制。
Kevin Black, Noah Brown, Danny Driess 等
Sparsh利用自监督学习在460k+触觉图像上预训练,提升TacBench上95.1%的性能。
Carolina Higuera, Akash Sharma, Chaithanya Krishna Bodduluri 等
IC-LoRA以20–100组样本和LoRA激活DiT的上下文生成能力,实现高保真多图生成。
Lianghua Huang, Wei Wang, Zhi-Fan Wu 等
SuctionPrompt结合视觉语言模型与3D检测,实现零样本多物体抓取,成功率达65%。
Tomohiro Motoda, Takahide Kitamura, Ryo Hanai 等
提出多模态检测(MM-Det)利用LMM生成多模态伪造表示,有效识别扩散模型生成视频。
Xiufeng Song, Xiao Guo, Jiache Zhang 等
基于心理学与人类学定义,调研文化意识在多模态大模型中的数据构建与评估方法。
Siddhesh Pawar, Junyeong Park, Jiho Jin 等
LCoDeepNEAT结合Lamarckian遗传算法,优化CNN架构和最后层权重,提升分类准确率。
Zaniar Sharifi, Khabat Soltanian, Ali Amiri
Senna结合LVLM与端到端模型,提升自主驾驶规划准确率27.12%,碰撞率降低33.33%。
Bo Jiang, Shaoyu Chen, Bencheng Liao 等
提出环境作为策略的自适应训练框架,实现无人机在未见轨迹上的鲁棒飞行。
Hongze Wang, Jiaxu Xing, Nico Messikommer 等
DynaMath通过动态生成问题评估视觉语言模型的数学推理能力,发现其在问题变体上的表现不稳定。
Chengke Zou, Xingang Guo, Rui Yang 等
提出基于物理导引的虚拟引导框架,支持盲低视力用户在社交VR中导航与互动。
Jazmin Collins, Crescentia Jung, Yeonju Jang 等
前沿AI安全案例研究,提出结构化论证方法,强调证据支持。
Marie Davidsen Buhl, Gaurav Sett, Leonie Koessler 等
Fed-POE算法结合本地与联邦模型,通过动态模型选择实现在线预测与微调,显著提升性能。
Pouya M. Ghari, Yanning Shen
利用谱带贪婪算法结合图傅里叶变换系数实现配电网实时监测。
Samuel Talkington, Rahul Gupta, Richard Asiamah 等
LARP采用全局查询的自回归视频编码,提升生成质量,FVD达57。
Hanyu Wang, Saksham Suri, Yixuan Ren 等
提出能量基扩散语言模型(EDLM),利用残差EBM提升文本生成质量,显著优于现有扩散模型,接近自回归模型困惑度。
Minkai Xu, Tomas Geffner, Karsten Kreis 等
提出支持18种语言的仓库级代码补全基准M2RC-EVAL,结合AST解析进行细粒度标注。
Jiaheng Liu, Ken Deng, Congnan Liu 等
CycleResearcher利用强化学习训练的开源模型,实现从文献综述到同行评审的全流程自动化,预测论文评分误差降低26.89%。
Yixuan Weng, Minjun Zhu, Guangsheng Bao 等
ProtoViT结合视觉Transformer实现可解释图像分类,性能优于现有原型模型。
Chiyu Ma, Jon Donnelly, Wenjun Liu 等
提出了Relaxed Recursive Transformers,通过层级LoRA实现有效参数共享,性能接近完整模型。
Sangmin Bae, Adam Fisch, Hrayr Harutyunyan 等