TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
提出TTF-VLA,通过像素差异和注意力机制实现无训练的时序特征融合,提升机器人操控任务性能。
Chenghao Liu, Jiachen Zhang, Chengxuan Li 等
提出TTF-VLA,通过像素差异和注意力机制实现无训练的时序特征融合,提升机器人操控任务性能。
Chenghao Liu, Jiachen Zhang, Chengxuan Li 等
CHORD框架通过动态加权结合SFT和RL,提升LLMs性能。
Wenhao Zhang, Yuexiang Xie, Yuchang Sun 等
提出基于离散时间线性因果模型的潜在子过程识别方法,适用于复杂网络中的Hawkes过程。
Songyao Jin, Biwei Huang
提出了锥形Gromov-Wasserstein距离(CGW),用于不平衡度量网络和超网络的比较,具有鲁棒性和可扩展性。
Mary Chriselda Antony Oliver, Emmanuel Hartman, Tom Needham
TexVerse提供1.6M高分辨率3D模型,填补纹理生成数据集空白。
Yibo Zhang, Li Zhang, Rui Ma 等
UI-Venus通过RFT在UI定位和导航任务上取得SOTA表现。
Zhangxuan Gu, Zhengwen Zeng, Zhenyu Xu 等
综述以三维分类统一解析Memory-Augmented Transformers,但未报告新的数据集或量化基准。
Parsa Omidi, Xingshuai Huang, Axel Laborieux 等
提出Pass@k训练方法,利用分析导出优势函数,有效提升大模型探索能力,实验显示优于传统Pass@1训练。
Zhipeng Chen, Xiaobo Qin, Youbin Wu 等
STEP方法通过课程学习提升对话推荐的语义融合和精度。
Zhenye Yang, Jinpeng Chen, Huan Li 等
提出Πnet,通过正交投影层确保神经网络满足凸约束,训练速度快,效果优异。
Panagiotis D. Grontas, Antonio Terpin, Efe C. Balta 等
通过外部工具提升多模态LLM性能,分析四个关键维度。
Wenbin An, Jiahao Nie, Yaqiang Wu 等
提出ProxyRL-FRS,结合ProxyNCF和强化学习优化客户端选择,提升推荐模型性能。
Liang Qu, Jianxin Li, Wei Yuan 等
采用Mistral 7B和mT5模型,创新性地提升捷克语现代与历史文本摘要性能,建立新基准。
Václav Tran, Jakub Šmíd, Jiří Martínek 等
Echo-4o利用GPT-4o合成图像提升图像生成,显著提高多基准性能。
Junyan Ye, Dongzhi Jiang, Zihao Wang 等
提出Noise Hypernetwork,利用奖励偏置噪声调制,减少测试时优化成本,提升扩散模型生成质量。
Luca Eyring, Shyamgopal Karthik, Alexey Dosovitskiy 等
提出STREAM标准,增强ChemBio模型评估报告的透明度,包含23位专家意见。
Tegan McCaslin, Jide Alaga, Samira Nedungadi 等
提出条件扩散模型的非渐近收敛界,结合预训练模型实现精确条件分布逼近。
Mengze Li
提出M3-Agent框架,结合长时记忆实现多模态环境理解,性能优于基线模型。
Lin Long, Yichen He, Wentao Ye 等
CitySeg通过局部-全局交叉注意力网络和层次分类策略,实现城市级点云的开放词汇语义分割和零样本推理。
Jialei Xu, Zizhuang Wei, Weikang You 等
OpenCUA通过跨OS数据采集和反思长链推理,提升CUA性能,成功实现45%成功率。
Xinyuan Wang, Bowen Wang, Dunjie Lu 等