Towards Scalable Spatial Intelligence via 2D-to-3D Data Lifting
提出基于深度估计、相机校准的2D到3D数据提升方法,生成约200万场景,显著提升空间理解性能。
Xingyu Miao, Haoran Duan, Quanhao Qian 等
提出基于深度估计、相机校准的2D到3D数据提升方法,生成约200万场景,显著提升空间理解性能。
Xingyu Miao, Haoran Duan, Quanhao Qian 等
提出Prune&Comp,通过迭代剪枝与幅值补偿,零训练成本显著提升层剪模型性能。
Xinrui Chen, Hongxing Zhang, Fanyi Zeng 等
VERIRAG利用结构化方法检测科学摘要中的潜在方法学漏洞,提升F1至少19点。
Shubham Mohole, Hongjun Choi, Shusen Liu 等
Ultra3D利用VecSet和Part Attention实现高效高保真3D生成,速度提升6.7倍。
Yiwen Chen, Zhihao Li, Yikai Wang 等
流匹配(Flow Matching)在生物序列、分子和蛋白质生成中表现出高效稳定的生成能力。
Zihao Li, Zhichen Zeng, Xiao Lin 等
提出层级式记忆架构H-MEM,提升LLM代理长远推理效率,显著优于五个基线方法。
Haoran Sun, Shaoning Zeng
Structured decoding enables large language models (LLMs) to generate outputs in formats required by downstream systems, such as HTML or JSON. However, existing methods suffer from efficiency bottlenec
Ran Wang, Xiaoxuan Liu, Hao Ren 等
使用GRASP和IntPhys 2数据集评估多模态语言模型,发现视觉与语言信息整合不佳。
Mohamad Ballout, Serwan Jassim, Elia Bruni
提出一种确定性、模块化的框架,通过预编译策略守卫确保企业政策合规,应用于τ-bench航空领域。
Naama Zwerdling, David Boaz, Ella Rabinovich 等
利用EAST+CRNN在Aria眼镜数据中实现环境鲁棒的场景文本识别,CER从0.65降至0.48。
Joseph De Mathia, Carlos Francisco Moreno-García
提出GPAI模型评估的四阶段方法,强调内部外部效度与可复现性。
Patricia Paskov, Michael J. Byun, Kevin Wei 等
TorchAO是基于PyTorch的端到端模型优化框架,支持FP8、QAT、PTQ和稀疏技术,提升模型部署效率。
Andrew Or, Apurva Jain, Daniel Vega-Myhre 等
LAN2CB利用大语言模型将自然语言任务转化为机器人控制代码,显著降低人力成本。
Zhehui Huang, Guangyao Shi, Yuwei Wu 等
AutoMCP研究116个服务器,修复后生成成功率94.2%,工具数减少三分之一。
Meriem Mastouri, Emna Ksontini, Amine Barrak 等
提出GUI-G²,基于高斯奖励模型,将GUI定位从二值变为连续高斯分布,显著提升性能。
Fei Tang, Zhangxuan Gu, Zhengxi Lu 等
提出Inter-LLM算法结合多模态成本估算,实现大场景多目标采集任务的长远规划。
Ruochu Yang, Yu Zhou, Fumin Zhang 等
提出RankMixer,采用多头Token Mixing和稀疏MoE,实现模型参数提升100倍,MFU从4.5%升至45%,在工业推荐中表现优异。
Jie Zhu, Zhifang Fan, Xiaoxie Zhu 等
提出了一种结合稠密深度图的LiDAR-视觉里程计方法,在KITTI数据集上表现优异。
JunYing Huang, Ao Xu, DongSun Yong 等
SPAR利用多智能体架构结合RefChain和查询演化,显著提升学术检索F1达56%。
Xiaofeng Shi, Yuduo Li, Qian Kou 等
本研究揭示模型通过无关数据传递行为特征,提出“潜意识学习”现象,影响模型安全与调控。
Alex Cloud, Minh Le, James Chua 等