LatentPress: Context Compression Beyond Text and Vision
LatentPress通过连续记忆标记实现4-16倍压缩,无需文本重建,提升长文和对话理解效率。
Zhengze Zhou, Hejian Sang
LatentPress通过连续记忆标记实现4-16倍压缩,无需文本重建,提升长文和对话理解效率。
Zhengze Zhou, Hejian Sang
CameraEditor通过视频扩散模型实现相机参数控制,提升几何精度。
Xin Shen, Chengyou Jia, Keshuo Xing 等
通过ParcelStow平台,比较专家与模仿学习策略在不同执行速度下的成功率,发现模仿学习在速度变化时性能下降明显。
Clinton Enwerem, John S. Baras, Calin Belta
HarnessDev评估LLM创建和改进执行基础设施的能力,显示在写作和机器学习实验中表现优于人类参考。
Yuhao Wu, Jingyuan Zhang, Jiajun Shi 等
EdiTikZ通过DaEdiTikZ数据集和强化学习实现科学图表编辑,9B模型超越GPT-5.6-Sol。
Christian Greisinger, Zhixue Zhao, Steffen Eger
提出DroneCATS-Agent,基于多模态大语言模型实现无人机自主控制,涵盖命令、追踪、搜索,验证模型在四项核心能力中的表现。
Jaewoo Park, Minyoung Lee, Sukmin Seo 等
扩展Rao-Blackwell化在线POMDP框架,结合混合连续离散信念表示,提升高维环境下的决策效率。
Jiho Lee, Nisar Ahmed, Kyle Hollins Wray 等
RTGL是一种声明式语言,简化关系深度学习任务生成,解决SQL手工定义的时间泄漏问题。
Oleksii Kolesnichenko, Jakub Peleška, Gustav Šír
通过基础图像模型的单一提示实现水印清洗,显著降低了水印的可靠性。
Jidong Yang, Qi Li, Wei Zong 等
通过PRIS规则,快速筛选晶体结构,检测率达87.9%。
Zhilong Song, Lixue Cheng
PersuaRL通过强化学习驱动的多专家选择框架,在保险对话生成中实现了显著的说服力提升。
Rohan Kirti, Akash Ghosh, Aryan Vats 等
TFMat通过文本引导流匹配提高晶体生成效率,在MP-20上达到92.04%的匹配率。
Wentao Li
提出Phrase-Localized LCG,无需训练即可实现代码切换TTS的本地化口音控制。
Che Hyun Lee, Sangkwon Park, Donghun Kang 等
FigTree通过递归SVG程序生成科学图表,显著提升编辑性和质量。
Yepeng Liu, Dasen Dai, Chengzhi Liu 等
提出披露门控机制,基于五级门控层次提升用户模拟的真实性,确保排名稳定。
Yao Liu, Yu He
SciGram框架生成1.4M视觉指令,提升科学图解理解性能,超越SOTA。
Raul Ortega, José Manuel Gómez-Pérez
HELIOS通过无监督数据集实现城市场景昼夜光照转换,提升结构一致性。
Hala Djeghim, Nathan Piasco, Luis Roldão 等
提出一种基于相位频谱的攻击框架,在多模态大语言模型上实现了90%以上的攻击成功率。
Daizong Liu, Junhao Dong, Zhiyuan Ma 等
FCCA方法在低资源LLM适配中表现出色,Qwen2.5-3B上超越其他方法2.3分。
Wentao Ye, Zhanming Shen, Zhiqing Xiao 等
引入深度算子网络(DeepONet)结合生成对抗网络(GAN)实现高分辨率降水预报,提升长时预测的稳定性与物理一致性。
Mohammad Kian Golkar, Luciano Alves de Oliveira, Mohammad Khanjani