XTC: Head-Aware Sampling by Excluding Top Choices
XTC通过排除高概率选项提高生成多样性,Distinct-2提升15%,三元组重复减少47%。
Philipp Emanuel Weidmann, Allen Roush, Judah Goldfeder 等
XTC通过排除高概率选项提高生成多样性,Distinct-2提升15%,三元组重复减少47%。
Philipp Emanuel Weidmann, Allen Roush, Judah Goldfeder 等
提出Physical Agentic AI框架,通过LLM规划和确定性执行协调异构机器人团队,实验中将错误调度率从23%-29%降至0%。
Xinyuan Liu, Eren Sadikoglu, Riana Chatterjee 等
NOVA结合4F^2 VCT DRAM和双层NMP架构,提升LLM推理性能4.5倍。
In-Jun Jung, Jaeha Min, Joo-Young Kim
Kernel Token Contradiction (KTC) 提供了一种快速且高效的LLM声明不确定性量化方法,速度提升8.2倍。
Jérémie Dentan, Alexi Canesse, Mahammed El Sharkawy 等
研究量子状态的块编码转换,揭示了转换的基本限制。
Manaki Arihara, Mio Murao
DSSM-CRF在IEMOCAP上达到75.81% UA,解决对话情感识别中的跨说话者影响。
Guan-Hua Wen, Hou-Chiang Tseng, Kuan-Yu Chen
GAN-Diff结合预训练WGAN-GP特征与条件扩散U-Net,实现图像去噪和超分辨率提升,PSNR分别提高4.40dB和3.70dB。
Saif Ahmed, Asadullah Hil Galib, S. M. Riaz Rahman Antu 等
BehaviorWorldGen以BehaviorFlow闭环生成可控交互轨迹,提升稀有驾驶场景训练;文中未给出性能百分比。
Jiaqi Wang, Zhuo Zhang, Haining Guan 等
ARCHER利用傅里叶空间信息实现零样本蛋白质晶体姿态估计,误差5.0°。
Nhan D. Nguyen, Bao Pham
提出K-DCT模型加速DDPM采样,捕获自然图像非对角相关,提升生成质量。
Rui Xia, Ayan Das, Artem Artemev 等
Bulbul数据集支持多方言阿拉伯语语音识别,涵盖11个阿拉伯国家。
Ahmed Ashraf, Aisha Alansari, Fadel Al Abbas 等
GuardPaint通过推测解码框架在扩散过程中修复不安全内容,显著降低攻击成功率并保持图像质量。
Shreyash Dhoot, Paras Dhiman, Arsh Abbas Naqvi 等
GUI-Primitives基准测试揭示了视觉语言模型在GUI空间推理中的局限,最高准确率仅32%。
Md Abrar Jahin, Md Rizwan Parvez
使用LaBSE等编码器,研究维基百科多语言版本的宗教与科学概念的框架差异。
Hung-Hsuan Chen
DefaultShift方法量化加速文本到图像模型的语义默认偏移,减少10.3%-35.1%的人为偏移。
Xuanhua Yin, Chuanzhi Xu, Shunqi Mao 等
PowerSlider通过阶段异构性优化GPU频率,实现LLM在动态功率限制下的高效服务。
Yueying Li, Jiayang Chen, Yuanfan Chen 等
提出了一种用于稀疏数据分析的随机交替最小二乘算法,应用于果蝇连接组数据。
Lawrence K. Saul, Ningyuan Huang, Dennis Bollweg 等
提出OmniAssistBench,基于逆向工程构建多轮交互视频数据集,评估Omni-LLMs的多模态交互能力。
Xianyun Sun, Chaoyou Fu, Zhengye Zhang 等
提出只需一次线性求解的加速牛顿方法,达到O(1/k^3)收敛速率。
Nikita Doikov
VIALS基准评估生命科学视觉Artifact理解能力,模型准确率仅26.5%。
Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor 等