InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning
InfiMed采用反思增强的SFT和RLVR,提升低资源医学多模态模型性能,达7项基准SOTA。
Zeyu Liu, Zhitian Hou, Guanghao Zhu 等
InfiMed采用反思增强的SFT和RLVR,提升低资源医学多模态模型性能,达7项基准SOTA。
Zeyu Liu, Zhitian Hou, Guanghao Zhu 等
WorkForceAgent-R1通过R1风格的强化学习提升LLM在网页导航中的推理能力,性能提升10.26-16.59%。
Yuchen Zhuang, Di Jin, Jiaao Chen 等
提出WebDancer,基于ReAct的端到端自主信息搜索模型,显著提升在GAIA和WebWalkerQA的表现。
Jialong Wu, Baixuan Li, Runnan Fang 等
提出正交和方差损失提升MoE专家专精,性能提升23.79%。
Hongcan Guo, Haolang Lu, Guoshun Nan 等
BioHopR是基于PrimeKG的多跳、多答案生物医学知识图谱问答基准,评估模型推理能力。
Yunsoo Kim, Yusuf Abdulle, Honghan Wu
本研究评估LLMs在医学文本摘要中的表现,强调词汇适应对高OOV场景的提升。
Gunjan Balde, Soumyadeep Roy, Mainack Mondal 等
提出基于logit的集成方法,匹配人类对LLM一致性的评估。
Xiaoyuan Wu, Weiran Lin, Omer Akgul 等
提出动态调度的多智能体协作框架“puppeteer”,通过强化学习优化代理序列,提升性能与效率。
Yufan Dang, Chen Qian, Xueheng Luo 等
强化微调提升多模态大语言模型推理能力,显著提高OpenAI-o1和DeepSeek-R1性能。
Haoyuan Sun, Jiaqi Wu, Bo Xia 等
提出TriSense多模态大模型,结合视觉、音频、语音实现视频时序理解,利用自适应查询连接器提升鲁棒性。
Zinuo Li, Xian Zhang, Yongxin Guo 等
AlignXplore模型通过行为信号推断个性化偏好,提升15.49%的性能。
Jia-Nan Li, Jian Guan, Wei Wu 等
提出QwenLong-L1,通过渐进式上下文扩展和强化学习实现长文本推理,超越现有模型。
Fanqi Wan, Weizhou Shen, Shengyi Liao 等
提出Agent Distillation,将LLM代理行为迁移到小模型,结合检索与代码工具,显著提升模型性能。
Minki Kang, Jongwon Jeong, Seanie Lee 等
ToDi通过动态结合FKL与RKL实现逐词细粒度知识蒸馏,显著提升LLM性能。
Seongryong Jung, Suwan Yoon, DongGeon Kim 等
IRONIC框架通过多模态连贯关系实现零样本讽刺检测,取得了最先进的性能。
Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee
提出GUI-G1,结合改进的RL策略和奖励设计,在17K样本上实现90.3%的准确率,超越同规模模型。
Yuqi Zhou, Sunhao Dai, Shuai Wang 等
Soft Thinking通过连续概念空间提升LLMs推理能力,准确率提升2.48%,节省22.4% tokens。
Zhen Zhang, Xuehai He, Weixiang Yan 等
Hunyuan-TurboS结合Mamba-Transformer,采用自适应链式推理,参数560B,性能优异。
Tencent Hunyuan Team, Ao Liu, Botong Zhou 等
BanglaByT5是首个专为孟加拉语设计的字节级模型,优于多语言模型。
Pramit Bhattacharyya, Arnab Bhattacharya
利用PMP方法在澳大利亚和印度英语中实现可解释的讽刺检测,显著提高性能。
Ishmanbir Singh, Dipankar Srirag, Aditya Joshi