Tokenisation via Convex Relaxations
ConvexTok uses convex relaxations to optimize tokenisation, achieving near-optimal compression within 1% at 128k vocabulary, improving BpB significantly.
Jan Tempus, Philip Whittington, Craig W. Schmidt et al.
ConvexTok uses convex relaxations to optimize tokenisation, achieving near-optimal compression within 1% at 128k vocabulary, improving BpB significantly.
Jan Tempus, Philip Whittington, Craig W. Schmidt et al.
Proposed DeltaDirect with MoDirect dataset boosts motion direction accuracy from 25.9% to 85.4% on synthetic domain.
Jongseo Lee, Hyuntak Lee, Sunghun Kim et al.
MotiMotion integrates VLM-based reasoning and confidence-aware control for motion-controlled video generation, outperforming baselines on MotiBench.
Lee Hsin-Ying, Hanwen Jiang, Yiqun Mei et al.
Vector Policy Optimization (VPO) trains diverse policies to improve test-time search, achieving over 20% gains on best@k metrics across multiple tasks.
Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld et al.
AwareVLN introduces self-aware reasoning for VLN, achieving NE 4.02 on R2R-CE Val-Unseen, outperforming prior SOTA.
Wenxuan Guo, Xiuwei Xu, Yichen Liu et al.
Introduces curiosity-driven 3D exploration using persistent 3D Gaussian Splatting world model and Transformer policy, achieving 74.94% 3D coverage on HM3D.
Lily Goli, Justin Kerr, Daniele Reda et al.
GesVLA integrates gesture into Vision-Language-Action models, achieving 94.3% target grounding accuracy in complex real-world tasks.
Wenxuan Guo, Ziyuan Li, Meng Zhang et al.
The Matching Principle unifies nuisance-robust learning by estimating deployment nuisance covariance and regularizing encoder Jacobian accordingly; validated on 7B-parameter Qwen2.5-7B.
Vishal Rajput
Proposes KDE-gradient conservative drifting with finite-particle convergence rates up to N^{-(2-β)/(2(d+4-β))}
Krishnakumar Balasubramanian
MOSS enables source-level self-rewriting in autonomous agents, boosting OpenClaw’s four-task mean grader score from 0.25 to 0.61 in one cycle.
Qianshu Cai, Yonggang Zhang, Xianzhang Jia et al.
LCGuard uses adversarially learned transformations on Transformer KV caches to reduce sensitive information reconstruction in multi-agent systems while preserving task performance.
Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas et al.
Evaluated six commercial AI chatbots on 2,100 BBC news questions across six languages, achieving up to 95.6% accuracy on emerging facts.
Mirac Suzgun, Emily Shen, Federico Bianchi et al.
DeltaBox achieves millisecond-level incremental checkpoint/rollback for AI agents via DeltaFS and DeltaCR; 14ms checkpoint and 5ms rollback on SWE-bench.
Yunpeng Dong, Jingkai He, Yuze Hou et al.
DecQ introduces detail-condensing queries to RAEs, boosting reconstruction PSNR to 22.76dB and reducing generation FID to 1.41 with only 3.9% extra computation.
Tianhang Wang, Yitong Chen, Wei Song et al.
6B-parameter LLMs pretrained sequentially on Common Crawl show 15% F1 improvement on KairosQA for temporal knowledge over shuffled baselines.
Pilchen Hippolyte, Fabre Romain, Signe Talla Franck et al.
StructuredSemanticSearch improves model discovery via structured table retrieval, boosting nugget coverage on 597 queries
Zhengyuan Dong, Renée J. Miller
League-based multi-agent RL achieves 22 m/s quadrotor racing with 50% collision reduction vs. single-agent baselines.
Ismail Geles, Leonard Bauersfeld, Markus Wulfmeier et al.
WorldKV enables efficient world memory via KV cache retrieval and compression, doubling throughput while maintaining revisit fidelity.
Jung Yi, Minjae Kim, Paul Hyunbin Cho et al.
AnyMo proposes geometry-aware setup-agnostic human motion modeling, achieving 11.7% zero-shot recognition and 28.6% cross-modal retrieval MRR improvements.
Baiyu Chen, Zechen Li, Wilson Wongso et al.
TriSweep: a four-drone swarm framework achieves key rank 18±1.7 at 0.25m for masked AES-128 EM side-channel analysis.
Eric Yocam, Varghese Vaidyan