cs.CV 2409.02389

Multi-modal Situated Reasoning in 3D Scenes

Introduced MSQA, a large-scale multi-modal dataset with 251K QA pairs, leveraging 3D scene graphs and interleaved inputs for improved scene reasoning.

Xiongkun Linghu, Jiangyong Huang, Xuesong Niu et al.

2024-09-04 40
cs.CL 2409.02060

OLMoE: Open Mixture-of-Experts Language Models

OLMoE uses sparse Mixture-of-Experts, activating only 1B of 7B parameters, outperforming larger models.

Niklas Muennighoff, Luca Soldaini, Dirk Groeneveld et al.

2024-09-04 20
cs.FL 2409.01079

Attractor Basins in Concurrent Systems

Proposed algorithm identifies and analyzes attractor basins in concurrent systems using safe Petri nets framework.

Giann Karlo Aguirre Samboni, Stefan Haar, Loic Paulevé et al.

2024-09-02 5
cs.LG 2409.00920

ToolACE: Winning the Points of LLM Function Calling

ToolACE employs self-evolution synthesis of 26,507 APIs, enabling high-performance function calling with only 8B parameters, rivaling GPT-4.

Weiwen Liu, Xu Huang, Xingshan Zeng et al.

2024-09-02 45
cs.CL 2409.00608

TinyAgent: Function Calling at the Edge

TinyAgent fine-tunes small open-source LLMs with high-quality datasets, surpassing GPT-4-Turbo in function calling, deploying efficiently on edge devices with tool retrieval and quantization.

Lutfi Eren Erdogan, Nicholas Lee, Siddharth Jha et al.

2024-09-01 59 citations 33