Capturing LLM Capabilities via Evidence-Calibrated Query Clustering

TL;DR

ECC algorithm calibrates semantic embeddings with model comparisons, improving LLM ranking by 17.64%.

cs.AI 🔴 Advanced 2026-05-17 28 views
Fangzhou Wu Sandeep Silwal Qiuyi Zhang
LLM evaluation query clustering capability modeling Bradley-Terry model posterior calibration

Key Findings

Methodology

ECC integrates semantic embeddings and limited model comparisons, parameterizes cluster capability profiles using the Bradley-Terry model, and introduces trainable soft responsibilities for flexible capability-aware clustering.

Key Results

  • ECC improves LLM ranking quality by 17.64% over human-labeled clustering and 18.02% over embedding-based baselines on datasets like MMLU and MATH.
  • In query routing, ECC enhances response quality by 16.6%, and in limited-budget model ranking, it improves ranking quality by 16.3%.
  • Qualitative analysis shows ECC separates queries with divergent capability needs and merges those with aligned needs effectively.

Significance

ECC addresses the misalignment between surface semantics and latent capability demands, providing a robust tool for capability-aware LLM evaluation in personalized and domain-specific applications.

Technical Contribution

ECC uniquely incorporates posterior model comparisons into clustering, introduces capability profiles parameterized by Bradley-Terry models, and models mixed capability demands through soft responsibilities.

Novelty

ECC innovatively combines semantic embeddings with posterior signals, overcoming the limitations of traditional clustering methods in capturing latent capability requirements.

Limitations

  • ECC relies on limited model comparison data, which may constrain performance in data-scarce scenarios.
  • High dependency on semantic embeddings increases computational complexity.
  • Further validation is needed across diverse real-world applications.

Future Work

Future work could explore ECC's extension to multimodal data, optimize computational efficiency, and incorporate dynamic signals for real-time performance.

AI Executive Summary

Traditional query clustering methods, based on semantic embeddings or human labels, fail to capture latent capability demands. ECC introduces a capability-aware clustering approach by calibrating semantic embeddings with limited model comparison signals. It uses the Bradley-Terry model to parameterize capability profiles and employs trainable soft responsibilities to model mixed capability demands.

Experiments demonstrate that ECC significantly improves LLM ranking quality, outperforming human-labeled and embedding-based baselines by over 17%. It also excels in downstream tasks like query routing, enhancing response quality by 16.6%, and limited-budget model ranking, achieving a 16.3% improvement.

While ECC marks a breakthrough in capability modeling, its reliance on model comparison data and computational complexity remain challenges. Future research could explore its potential in multimodal data and real-time applications.

Deep Analysis

Background

Large Language Models (LLMs) excel across tasks, but their evaluation depends on aligning queries with capability demands. Traditional clustering methods based on semantic embeddings fail to capture latent demands, leading to inaccurate evaluations.

Core Problem

Existing methods misalign surface semantics with latent capability needs, limiting their effectiveness in capability-aware LLM evaluation, especially for complex or mixed-demand queries.

Innovation

ECC calibrates semantic embeddings with model comparison signals, introduces Bradley-Terry-based capability profiles, and uses soft responsibilities to model mixed demands.

Methodology

  • �� Initialize query clusters using semantic embeddings.
  • �� Collect limited model comparison data as posterior signals.
  • �� Parameterize capability profiles using the Bradley-Terry model.
  • �� Introduce soft responsibilities to quantify query-cluster alignment.
  • �� Use alternating optimization to update cluster centroids and responsibilities.

Experiments

Experiments on MMLU, MATH, and other datasets compare ECC with human-labeled and embedding-based baselines, validating its performance in query routing and new model ranking tasks.

Results

ECC improves ranking quality by over 17%, enhances query routing response quality by 16.6%, and achieves a 16.3% improvement in limited-budget model ranking.

Applications

ECC is applicable for personalized LLM deployment, query routing optimization, and new model evaluation, particularly in multi-task, multi-domain scenarios.

Limitations & Outlook

ECC's reliance on model comparison data may limit performance in data-scarce scenarios, and its computational complexity remains a challenge.

Plain Language Accessible to non-experts

Imagine you're in a library looking for the best expert to answer your question. Traditional methods only look at the expert's title (semantic embeddings), but ECC observes how they actually answer questions (model comparisons) to group them, ensuring each group matches your needs better.

ELI14 Explained like you're 14

Think of your friends who are good at different video games. You want to know who can help you beat a tough level. ECC is like a smart referee—it doesn't just look at the games they play but also watches how well they perform, grouping them by skill to find you the perfect teammate!

Glossary

Bradley-Terry Model

A model for estimating latent strengths from pairwise comparisons.

Used in ECC to parameterize cluster capability profiles.

Soft Responsibilities

Weights quantifying how well a query aligns with multiple clusters.

Enables ECC to model mixed capability demands.

Capability Profile

Represents the latent capability distribution of a cluster.

Distinguishes clusters in ECC.

Posterior Signal

Capability evidence derived from model comparisons.

Used to calibrate semantic embeddings in ECC.

Query Routing

Assigning queries to the most suitable model based on capability needs.

ECC improves response quality in query routing tasks.

Open Questions Unanswered questions from this research

  • 1 How can ECC perform better in data-scarce scenarios?
  • 2 Can ECC be extended to multimodal data and real-time applications?

Applications

Immediate Applications

Query Routing Optimization

Selects the best model for a query based on capability demands, improving response quality.

New Model Evaluation

Quickly evaluates new model capabilities under limited comparison budgets.

Long-term Vision

Multimodal Capability Modeling

Extends ECC to multimodal data for more complex tasks.

Abstract

Query clustering organizes queries into groups that reflect shared latent capability demands, enabling capability-aware LLM evaluation. Existing clustering methods, which primarily rely on semantic taxonomies or embeddings, often fail to capture such latent capability requirements due to a misalignment between surface-level semantics and actual model performance. We propose ECC, an algorithm that calibrates prior semantic embeddings using limited posterior model comparisons to bridge the gap between surface-level semantics and latent capability requirements. ECC characterizes each cluster through a capability profile parameterized by a Bradley-Terry model and uses trainable mixture weights to accommodate queries with mixed capability demands, jointly learning a flexible, capability-aware clustering structure that supports query-specific inference of LLM capabilities. Extensive quantitative and qualitative evaluations demonstrate that ECC significantly improves LLM capability ranking quality, outperforming human-labeled and embedding-based baselines by an average of 17.64 and 18.02 percentage points, respectively, and proves effective in downstream tasks such as query routing.

cs.AI cs.LG