LEGORA RESEARCH

Legora BAR Update

September 17, 2026

Category

Legora Research

UPDATED

September 16, 2026

September 9, 2025

author

Jacob Lauritzen
Emil Sjölander
Ebba Helfer
Firas Danil

September update

Our mission at Legora has always been to put the most advanced AI in the hands of lawyers. From the earliest days we made a deliberate choice to be, and to remain, model-agnostic: the best model for legal work changes every few months, and our customers should never be locked to a single tab.

The Legora Benchmark for Agentic Reasoning (BAR) is how we hold ourselves to that. It runs the same end-to-end legal tasks, inside the same harness our customers use every day, across models from every major lab, frontier and open-weight alike. The purpose is simple: show, with one consistent yardstick, how well the models on the market perform on real legal work today, and how that picture moves over time.

Not every model on this page is available in Legora. Before any model is rolled out to customers it goes through our security review and has to meet our requirements on data handling, hosting and confidentiality.

What follows is a snapshot: how these models performed inside the Legora harness at one point in September 2026. The picture may look different a month from now, both because we keep developing the harness and because the models themselves keep improving, and both of those improvements flow through to our users.

Leading on quality

1.06x

Fable 5.1, against the 15-model average

Best to worst

17%

between the strongest and the weakest model

Each a complete task set inside a real matter, graded case by case.

Best on citations

Opus 5

1.05x on cited answers

Quality by difficulty

Each difficulty panel is normalized to the average of the 15 models within that difficulty.

Claude (Anthropic)GPT (OpenAI)Grok (xAI)Gemini (Google)Kimi (Moonshot)GLM (Z.ai)DeepSeekMuse Spark (Meta)Average of the 15 models (1.00×)0.75×1.00×1.10×1.25×ShortThe Legora Benchmark for Agentic Reasoning - September UpdateGrok 4.6The Legora Benchmark for Agentic Reasoning - September Update6 AstraThe Legora Benchmark for Agentic Reasoning - September UpdateOpus 5The Legora Benchmark for Agentic Reasoning - September Update5.6 TerraThe Legora Benchmark for Agentic Reasoning - September Update3.8 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateV4 ProThe Legora Benchmark for Agentic Reasoning - September Update5.6 LunaThe Legora Benchmark for Agentic Reasoning - September UpdateV4.1 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateV4 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateSonnet 5The Legora Benchmark for Agentic Reasoning - September UpdateMuse 1.3The Legora Benchmark for Agentic Reasoning - September UpdateFable 5.1The Legora Benchmark for Agentic Reasoning - September UpdateGLM 5.3The Legora Benchmark for Agentic Reasoning - September UpdateGLM 5.3 FThe Legora Benchmark for Agentic Reasoning - September UpdateKimi K3MediumThe Legora Benchmark for Agentic Reasoning - September Update5.6 TerraThe Legora Benchmark for Agentic Reasoning - September Update5.6 LunaThe Legora Benchmark for Agentic Reasoning - September UpdateGLM 5.3 FThe Legora Benchmark for Agentic Reasoning - September UpdateMuse 1.3The Legora Benchmark for Agentic Reasoning - September UpdateSonnet 5The Legora Benchmark for Agentic Reasoning - September UpdateV4.1 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateGLM 5.3The Legora Benchmark for Agentic Reasoning - September UpdateV4 ProThe Legora Benchmark for Agentic Reasoning - September Update6 AstraThe Legora Benchmark for Agentic Reasoning - September UpdateKimi K3The Legora Benchmark for Agentic Reasoning - September UpdateV4 FlashThe Legora Benchmark for Agentic Reasoning - September Update3.8 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateGrok 4.6The Legora Benchmark for Agentic Reasoning - September UpdateOpus 5The Legora Benchmark for Agentic Reasoning - September UpdateFable 5.1LongThe Legora Benchmark for Agentic Reasoning - September Update5.6 TerraThe Legora Benchmark for Agentic Reasoning - September Update5.6 LunaThe Legora Benchmark for Agentic Reasoning - September UpdateGLM 5.3 FThe Legora Benchmark for Agentic Reasoning - September UpdateV4 ProThe Legora Benchmark for Agentic Reasoning - September UpdateSonnet 5The Legora Benchmark for Agentic Reasoning - September Update6 AstraThe Legora Benchmark for Agentic Reasoning - September UpdateV4.1 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateGrok 4.6The Legora Benchmark for Agentic Reasoning - September UpdateV4 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateGLM 5.3The Legora Benchmark for Agentic Reasoning - September UpdateKimi K3The Legora Benchmark for Agentic Reasoning - September Update3.8 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateMuse 1.3The Legora Benchmark for Agentic Reasoning - September UpdateFable 5.1The Legora Benchmark for Agentic Reasoning - September UpdateOpus 5

Source: Legora

On easy work the field is essentially flat, with nearly every model within 3% of the average. The separation happens on long cases, where the spread runs from 0.78x to 1.15x. Opus 5 and Fable 5.1 lead the long tier, with Muse Spark 1.3 and Gemini 3.8 Flash close behind at around 1.09x to 1.10x. The lesson is the same as in our last update: short tasks no longer separate the models, long multi-step matters do.

Quality vs median time per case

Overall quality against median agent time per case, both relative to the 15-model average (1.00x). Open-weight models are grayed out. Frontier models are served by their own labs, so their latency is a stable reference point. Open-weight models can be hosted by many providers, and the time we measured reflects the host we used rather than the model alone.

Claude (Anthropic)GPT (OpenAI)Grok (xAI)Gemini (Google)Kimi (Moonshot)GLM (Z.ai)DeepSeekMuse Spark (Meta)Average of the 15 models (1.00×)Open-weight models, grayed: latency depends on the hosting providerBest: faster than average, above-average quality0.90×1.00×1.10×0.00×0.25×0.50×0.75×1.00×1.25×1.50×1.75×2.00×2.25×2.50×Median time per case relative to the 15-model average (further right = slower)Opus 5Sonnet 5GPT-5.6 LunaGPT-5.6 TerraGPT-6 AstraGrok 4.6Kimi K3GLM 5.3GLM 5.3 FlashDeepSeek V4 FlashDeepSeek V4 ProMuse Spark 1.3Gemini 3.8 FlashFable 5.1DeepSeek V4.1 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update

Source: Legora

Muse Spark 1.3 is the fastest model in the field at 0.36x the average median time per case while still landing above average on quality (1.02x), which makes it the speed point on the frontier. Gemini 3.8 Flash (0.75x time, 1.04x quality), Opus 5 (0.96x, 1.05x) and Fable 5.1 (1.06x, 1.06x) complete the Pareto curve: each step up in quality costs time. The open-weight models spread widely along the time axis, with the DeepSeek Flash models at 2.3x to 2.5x, which reflects the host we used as much as the model.

Verbosity: combined output per run, split by kind

Combined output per run relative to the 15 model average (1.00x).

Response (chat text and comments)Document (written by drafting tools)0.00×0.25×0.50×0.75×1.00×1.25×1.50×GPT-6 AstraThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update1.46×Opus 5The Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update1.44×Fable 5.1The Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update1.20×DeepSeek V4.1 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update1.10×Gemini 3.8 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update1.02×DeepSeek V4 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update0.97×GLM 5.3The Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update0.96×Grok 4.6The Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update0.92×GPT-5.6 LunaThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update0.91×Muse Spark 1.3The Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update0.89×Kimi K3The Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update0.88×GLM 5.3 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update0.86×Sonnet 5The Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update0.84×DeepSeek V4 ProThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update0.77×GPT-5.6 TerraThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update0.76×

Source: Legora

Verbosity is a recent addition to BAR. We measure it because preferences differ: a lawyer may want a detailed explanation on some tasks and a short, direct answer on others, and this shows how much each model writes rather than how well. GPT-5.6 Terra and DeepSeek V4 Pro are the most concise at 0.76x to 0.77x, while GPT-6 Astra, Opus 5 and Fable 5.1 are the most expansive at 1.20x to 1.46x, with most of the difference sitting in documents rather than chat responses. Gemini 3.8 Flash is the exception, at 1.91x on chat responses against 0.50x on documents: it tends to answer inside the chat rather than produce documents.

Quality vs cost per case

Overall quality against average cost per case at public list prices, both relative to the 15-model average (1.00x)

Claude (Anthropic)GPT (OpenAI)Grok (xAI)Gemini (Google)Kimi (Moonshot)GLM (Z.ai)DeepSeekMuse Spark (Meta)Average of the 15 models (1.00×)Best value: cheaper than average, above-average quality0.90×1.00×1.10×0.05×0.1×0.2×0.5×Average cost per case relative to the 15-model average, log scale (further right = pricier)Opus 5Sonnet 5GPT-5.6 LunaGPT-5.6 TerraGPT-6 AstraGrok 4.6Kimi K3GLM 5.3GLM 5.3 FlashDeepSeek V4 FlashDeepSeek V4 ProMuse Spark 1.3Gemini 3.8 FlashFable 5.1DeepSeek V4.1 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September UpdateThe Legora Benchmark for Agentic Reasoning - September Update

Source: Legora

Among frontier models, Gemini 3.8 Flash is currently the best price-to-quality point on the Pareto curve: 1.04x quality at 0.29x the field's average cost per case. Fable 5.1 and Opus 5 are the only two models above it on quality, and they remain the right choice where the last few points on hard matters matter more than cost. The open-weight models redraw the bottom of the curve: DeepSeek V4 Flash delivers 1.02x quality at 0.12x cost and GLM 5.3 Flash 0.96x at 0.07x.

Citation performance

Cited answers: share of runs with a citation. Grounding: share of documents read that were cited. Each panel normalised to the 15 model average.

Claude (Anthropic)GPT (OpenAI)Grok (xAI)Gemini (Google)Kimi (Moonshot)GLM (Z.ai)DeepSeekMuse Spark (Meta)Average of the 15 models (1.00×)0.70×0.85×1.00×1.10×1.25×Cited answersThe Legora Benchmark for Agentic Reasoning - September UpdateV4 ProThe Legora Benchmark for Agentic Reasoning - September UpdateGLM 5.3 FThe Legora Benchmark for Agentic Reasoning - September UpdateGrok 4.6The Legora Benchmark for Agentic Reasoning - September UpdateMuse 1.3The Legora Benchmark for Agentic Reasoning - September UpdateGLM 5.3The Legora Benchmark for Agentic Reasoning - September UpdateV4 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateFable 5.1The Legora Benchmark for Agentic Reasoning - September Update5.6 TerraThe Legora Benchmark for Agentic Reasoning - September UpdateV4.1 FlashThe Legora Benchmark for Agentic Reasoning - September Update5.6 LunaThe Legora Benchmark for Agentic Reasoning - September Update3.8 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateSonnet 5The Legora Benchmark for Agentic Reasoning - September UpdateKimi K3The Legora Benchmark for Agentic Reasoning - September Update6 AstraThe Legora Benchmark for Agentic Reasoning - September UpdateOpus 5GroundingThe Legora Benchmark for Agentic Reasoning - September Update6 AstraThe Legora Benchmark for Agentic Reasoning - September UpdateV4 ProThe Legora Benchmark for Agentic Reasoning - September Update5.6 LunaThe Legora Benchmark for Agentic Reasoning - September Update5.6 TerraThe Legora Benchmark for Agentic Reasoning - September UpdateV4.1 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateGrok 4.6The Legora Benchmark for Agentic Reasoning - September UpdateV4 FlashThe Legora Benchmark for Agentic Reasoning - September UpdateMuse 1.3The Legora Benchmark for Agentic Reasoning - September UpdateGLM 5.3 FThe Legora Benchmark for Agentic Reasoning - September UpdateFable 5.1The Legora Benchmark for Agentic Reasoning - September UpdateSonnet 5The Legora Benchmark for Agentic Reasoning - September UpdateGLM 5.3The Legora Benchmark for Agentic Reasoning - September UpdateOpus 5The Legora Benchmark for Agentic Reasoning - September UpdateKimi K3The Legora Benchmark for Agentic Reasoning - September Update3.8 Flash

Source: Legora

Opus 5 tops cited answers at 1.05x, and the top of that panel is crowded: eleven models sit at or above the average. Grounding is where the models diverge. Gemini 3.8 Flash leads at 1.18x, followed by Kimi K3 at 1.14x and Opus 5 at 1.10x.

Which model for which kind of work

Each task family (column) is normalised to the 15-model average for that family, so a column shows which models are stronger or weaker at that kind of work rather than how hard it is.

Analyse / AnswerExtractCompareDraftReviewEdit
Fable 5.11.02×1.05×1.12×0.97×1.04×1.07×
Opus 51.04×0.98×1.11×1.09×0.98×1.11×
Gemini 3.8 Flash1.01×1.03×1.03×1.02×1.16×0.92×
Kimi K31.05×0.99×1.03×1.10×0.99×1.08×
DeepSeek V4 Flash1.03×0.98×1.04×1.02×1.03×1.07×
GLM 5.31.03×1.00×1.02×1.08×1.03×1.02×
Muse Spark 1.31.04×1.02×0.90×1.04×1.06×1.01×
Sonnet 51.01×1.01×0.97×1.03×0.94×1.04×
DeepSeek V4.1 Flash1.01×0.99×0.97×1.03×1.00×1.00×
GPT-6 Astra0.95×1.01×1.12×1.00×1.00×1.01×
Grok 4.60.90×0.99×1.09×1.08×1.09×1.10×
DeepSeek V4 Pro1.00×0.99×0.95×0.92×0.94×0.87×
GLM 5.3 Flash1.00×1.01×0.90×0.87×0.98×0.96×
GPT-5.6 Luna0.95×1.00×0.87×0.88×0.90×0.91×
GPT-5.6 Terra0.96×0.95×0.89×0.88×0.84×0.83×
vs the column averageWell below (0.95× or less)Below (0.96 to 0.98×)At average (0.99 to 1.01×)Above (1.02 to 1.05×)Well above (1.06× or more)

Source: Legora

No model wins every column, which is the strongest argument for staying model-agnostic. Fable 5.1, GPT-6 Astra and Opus 5 lead on Compare at 1.11x to 1.12x, while Kimi K3, Opus 5 and GLM 5.3 lead on Draft. Gemini 3.8 Flash stands out on Review at 1.16x, the single largest lead anywhere in the table.

Product

Solutions

Certified

Company

Legal

Resources

Social

© 2026 Legora. All rights reserved.