← Niche Catalog

extraction

Modality: llm_chat · full deep dive — every ranked model, test result, and artifact.

34
Models
0
Benchmark Results
0
Media Artifacts
0
Resolutions

Ranked Models

Ranked by confidence-adjusted score (single/zero-sample, non-curated scores floored; curated empirical scores trusted as-is).

#ModelProviderAdj. ScoreRawEvidence
1gemini-2.5-flashgoogle_gemini1.7001.700curated
2claude-haiku-4-5-20251001anthropic0.9610.967n=763
3claude-sonnet-4-6claude_desktop0.7730.850n=50
4claude-sonnet-4-6::think=fastclaude_code0.5451.000n=6
5claude-sonnet-4-6::think=deepclaude_code0.5451.000n=6
6gpt-4o-miniopenai0.5310.973n=6
7gpt-5.5::think=deepcodex0.5250.963n=6
8gpt-5.5::think=fastcodex0.5250.963n=6
9claude-opus-4-7::think=fastclaude_code0.4770.875n=6
10claude-opus-4-7::think=deepclaude_code0.4770.875n=6
11claude-opus-4-8::think=fastclaude_code0.4300.788n=6
12gpt-5.3-codex-spark::think=deepcodex0.3820.700n=6
13claude-opus-4-8::think=deepclaude_code0.3820.700n=6
14gpt-5.4::think=fastcodex0.3340.612n=6
15gpt-5.4::think=deepcodex0.3340.612n=6
16codex-auto-reviewcodex0.2860.525n=6
17gpt-5.3-codex-spark::think=fastcodex0.2860.525n=6
18deepseek-chatdeepseek0.1951.300provisional (n≤1)
19grok-4.3xai0.1801.200provisional (n≤1)
20claude-sonnet-4-5-20250929claude_code0.1460.970provisional (n≤1)
21claude-opus-4-6claude_code0.1340.895provisional (n≤1)
22claude-opus-4-1-20250805claude_code0.1340.895provisional (n≤1)
23gpt-5.4codex0.1200.800provisional (n≤1)
24gpt-5.5codex0.1200.800provisional (n≤1)
25gemini-3.1-progemini0.1200.800provisional (n≤1)
26claude-opus-4-20250514claude_code0.1160.776provisional (n≤1)
27claude-opus-4-5-20251101claude_code0.1120.750provisional (n≤1)
28claude-sonnet-4-20250514claude_code0.1110.737provisional (n≤1)
29claude-opus-4-8claude_code0.0860.572provisional (n≤1)
30claude-sonnet-4-6claude_code0.0400.268provisional (n≤1)
31claude-opus-4-7claude_code0.0290.191provisional (n≤1)
32gemini-2.5-progoogle_gemini0.0170.017n=8006
33gpt-5.3-codex-sparkcodex0.0160.105provisional (n≤1)
34claude-haiku-4-5-20251001claude_code0.0000.000n=50

Test Results

No benchmark outputs recorded for this niche yet.