← Niche Catalog

chat

Modality: llm_chat · full deep dive — every ranked model, test result, and artifact.

49
Models
0
Benchmark Results
0
Media Artifacts
20
Resolutions

Ranked Models

Ranked by confidence-adjusted score (single/zero-sample, non-curated scores floored; curated empirical scores trusted as-is).

#ModelProviderAdj. ScoreRawEvidence
1deepseek-chatdeepseek0.9941.000n=819
2gpt-4o-miniopenai0.9870.992n=1068
3claude-sonnet-4-5-20250929anthropic0.8751.000n=35
4claude-sonnet-4-6claude_desktop0.7730.850n=50
5claude-sonnet-4-6anthropic0.7221.000n=13
6claude-sonnet-4-6::think=fastclaude_code0.5451.000n=6
7claude-sonnet-4-6::think=deepclaude_code0.5451.000n=6
8gpt-5.5::think=deepcodex0.5250.963n=6
9gpt-5.5::think=fastcodex0.5250.963n=6
10claude-haiku-4-5-20251001anthropic0.5000.550n=50
11claude-opus-4-7::think=fastclaude_code0.4770.875n=6
12claude-opus-4-7::think=deepclaude_code0.4770.875n=6
13gpt-4oopenai0.4560.456curated
14gemini-2.5-flashgoogle_gemini0.4550.500n=50
15sonarperplexity0.4441.000n=4
16claude-opus-4-8::think=fastclaude_code0.4300.788n=6
17gpt-5.3-codex-spark::think=deepcodex0.3820.700n=6
18claude-opus-4-8::think=deepclaude_code0.3820.700n=6
19gpt-5.4::think=fastcodex0.3340.612n=6
20gpt-5.4::think=deepcodex0.3340.612n=6
21codex-auto-reviewcodex0.2860.525n=6
22gpt-5.3-codex-spark::think=fastcodex0.2860.525n=6
23gpt-5.4codex0.1501.000provisional (n≤1)
24gpt-5.5codex0.1501.000provisional (n≤1)
25claude-sonnet-4-5-20250929claude_code0.1430.951provisional (n≤1)
26claude-opus-4-6claude_code0.1300.870provisional (n≤1)
27claude-opus-4-1-20250805claude_code0.1300.869provisional (n≤1)
28gemini-3.1-progemini0.1200.800provisional (n≤1)
29antigravity:gemini-2.5-proantigravity0.1170.780provisional (n≤1)
30claude-opus-4-20250514claude_code0.1130.751provisional (n≤1)
31claude-sonnet-4-20250514claude_code0.1110.737provisional (n≤1)
32claude-opus-4-5-20251101claude_code0.1090.725provisional (n≤1)
33antigravity:gemini-2.5-flashantigravity0.1050.700provisional (n≤1)
34antigravity:gemini-2.0-flash-thinkingantigravity0.1050.700provisional (n≤1)
35claude-opus-4-8claude_code0.0830.555provisional (n≤1)
36claude-sonnet-4-6claude_code0.0370.247provisional (n≤1)
37claude-opus-4-7claude_code0.0250.168provisional (n≤1)
38gpt-5.3-codex-sparkcodex0.0160.105provisional (n≤1)
39gemini-2.5-progoogle_gemini0.0000.002provisional (n≤1)
40gpt-5.4-minicodex0.0000.000n=50
41claude-haiku-4-5-20251001claude_code0.0000.000n=50
42copilot:gpt-4ogithub_copilot0.0000.000provisional (n≤1)
43copilot:gpt-4o-minigithub_copilot0.0000.000provisional (n≤1)
44copilot:claude-3.5-sonnetgithub_copilot0.0000.000provisional (n≤1)
45copilot:claude-3.7-sonnetgithub_copilot0.0000.000provisional (n≤1)
46copilot:gemini-1.5-progithub_copilot0.0000.000provisional (n≤1)
47copilot:gemini-2.0-flashgithub_copilot0.0000.000provisional (n≤1)
48copilot:o1github_copilot0.0000.000provisional (n≤1)
49copilot:o3-minigithub_copilot0.0000.000provisional (n≤1)

Test Results

No benchmark outputs recorded for this niche yet.

Resolved Here

Requests semantically routed into this niche.

RequestedMethodConfidenceWhen
educational_chatsemantic0.5932026-05-21 23:38
educational_chatsemantic0.5932026-05-21 23:38
educational_chatsemantic0.5932026-05-21 23:38
educational_chatsemantic0.5932026-05-21 23:37
educational_chatsemantic0.5932026-05-21 23:37
educational_chatsemantic0.5932026-05-21 23:37
educational_chatsemantic0.5932026-05-21 18:01
educational_chatsemantic0.5932026-05-21 17:57
educational_chatsemantic0.5932026-05-21 17:57
educational_chatsemantic0.5932026-05-21 17:56
educational_chatsemantic0.5932026-05-21 17:56
educational_chatsemantic0.5932026-05-21 17:55
educational_chatsemantic0.5932026-05-21 17:48
educational_chatsemantic0.5932026-05-21 17:48
educational_chatsemantic0.5932026-05-20 21:35
educational_chatsemantic0.5932026-05-20 21:35
educational_chatsemantic0.5932026-05-20 21:35
educational_chatsemantic0.5932026-05-20 21:02
educational_chatsemantic0.5932026-05-20 21:02
educational_chatsemantic0.5932026-05-20 21:01