OpenAIProprietary model
GPT-5.6 Terra benchmarks
- General rank#9of 27Leads 3 of 10 (30%)non-coding tasks
- Speed#4 / 71,565 msMedian latency, p50Hosted API only
- Cost#6 / 8$1.03Per 1,000 decisionsHosted price
- Moderation#1 / 8 tied79.9%Best task · Balanced accuracyvs frontier LLMs
Comparison summary
- Strongest
- Routing and classification
- Leads 2 of 4 (50%)
- Weakest
- Grounding
- Leads 0 of 2 (0%)
Strong at routing, weaker at grounding. It leads 3 of 10 (30%) non-coding tasks, #9 of 27 models by that count.
Specifications
- Lab
- OpenAI
- Weights
- Proprietary
- Parameters
- Not disclosed
- Licence
- Proprietary
Overall standing
Share of non-coding tasks led · #9 of 27
- Claude Opus 5.585%
- Jev68%
- AutoJev-27B67%
- Eikos-27B60%
- GPT-6.1 Sol54%
- Claude Sonnet 5.546%
- Shisa DE-142%
- GPT-5.6 Terra30%
Safety and guardrails
Share of tasks led · #7 of 8
- Claude Opus 5.5Leads 3 of 4
- JevLeads 8 of 12
- GPT-6.1 SolLeads 2 of 4
- Claude Sonnet 5.5Leads 2 of 4
- Gemini 3.8 FlashLeads 1 of 4
- Claude Haiku 4.5Leads 1 of 4
- GPT-5.6 TerraLeads 1 of 4
- GPT-6 LunaLeads 1 of 4
See the 4 tasks
Prompt injection
Tier 4 of 4#6 / 8Balanced accuracy, % · Higher is better
- Jev95.2, interval 93.9 to 96.5, ahead alone
- Claude Haiku 4.592.7, interval 91.1 to 94.3, tier 2
- GPT-6.1 Sol91.3, interval 89.6 to 92.9, tier 2
- Claude Opus 5.590.9, interval 89.2 to 92.5, tier 2
- Gemini 3.8 Flash90.4, interval 88.6 to 92.1, tier 3
- Claude Sonnet 5.588.3, interval 86.4 to 90.2, tier 4
- GPT-5.6 Terra88.2, interval 86.3 to 90.0, tier 4
- GPT-6 Luna88.0, interval 86.1 to 89.8, tier 4
Moderation
Tied for the lead#1 / 8Balanced accuracy, % · Higher is better
- Claude Sonnet 5.581.6, interval 78.5 to 84.4, tied for the lead
- GPT-6.1 Sol81.4, interval 78.5 to 84.2, tied for the lead
- Gemini 3.8 Flash81.4, interval 78.4 to 84.1, tied for the lead
- Claude Opus 5.581.1, interval 78.0 to 84.0, tied for the lead
- Claude Haiku 4.581.1, interval 78.0 to 84.0, tied for the lead
- GPT-6 Luna80.8, interval 77.6 to 83.7, tied for the lead
- GPT-5.6 Terra79.9, interval 77.0 to 82.9, tied for the lead
- Jev78.0, interval 74.9 to 81.0, tier 2
Off-topic
Tier 3 of 4#5 / 8Balanced accuracy, % · Higher is better
- Claude Opus 5.596.0, interval 94.8 to 97.1, tied for the lead
- Claude Sonnet 5.595.4, interval 94.1 to 96.6, tied for the lead
- GPT-6.1 Sol95.3, interval 93.9 to 96.6, tied for the lead
- Gemini 3.8 Flash95.0, interval 93.6 to 96.3, tier 2
- Jev93.4, interval 91.8 to 94.9, tier 3
- GPT-5.6 Terra92.3, interval 90.6 to 93.9, tier 3
- Claude Haiku 4.591.5, interval 89.7 to 93.2, tier 4
- GPT-6 Luna90.6, interval 88.7 to 92.4, tier 4
PII
Tier 4 of 5#6 / 8Balanced accuracy, % · Higher is better
- Claude Opus 5.595.4, interval 94.1 to 96.6, ahead alone
- Claude Sonnet 5.594.0, interval 92.6 to 95.5, tier 2
- Gemini 3.8 Flash93.1, interval 91.5 to 94.6, tier 2
- Jev92.9, interval 91.3 to 94.4, tier 2
- GPT-6.1 Sol91.3, interval 89.7 to 93.0, tier 3
- GPT-6 Luna87.2, interval 85.3 to 89.1, tier 4
- GPT-5.6 Terra86.4, interval 84.5 to 88.4, tier 4
- Claude Haiku 4.583.1, interval 80.9 to 85.3, tier 5
Routing and classification
Share of tasks led · #3 of 8
- Claude Opus 5.5Leads 3 of 4
- JevLeads 9 of 14
- GPT-5.6 TerraLeads 2 of 4
- Gemini 3.8 FlashLeads 1 of 4
- Claude Sonnet 5.5Leads 1 of 4
- GPT-6.1 SolLeads 1 of 4
- GPT-6 LunaLeads 1 of 4
- Claude Haiku 4.5Leads 0 of 4
See the 4 tasks
Routing, 20 intents
Tier 2 of 3#2 / 8Accuracy, % · Higher is better
- Claude Opus 5.595.0, interval 93.6 to 96.3, ahead alone
- GPT-6.1 Sol92.8, interval 91.2 to 94.3, tier 2
- Gemini 3.8 Flash92.7, interval 91.1 to 94.2, tier 2
- GPT-5.6 Terra92.4, interval 90.7 to 94.0, tier 2
- Claude Sonnet 5.591.7, interval 89.9 to 93.4, tier 2
- GPT-6 Luna90.3, interval 88.4 to 92.1, tier 3
- Claude Haiku 4.589.3, interval 87.3 to 91.2, tier 3
- Jev89.1, interval 87.0 to 91.0, tier 3
Routing, 77 intents
Tier 2 of 4#2 / 8Accuracy, % · Higher is better
- Claude Opus 5.588.0, interval 85.2 to 90.8, ahead alone
- Gemini 3.8 Flash84.8, interval 81.6 to 88.0, tier 2
- GPT-6.1 Sol84.4, interval 81.2 to 87.6, tier 2
- Claude Sonnet 5.584.2, interval 81.0 to 87.2, tier 2
- GPT-5.6 Terra83.4, interval 80.0 to 86.6, tier 2
- GPT-6 Luna82.2, interval 78.8 to 85.6, tier 3
- Claude Haiku 4.580.0, interval 76.6 to 83.4, tier 3
- Jev79.6, interval 76.0 to 83.0, tier 4
Tool routing
Tied for the lead#1 / 8Accuracy, % · Higher is better
- GPT-6 Luna85.5, interval 83.3 to 87.6, tied for the lead
- GPT-5.6 Terra84.2, interval 82.0 to 86.3, tied for the lead
- Gemini 3.8 Flash83.6, interval 81.3 to 85.7, tier 2
- Claude Haiku 4.582.0, interval 79.6 to 84.2, tier 2
- GPT-6.1 Sol79.9, interval 77.4 to 82.2, tier 3
- Claude Sonnet 5.579.4, interval 76.9 to 81.7, tier 3
- Claude Opus 5.578.7, interval 76.1 to 81.1, tier 4
- Jev78.3, interval 75.7 to 80.7, tier 4
Complaint routing
Tied for the lead#1 / 8Accuracy, % · Higher is better
- Gemini 3.8 Flash79.6, interval 77.1 to 82.0, tied for the lead
- GPT-6.1 Sol79.0, interval 76.5 to 81.4, tied for the lead
- Claude Opus 5.578.9, interval 76.4 to 81.4, tied for the lead
- Jev78.7, interval 76.3 to 81.2, tied for the lead
- GPT-5.6 Terra78.4, interval 75.9 to 81.0, tied for the lead
- Claude Sonnet 5.578.3, interval 75.7 to 80.8, tied for the lead
- GPT-6 Luna77.9, interval 75.4 to 80.4, tier 2
- Claude Haiku 4.577.1, interval 74.6 to 79.7, tier 2
Grounding
Share of tasks led · #6 of 8
- Claude Opus 5.5Leads 2 of 2
- Claude Sonnet 5.5Leads 2 of 2
- Gemini 3.8 FlashLeads 2 of 2
- GPT-6.1 SolLeads 2 of 2
- JevLeads 4 of 6
- GPT-5.6 TerraLeads 0 of 2
- GPT-6 LunaLeads 0 of 2
- Claude Haiku 4.5Leads 0 of 2
See the 2 tasks
RAG faithfulness
Tier 2 of 3#5 / 8Balanced accuracy, % · Higher is better
- Claude Opus 5.585.0, interval 82.3 to 87.5, tied for the lead
- GPT-6.1 Sol84.2, interval 81.5 to 86.9, tied for the lead
- Claude Sonnet 5.583.6, interval 80.8 to 86.4, tied for the lead
- Gemini 3.8 Flash83.3, interval 80.4 to 86.2, tied for the lead
- GPT-5.6 Terra80.6, interval 77.7 to 83.6, tier 2
- Jev80.3, interval 77.5 to 83.1, tier 2
- GPT-6 Luna79.7, interval 76.7 to 82.7, tier 2
- Claude Haiku 4.577.4, interval 74.4 to 80.3, tier 3
Search relevance
Tier 2 of 3#5 / 8Accuracy, % · Higher is better
- Claude Opus 5.563.6, interval 60.7 to 66.7, tied for the lead
- GPT-6.1 Sol63.0, interval 60.0 to 66.1, tied for the lead
- Gemini 3.8 Flash62.5, interval 59.6 to 65.6, tied for the lead
- Claude Sonnet 5.561.1, interval 58.1 to 64.0, tied for the lead
- Jev57.7, interval 54.7 to 60.8, tier 2
- GPT-5.6 Terra57.6, interval 54.3 to 60.6, tier 2
- GPT-6 Luna54.7, interval 51.6 to 57.8, tier 2
- Claude Haiku 4.550.6, interval 47.4 to 53.7, tier 3
Speed
Median latency, p50 · Hosted API only · lower is better
- Jev~65 ms
- GPT-6 Luna1,124 ms
- Claude Haiku 4.51,306 ms
- GPT-5.6 Terra1,565 ms
- Claude Sonnet 5.51,646 ms
- Gemini 3.8 Flash1,936 ms
- Claude Opus 5.52,194 ms
Cost
Per 1,000 decisions, hosted price · lower is better
- Jev$0.029
- GPT-6 Luna$0.049
- Gemini 3.8 Flash$0.57
- Claude Haiku 4.5$0.69
- GPT-6.1 Sol~$1.02
- GPT-5.6 Terra$1.03
- Claude Sonnet 5.5$1.52
- Claude Opus 5.5$3.44
How we count
A model leads a task when it is in the task's leading tie tier. Each task counts inside its own benchmark, against that benchmark's models; no score is averaged. An area chart shows the models ranked on at least 2 of the area's tasks in a benchmark this model is in too. The overall standing counts every non-coding tasks and needs 5 for a rank. Latency is compared only on one hardware tier.
GPT-5.6 TerraOther modelsWhisker: 95% interval
