OpenAIProprietary model

GPT-5.6 Terra benchmarks

All models
  • General rank
    #9of 27Leads 3 of 10 (30%)non-coding tasks
  • Speed#4 / 7
    1,565 msMedian latency, p50Hosted API only
  • Cost#6 / 8
    $1.03Per 1,000 decisionsHosted price
  • Moderation#1 / 8 tied
    79.9%Best task · Balanced accuracyvs frontier LLMs

Comparison summary

Strongest
Routing and classification
Leads 2 of 4 (50%)
Weakest
Grounding
Leads 0 of 2 (0%)

Strong at routing, weaker at grounding. It leads 3 of 10 (30%) non-coding tasks, #9 of 27 models by that count.

Specifications

Lab
OpenAI
Weights
Proprietary
Parameters
Not disclosed
Licence
Proprietary

Overall standing

Share of non-coding tasks led · #9 of 27

Safety and guardrails

Share of tasks led · #7 of 8

  1. Claude Opus 5.5Leads 3 of 4
  2. JevLeads 8 of 12
  3. GPT-6.1 SolLeads 2 of 4
  4. Claude Sonnet 5.5Leads 2 of 4
  5. Gemini 3.8 FlashLeads 1 of 4
  6. Claude Haiku 4.5Leads 1 of 4
  7. GPT-5.6 Terra
    Leads 1 of 4
  8. GPT-6 LunaLeads 1 of 4
See the 4 tasks

Prompt injection

Tier 4 of 4#6 / 8

Balanced accuracy, % · Higher is better

  1. Jev95.2, interval 93.9 to 96.5, ahead alone
  2. Claude Haiku 4.592.7, interval 91.1 to 94.3, tier 2
  3. GPT-6.1 Sol91.3, interval 89.6 to 92.9, tier 2
  4. Claude Opus 5.590.9, interval 89.2 to 92.5, tier 2
  5. Gemini 3.8 Flash90.4, interval 88.6 to 92.1, tier 3
  6. Claude Sonnet 5.588.3, interval 86.4 to 90.2, tier 4
  7. GPT-5.6 Terra
    88.2, interval 86.3 to 90.0, tier 4
  8. GPT-6 Luna88.0, interval 86.1 to 89.8, tier 4

Moderation

Tied for the lead#1 / 8

Balanced accuracy, % · Higher is better

  1. Claude Sonnet 5.581.6, interval 78.5 to 84.4, tied for the lead
  2. GPT-6.1 Sol81.4, interval 78.5 to 84.2, tied for the lead
  3. Gemini 3.8 Flash81.4, interval 78.4 to 84.1, tied for the lead
  4. Claude Opus 5.581.1, interval 78.0 to 84.0, tied for the lead
  5. Claude Haiku 4.581.1, interval 78.0 to 84.0, tied for the lead
  6. GPT-6 Luna80.8, interval 77.6 to 83.7, tied for the lead
  7. GPT-5.6 Terra
    79.9, interval 77.0 to 82.9, tied for the lead
  8. Jev78.0, interval 74.9 to 81.0, tier 2

Off-topic

Tier 3 of 4#5 / 8

Balanced accuracy, % · Higher is better

  1. Claude Opus 5.596.0, interval 94.8 to 97.1, tied for the lead
  2. Claude Sonnet 5.595.4, interval 94.1 to 96.6, tied for the lead
  3. GPT-6.1 Sol95.3, interval 93.9 to 96.6, tied for the lead
  4. Gemini 3.8 Flash95.0, interval 93.6 to 96.3, tier 2
  5. Jev93.4, interval 91.8 to 94.9, tier 3
  6. GPT-5.6 Terra
    92.3, interval 90.6 to 93.9, tier 3
  7. Claude Haiku 4.591.5, interval 89.7 to 93.2, tier 4
  8. GPT-6 Luna90.6, interval 88.7 to 92.4, tier 4

PII

Tier 4 of 5#6 / 8

Balanced accuracy, % · Higher is better

  1. Claude Opus 5.595.4, interval 94.1 to 96.6, ahead alone
  2. Claude Sonnet 5.594.0, interval 92.6 to 95.5, tier 2
  3. Gemini 3.8 Flash93.1, interval 91.5 to 94.6, tier 2
  4. Jev92.9, interval 91.3 to 94.4, tier 2
  5. GPT-6.1 Sol91.3, interval 89.7 to 93.0, tier 3
  6. GPT-6 Luna87.2, interval 85.3 to 89.1, tier 4
  7. GPT-5.6 Terra
    86.4, interval 84.5 to 88.4, tier 4
  8. Claude Haiku 4.583.1, interval 80.9 to 85.3, tier 5

Routing and classification

Share of tasks led · #3 of 8

  1. Claude Opus 5.5Leads 3 of 4
  2. JevLeads 9 of 14
  3. GPT-5.6 Terra
    Leads 2 of 4
  4. Gemini 3.8 FlashLeads 1 of 4
  5. Claude Sonnet 5.5Leads 1 of 4
  6. GPT-6.1 SolLeads 1 of 4
  7. GPT-6 LunaLeads 1 of 4
  8. Claude Haiku 4.5Leads 0 of 4
See the 4 tasks

Routing, 20 intents

Tier 2 of 3#2 / 8

Accuracy, % · Higher is better

  1. Claude Opus 5.595.0, interval 93.6 to 96.3, ahead alone
  2. GPT-6.1 Sol92.8, interval 91.2 to 94.3, tier 2
  3. Gemini 3.8 Flash92.7, interval 91.1 to 94.2, tier 2
  4. GPT-5.6 Terra
    92.4, interval 90.7 to 94.0, tier 2
  5. Claude Sonnet 5.591.7, interval 89.9 to 93.4, tier 2
  6. GPT-6 Luna90.3, interval 88.4 to 92.1, tier 3
  7. Claude Haiku 4.589.3, interval 87.3 to 91.2, tier 3
  8. Jev89.1, interval 87.0 to 91.0, tier 3

Routing, 77 intents

Tier 2 of 4#2 / 8

Accuracy, % · Higher is better

  1. Claude Opus 5.588.0, interval 85.2 to 90.8, ahead alone
  2. Gemini 3.8 Flash84.8, interval 81.6 to 88.0, tier 2
  3. GPT-6.1 Sol84.4, interval 81.2 to 87.6, tier 2
  4. Claude Sonnet 5.584.2, interval 81.0 to 87.2, tier 2
  5. GPT-5.6 Terra
    83.4, interval 80.0 to 86.6, tier 2
  6. GPT-6 Luna82.2, interval 78.8 to 85.6, tier 3
  7. Claude Haiku 4.580.0, interval 76.6 to 83.4, tier 3
  8. Jev79.6, interval 76.0 to 83.0, tier 4

Tool routing

Tied for the lead#1 / 8

Accuracy, % · Higher is better

  1. GPT-6 Luna85.5, interval 83.3 to 87.6, tied for the lead
  2. GPT-5.6 Terra
    84.2, interval 82.0 to 86.3, tied for the lead
  3. Gemini 3.8 Flash83.6, interval 81.3 to 85.7, tier 2
  4. Claude Haiku 4.582.0, interval 79.6 to 84.2, tier 2
  5. GPT-6.1 Sol79.9, interval 77.4 to 82.2, tier 3
  6. Claude Sonnet 5.579.4, interval 76.9 to 81.7, tier 3
  7. Claude Opus 5.578.7, interval 76.1 to 81.1, tier 4
  8. Jev78.3, interval 75.7 to 80.7, tier 4

Complaint routing

Tied for the lead#1 / 8

Accuracy, % · Higher is better

  1. Gemini 3.8 Flash79.6, interval 77.1 to 82.0, tied for the lead
  2. GPT-6.1 Sol79.0, interval 76.5 to 81.4, tied for the lead
  3. Claude Opus 5.578.9, interval 76.4 to 81.4, tied for the lead
  4. Jev78.7, interval 76.3 to 81.2, tied for the lead
  5. GPT-5.6 Terra
    78.4, interval 75.9 to 81.0, tied for the lead
  6. Claude Sonnet 5.578.3, interval 75.7 to 80.8, tied for the lead
  7. GPT-6 Luna77.9, interval 75.4 to 80.4, tier 2
  8. Claude Haiku 4.577.1, interval 74.6 to 79.7, tier 2

Grounding

Share of tasks led · #6 of 8

  1. Claude Opus 5.5Leads 2 of 2
  2. Claude Sonnet 5.5Leads 2 of 2
  3. Gemini 3.8 FlashLeads 2 of 2
  4. GPT-6.1 SolLeads 2 of 2
  5. JevLeads 4 of 6
  6. GPT-5.6 Terra
    Leads 0 of 2
  7. GPT-6 LunaLeads 0 of 2
  8. Claude Haiku 4.5Leads 0 of 2
See the 2 tasks

RAG faithfulness

Tier 2 of 3#5 / 8

Balanced accuracy, % · Higher is better

  1. Claude Opus 5.585.0, interval 82.3 to 87.5, tied for the lead
  2. GPT-6.1 Sol84.2, interval 81.5 to 86.9, tied for the lead
  3. Claude Sonnet 5.583.6, interval 80.8 to 86.4, tied for the lead
  4. Gemini 3.8 Flash83.3, interval 80.4 to 86.2, tied for the lead
  5. GPT-5.6 Terra
    80.6, interval 77.7 to 83.6, tier 2
  6. Jev80.3, interval 77.5 to 83.1, tier 2
  7. GPT-6 Luna79.7, interval 76.7 to 82.7, tier 2
  8. Claude Haiku 4.577.4, interval 74.4 to 80.3, tier 3

Search relevance

Tier 2 of 3#5 / 8

Accuracy, % · Higher is better

  1. Claude Opus 5.563.6, interval 60.7 to 66.7, tied for the lead
  2. GPT-6.1 Sol63.0, interval 60.0 to 66.1, tied for the lead
  3. Gemini 3.8 Flash62.5, interval 59.6 to 65.6, tied for the lead
  4. Claude Sonnet 5.561.1, interval 58.1 to 64.0, tied for the lead
  5. Jev57.7, interval 54.7 to 60.8, tier 2
  6. GPT-5.6 Terra
    57.6, interval 54.3 to 60.6, tier 2
  7. GPT-6 Luna54.7, interval 51.6 to 57.8, tier 2
  8. Claude Haiku 4.550.6, interval 47.4 to 53.7, tier 3

Speed

Median latency, p50 · Hosted API only · lower is better

  1. Jev~65 ms
  2. GPT-6 Luna1,124 ms
  3. Claude Haiku 4.51,306 ms
  4. GPT-5.6 Terra
    1,565 ms
  5. Claude Sonnet 5.51,646 ms
  6. Gemini 3.8 Flash1,936 ms
  7. Claude Opus 5.52,194 ms

Cost

Per 1,000 decisions, hosted price · lower is better

How we count

A model leads a task when it is in the task's leading tie tier. Each task counts inside its own benchmark, against that benchmark's models; no score is averaged. An area chart shows the models ranked on at least 2 of the area's tasks in a benchmark this model is in too. The overall standing counts every non-coding tasks and needs 5 for a rank. Latency is compared only on one hardware tier.

GPT-5.6 TerraOther modelsWhisker: 95% interval