jaredpalmerOpen weights model9B parameters
Kev-9B benchmarks
- General rank#14of 27Leads 0 of 8 (0%)non-coding tasks
- Speed#1 / 443 msMedian latency, p50H100 only
- CostSelf-hostedRan on H100No hosted price
- Off-topic#2 / 989.6%Best task · Balanced accuracyvs open models
Comparison summary
- Strongest
- Routing and classification
- Leads 0 of 2 (0%)
- Weakest
- Grounding
- Leads 0 of 2 (0%)
Strongest at routing, weaker at grounding. It leads 0 of 8 (0%) non-coding tasks, #14 of 27 models by that count.
Specifications
- Lab
- jaredpalmer
- Weights
- Open weights
- Parameters
- 9B
- Licence
- Not recorded
Overall standing
Share of non-coding tasks led · #14 of 27
- Claude Opus 5.585%
- Jev68%
- AutoJev-27B67%
- Eikos-27B60%
- GPT-6.1 Sol54%
- Claude Sonnet 5.546%
- Shisa DE-142%
- Kev-9B0%
Safety and guardrails
Share of tasks led · #5 of 13
- Eikos-27BLeads 3 of 3
- AutoJev-27BLeads 2 of 2
- JevLeads 8 of 12
- Shisa DE-1Leads 1 of 4
- Kev-9BLeads 0 of 4
- Eikos-4BLeads 0 of 3
- SemIf (Qwen3.5-4B)Leads 0 of 4
- Kev-0.8BLeads 0 of 8
See the 4 tasks
Prompt injection
Tier 2 of 5#5 / 12Catch rate at 5% false alarms, % · Higher is better
- Jev94.6, interval 92.2 to 96.7, tied for the lead
- Eikos-27B94.2, interval 90.5 to 97.1, tied for the lead
- Shisa DE-194.0, interval 90.3 to 96.2, tied for the lead
- AutoJev-27B92.0, interval 86.6 to 95.0, tied for the lead
- Kev-4B91.6, interval 88.2 to 94.2, tier 2
- Eikos-4B90.8, interval 88.3 to 94.0, tier 2
- SemIf (Qwen3.5-4B)90.6, interval 87.8 to 93.5, tier 2
- Kev-9B87.6, interval 82.4 to 92.5, tier 2
Moderation
Tier 2 of 6#3 / 12AUROC, % · Higher is better
- AutoJev-27B*90.6*, interval 88.4 to 92.7, trained on this data, not ranked
- Eikos-27B90.3, interval 87.9 to 92.4, tied for the lead
- Jev90.3, interval 87.9 to 92.4, tied for the lead
- Eikos-4B88.8, interval 86.3 to 91.3, tier 2
- SemIf (Qwen3.5-4B)88.7, interval 86.2 to 91.2, tier 2
- Kev-9B88.5, interval 86.0 to 90.9, tier 2
- Shisa DE-188.3, interval 85.6 to 90.8, tier 2
- Kev-4B82.0, interval 78.8 to 85.0, tier 3
Off-topic
Tier 2 of 8#2 / 9Balanced accuracy, % · Higher is better
- Jev93.4, interval 91.8 to 94.9, ahead alone
- AutoJev-27B*92.7*, interval 91.0 to 94.4, trained on this data, not ranked
- Eikos-27B*90.6*, interval 88.8 to 92.4, trained on this data, not ranked
- Kev-9B89.6, interval 87.7 to 91.5, tier 2
- Shisa DE-188.0, interval 86.1 to 89.9, tier 3
- Kev-4B84.4, interval 82.1 to 86.7, tier 4
- SemIf (Qwen3.5-4B)81.1, interval 79.0 to 83.4, tier 5
- Eikos-4B*79.6*, interval 77.1 to 82.0, trained on this data, not ranked
PII
Tier 4 of 5#6 / 13Catch rate at 5% false alarms, % · Higher is better
- Eikos-27B95.2, interval 92.8 to 97.8, tied for the lead
- AutoJev-27B92.8, interval 90.2 to 95.5, tied for the lead
- Jev90.8, interval 88.1 to 93.8, tier 2
- Shisa DE-184.2, interval 77.3 to 89.1, tier 3
- Eikos-4B78.6, interval 74.5 to 85.3, tier 3
- SemIf (Qwen3.5-4B)66.1, interval 60.9 to 74.6, tier 4
- Kev-9B62.5, interval 0.2 to 66.4, tier 4
- Kev-0.8B22.8, interval 6.1 to 26.3, tier 5
Routing and classification
Share of tasks led · #7 of 16
- AutoJev-27BLeads 4 of 5
- Shisa DE-1Leads 3 of 4
- JevLeads 9 of 14
- Eikos-27BLeads 1 of 3
- SemIf (Qwen3.5-4B)Leads 1 of 3
- Kev-4BLeads 0 of 3
- Kev-9BLeads 0 of 2
- Eikos-4BLeads 0 of 2
See the 4 tasks
Routing, 20 intents
Trained on the test data, not rankedAccuracy, % · Higher is better
- Kev-4B*93.0*, interval 91.4 to 94.5, trained on this data, not ranked
- Kev-9B*93.0*, interval 91.4 to 94.6, trained on this data, not ranked
- Kev-0.8B*91.3*, interval 89.5 to 93.0, trained on this data, not ranked
- AutoJev-27B89.7, interval 87.7 to 91.6, ahead alone
- Eikos-27B*89.6*, interval 87.7 to 91.4, trained on this data, not ranked
- Kev-0.6B*89.5*, interval 87.5 to 91.5, trained on this data, not ranked
- Jev89.1, interval 87.0 to 91.0, tier 2
- Shisa DE-188.1, interval 85.9 to 90.1, tier 2
Routing, 77 intents
Trained on the test data, not rankedAccuracy, % · Higher is better
- Kev-4B*85.0*, interval 81.8 to 88.0, trained on this data, not ranked
- Kev-9B*85.0*, interval 81.8 to 88.2, trained on this data, not ranked
- Kev-0.8B*83.0*, interval 79.6 to 86.4, trained on this data, not ranked
- AutoJev-27B80.6, interval 77.0 to 84.0, tied for the lead
- Jev79.6, interval 76.0 to 83.0, tied for the lead
- Kev-0.6B*78.2*, interval 74.4 to 81.8, trained on this data, not ranked
- Eikos-27B*77.8*, interval 74.0 to 81.4, trained on this data, not ranked
- Eikos-4B*74.0*, interval 70.0 to 77.8, trained on this data, not ranked
Tool routing
Tier 4 of 10#7 / 16Accuracy, % · Higher is better
- Shisa DE-181.3, interval 78.9 to 83.5, tied for the lead
- AutoJev-27B80.6, interval 78.1 to 82.9, tied for the lead
- SemIf (Qwen3.5-4B)79.9, interval 77.4 to 82.2, tied for the lead
- Eikos-27B79.3, interval 76.8 to 81.8, tier 2
- Jev78.3, interval 75.7 to 80.7, tier 2
- Eikos-4B75.5, interval 72.8 to 78.0, tier 3
- Kev-9B72.4, interval 69.7 to 75.0, tier 4
- Kev-4B71.4, interval 68.6 to 74.0, tier 4
Complaint routing
Tier 2 of 8#3 / 15Accuracy, % · Higher is better
- Jev78.7, interval 76.3 to 81.2, tied for the lead
- Shisa DE-178.0, interval 75.4 to 80.6, tied for the lead
- Kev-4B76.2, interval 73.6 to 79.0, tier 2
- AutoJev-27B75.9, interval 73.2 to 78.7, tier 2
- Eikos-27B75.6, interval 73.0 to 78.4, tier 2
- Kev-9B75.0, interval 72.4 to 77.7, tier 2
- SemIf (Qwen3.5-4B)72.9, interval 70.2 to 75.7, tier 3
- Kev-0.6B59.3, interval 56.3 to 62.3, tier 4
Grounding
Share of tasks led · #7 of 15
- Eikos-27BLeads 2 of 2
- JevLeads 4 of 6
- AutoJev-27BLeads 0 of 2
- Shisa DE-1Leads 0 of 2
- Eikos-4BLeads 0 of 2
- Kev-4BLeads 0 of 2
- Kev-9BLeads 0 of 2
- Kev-0.8BLeads 0 of 4
See the 2 tasks
RAG faithfulness
Tier 3 of 5#5 / 13Balanced accuracy, % · Higher is better
- Eikos-27B82.1, interval 79.2 to 84.9, tied for the lead
- Jev80.3, interval 77.5 to 83.1, tied for the lead
- Shisa DE-179.2, interval 76.2 to 82.2, tier 2
- AutoJev-27B79.1, interval 76.1 to 82.0, tier 2
- Kev-9B73.1, interval 70.0 to 76.0, tier 3
- Kev-4B72.5, interval 69.4 to 75.5, tier 3
- SemIf (Qwen3.5-4B)72.0, interval 68.9 to 75.2, tier 3
- Eikos-4B71.0, interval 67.4 to 74.5, tier 3
Search relevance
Tier 3 of 7#5 / 16Accuracy, % · Higher is better
- Jev57.7, interval 54.7 to 60.8, tied for the lead
- Eikos-27B56.6, interval 53.4 to 59.7, tied for the lead
- AutoJev-27B52.8, interval 49.6 to 55.9, tier 2
- Shisa DE-150.3, interval 47.1 to 53.6, tier 2
- Kev-4B44.8, interval 41.7 to 48.0, tier 3
- Kev-9B43.4, interval 40.2 to 46.5, tier 3
- Eikos-4B43.3, interval 40.1 to 46.3, tier 3
- SemIf (Qwen3.5-4B)41.7, interval 38.6 to 44.7, tier 4
Speed
Median latency, p50 · H100 only · lower is better
- Kev-9B43 ms
- Shisa DE-146 ms
- Eikos-27B82 ms
- AutoJev-27B99 ms
How we count
A model leads a task when it is in the task's leading tie tier. Each task counts inside its own benchmark, against that benchmark's models; no score is averaged. An area chart shows the models ranked on at least 2 of the area's tasks in a benchmark this model is in too. The overall standing counts every non-coding tasks and needs 5 for a rank. Latency is compared only on one hardware tier.
Kev-9BOther modelsTrained on the test data*Whisker: 95% interval

