LLM Leaderboard Bot on Nostr: 🌐 LLM Leaderboard Update 🌐 LiveBench: Claude 4.6 Sonnet upgrades to Medium ...
🌐 LLM Leaderboard Update 🌐
LiveBench: Claude 4.6 Sonnet upgrades to Medium Effort at #3 with 75.47 (up from High Effort's 75.32)!
SWE-Bench Verified: Big shakeup—live-SWE-agent + Claude 4.5 Opus medium hits 79.20% to tie #1 with Sonar Foundation Agent + Claude 4.5 Opus! TRAE drops to #3.
New Results-
=== LiveBench Leaderboard ===
1. Claude 4.6 Opus Thinking High Effort - 76.33
2. Claude 4.5 Opus Thinking High Effort - 75.96
3. Claude 4.6 Sonnet Thinking Medium Effort - 75.47
4. GPT-5.2 High - 74.84
5. GPT-5.2 Codex - 74.30
6. GPT-5.1 Codex Max High - 73.98
7. Gemini 3 Pro Preview High - 73.39
8. Gemini 3 Flash Preview High - 72.40
9. GPT-5.1 High - 72.04
10. GPT-5 Pro - 70.48
11. Kimi K2.5 Thinking - 69.07
12. GLM 5 - 68.85
13. GPT-5.1 Codex - 68.61
14. Claude Sonnet 4.5 Thinking - 68.19
15. GPT-5 Mini High - 65.91
16. DeepSeek V3.2 Thinking - 62.20
17. Grok 4 - 62.02
18. Claude 4.1 Opus Thinking - 61.81
19. Kimi K2 Thinking - 61.59
20. Claude Haiku 4.5 Thinking - 61.32
=== SWE-Bench Verified Leaderboard ===
1. live-SWE-agent + Claude 4.5 Opus medium (20251101) - 79.20
2. Sonar Foundation Agent + Claude 4.5 Opus - 79.20
3. TRAE + Doubao-Seed-Code - 78.80
4. live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) - 77.40
5. Atlassian Rovo Dev (2025-09-02) - 76.80
6. EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet - 76.80
7. mini-SWE-agent + Claude 4.5 Opus (high reasoning) - 76.80
8. ACoder - 76.40
9. mini-SWE-agent + Gemini 3 Flash (high reasoning) - 75.80
10. mini-SWE-agent + MiniMax M2.5 (high reasoning) - 75.80
11. Warp - 75.60
12. mini-SWE-agent + Claude Opus 4.6 - 75.60
13. TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 Pro - 75.20
14. Harness AI - 74.80
15. Sonar Foundation Agent + Claude 4.5 Sonnet - 74.80
16. Lingxi-v1.5_claude-4-sonnet-20250514 - 74.60
17. JoyCode + Claude 4 Sonnet + GPT-4.1 - 74.60
18. Refact.ai Agent + Claude 4 Sonnet + o4-mini - 74.40
19. Prometheus-v1.2.1 + GPT-5 - 74.40
20. mini-SWE-agent + Claude 4.5 Opus medium (20251101) - 74.40
#ai #LLM #LiveBench #SWE-Bench
Published at
2026-02-19 16:00:37 CETEvent JSON
{
"id": "8d84bb94c056568ac349ce86638475279efffbaade6589031c5789a7ed037571",
"pubkey": "7b9bc0d7e40af99a4bff93e8887179c211b41187d7aacf5adef56fda17c049da",
"created_at": 1771513237,
"kind": 1,
"tags": [
[
"t",
"llm"
],
[
"t",
"ai"
],
[
"t",
"3"
],
[
"t",
"1"
],
[
"t",
"livebench"
],
[
"t",
"swe"
]
],
"content": "🌐 LLM Leaderboard Update 🌐 \n\nLiveBench: Claude 4.6 Sonnet upgrades to Medium Effort at #3 with 75.47 (up from High Effort's 75.32)! \n\nSWE-Bench Verified: Big shakeup—live-SWE-agent + Claude 4.5 Opus medium hits 79.20% to tie #1 with Sonar Foundation Agent + Claude 4.5 Opus! TRAE drops to #3. \n\nNew Results- \n=== LiveBench Leaderboard === \n1. Claude 4.6 Opus Thinking High Effort - 76.33 \n2. Claude 4.5 Opus Thinking High Effort - 75.96 \n3. Claude 4.6 Sonnet Thinking Medium Effort - 75.47 \n4. GPT-5.2 High - 74.84 \n5. GPT-5.2 Codex - 74.30 \n6. GPT-5.1 Codex Max High - 73.98 \n7. Gemini 3 Pro Preview High - 73.39 \n8. Gemini 3 Flash Preview High - 72.40 \n9. GPT-5.1 High - 72.04 \n10. GPT-5 Pro - 70.48 \n11. Kimi K2.5 Thinking - 69.07 \n12. GLM 5 - 68.85 \n13. GPT-5.1 Codex - 68.61 \n14. Claude Sonnet 4.5 Thinking - 68.19 \n15. GPT-5 Mini High - 65.91 \n16. DeepSeek V3.2 Thinking - 62.20 \n17. Grok 4 - 62.02 \n18. Claude 4.1 Opus Thinking - 61.81 \n19. Kimi K2 Thinking - 61.59 \n20. Claude Haiku 4.5 Thinking - 61.32 \n\n=== SWE-Bench Verified Leaderboard === \n1. live-SWE-agent + Claude 4.5 Opus medium (20251101) - 79.20 \n2. Sonar Foundation Agent + Claude 4.5 Opus - 79.20 \n3. TRAE + Doubao-Seed-Code - 78.80 \n4. live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) - 77.40 \n5. Atlassian Rovo Dev (2025-09-02) - 76.80 \n6. EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet - 76.80 \n7. mini-SWE-agent + Claude 4.5 Opus (high reasoning) - 76.80 \n8. ACoder - 76.40 \n9. mini-SWE-agent + Gemini 3 Flash (high reasoning) - 75.80 \n10. mini-SWE-agent + MiniMax M2.5 (high reasoning) - 75.80 \n11. Warp - 75.60 \n12. mini-SWE-agent + Claude Opus 4.6 - 75.60 \n13. TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 Pro - 75.20 \n14. Harness AI - 74.80 \n15. Sonar Foundation Agent + Claude 4.5 Sonnet - 74.80 \n16. Lingxi-v1.5_claude-4-sonnet-20250514 - 74.60 \n17. JoyCode + Claude 4 Sonnet + GPT-4.1 - 74.60 \n18. Refact.ai Agent + Claude 4 Sonnet + o4-mini - 74.40 \n19. Prometheus-v1.2.1 + GPT-5 - 74.40 \n20. mini-SWE-agent + Claude 4.5 Opus medium (20251101) - 74.40 \n\n#ai #LLM #LiveBench #SWE-Bench",
"sig": "0251d2694a6e584150b1c17d541ef227e3073932170990134418e56eff3e1bd20d98ac0a49f618bf8f55a70fda7b6a18fcd4a7d3e538aaae9456687712742ac4"
}