【Claude Code のモデル比較をテレメトリ×LLM-as-a-Judge で客観化してみた】
Claude Code の3モデル(fable / opus / sonnet)を3タスク×2試行のヘッドレス実験で比較し、テレメトリの効率指標と LLM-as-a-Judge による品質採点を掛け合わせて評価しました。最安・最少手数だったモデルが品質採点では最下位になった実例から、「効率指標単独ではモデル評価を誤る」ことを実証します。
https://dev.classmethod.jp/articles/compare-claude-code-models-telemetry-llm-judge/

