GLOSSARY
SWE-bench(AIコーディング性能の評価基準)
AIコーディングツールの精度を比較する際によく引用される代表的なベンチマークです。実在のソフトウェアプロジェクトで報告された不具合や機能要望を、AIがどれだけ正確に解決できるかを測定し、スコアが高いほど実際の開発課題を解決できる精度が高いとされます。ツール選びの一つの参考指標にはなりますが、スコアだけで自分の用途に合うかは判断できないため、実際に試してみることも重要です。
詳しい解説はコラム記事「AIコーディングツールの進化、数年前と比べて何が変わったか」へ →
