パターンを読み込んでいます…
SWE-bench スイート
SWE-bench、SWE-bench Verified、SWE-bench Live を含むソフトウェアエンジニアリングのベンチマークスイート。例で比較対象として挙げられているモデルは、当時のベースラインです。
30秒でわかる概要
- 概要
- 人気リポジトリの実際の GitHub イシューを用いてコーディングエージェントを評価します。人手で検証したサブセットや毎月更新されるライブ版を備え、問題解決能力を測定します。
- 使いどころ
- 本物のソフトウェアエンジニアリング課題でエージェントの性能を比較したいとき、時系列で改善を追跡したいとき、あるいは学習データの汚染なしに問題を解けているか検証したいとき。
- 注意点
- 結果は、どのリポジトリやイシューの種類を含めるかに大きく左右されます。SWE-bench での成績が、自分たちのコードベースの流儀や技術スタックにそのまま当てはまるとは限りません。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
SWE-bench スイート: 概要
SWE-bench、SWE-bench Verified、SWE-bench Live を含むソフトウェアエンジニアリングのベンチマークスイート。例で比較対象として挙げられているモデルは、当時のベースラインです。
- Real GitHub issues from 12+ popular repositories
- Human-validated problem subset (SWE-bench Verified)
- Live benchmark updated monthly (SWE-bench Live)
- Multimodal variant with visual elements
- Contamination-free evaluation
- Industry standard for coding agents
エージェント評価フィールドガイドを受け取る
25のエージェント評価手法を1冊に凝縮:どのベンチマークが何を測るか、公開スコアが誤解を招くのはどんなときか、自分の失敗から評価を組み立てる方法。確認メールと一緒にリンクが届き、週刊The Agent Architectも購読できます。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (ICLR 2024)arXiv:2310.06770
- Introducing SWE-bench Verified - OpenAI (2024)
- swebench.com
このカタログを作ったエンジニアが担当
評価が見落としているものを可視化
エージェントの評価は実装よりも難しく、多くのテストは緑のまま本番だけがずれていきます。評価の仕組みを端から端まで点検します。いま測れているもの、まだ見えていないもの、そして現状のテストが素通りさせる劣化を洗い出します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで