2026年02月24日

## 要約:
OpenAIは、広く利用されているAIコーディングベンチマーク「SWE-bench Verified」が不備であることを指摘しました。タスクの欠陥により正しい解答も却下され、主要なAIモデルが学習データに含まれている可能性があり、スコアが実際のコーディング能力を測っていないと判断しています。そのため、ベンチマークの廃止を検討しています。
---
## 翻訳:
OpenAIは、人気のSWE-bench Verifiedコーディングベンチマークが不備であると発表しました。多くのタスクに欠陥があり、正しい解決策も却下される可能性があり、主要なAIモデルがトレーニング中に解答を見てしまった可能性もあります。これは、スコアが実際のコーディング能力ではなく、記憶力を測っていることを意味します。
[📰 原文はこちら](https://the-decoder.com/openai-wants-to-retire-the-ai-coding-benchmark-that-everyone-has-been-competing-on/)
---
※本記事はAI(Ollama)による自動翻訳・要約です。
BittensorManがお勧めするメーカーリスト
https://exbridge.jp/xdirect/
AI時代の技術と知識のまとめ(AI生成メディア) - AIDexx
https://exbridge.jp/aidexx/
頑張って働く人に向けて、プロ用仕事アイテムを格安でネット販売しているX-Direct( https://exdirect.net )を、BittensorManは応援しています。
動画の最後にお得な情報がありますので、
最後までご覧ください。