しんたろーしんたろーのITアカデミー

#SWE-bench の記事一覧

3

SWE-Bench Proの正解率80%は信用できるのか。AI開発者が判断プロセスを監査すべき理由
·41 views·しんたろー

SWE-Bench Proの正解率80%は信用できるのか。AI開発者が判断プロセスを監査すべき理由

爆速で進化したAIコーディング能力の「不都合な真実」 AIのコーディング能力を測る指標として、SWE-Bench Proが注目されている。 わずか8ヶ月で正解率は23.3%から80.3%へ上昇した。 この数字はエンジニア不要論を加速させる。 最新の調査でこの数字の裏にあるノイズが判明した。 評価タスクの約30%に不備がある。

なぜOpenAIは計算資源を10GWまで倍増させたのか。開発者が自社評価パイプラインを構築すべき理由
·130 views·しんたろー

なぜOpenAIは計算資源を10GWまで倍増させたのか。開発者が自社評価パイプラインを構築すべき理由

10GWという数字が突きつけるAI開発の物理的限界 10GW(ギガワット)。一般的な原発10基分、数百万世帯の電力を賄うエネルギー量だ。 AI開発の最前線では計算資源の拡張が続いている。2025年初頭の目標を1年余りで塗り替え、直近90日間で3GWものキャパシティが上積みされた。 巨大な脳が作られる裏側で、既存のベンチマークが崩壊している。

Claude Codeがセッション管理を強化。記憶保持でAI開発の無駄が消える理由
·137 views·しんたろー

Claude Codeがセッション管理を強化。記憶保持でAI開発の無駄が消える理由

AIが「毎朝記憶を消される」状態で働いていた AIエージェントにバグを直させると、同じ修正を繰り返す。 各リトライがステートレスだからだ。 ある検証では、170回のAI呼び出しのうち100回——59%——が同じ壁にぶつかるだけの無駄なリトライだった。 合計23時間のうち約13時間が「AIが同じ間違いを繰り返す時間」だ。 Claude Codeの最新アップデートは、この構造的な問題に対応している。