PR

AI評価

本ページはアフィリエイト広告を利用しています
AI・サービス

OpenAIが生命科学向けAI評価基準「LifeSciBench」を公開——実務に即したベンチマークの狙い

OpenAIは2026年6月17日、AIが生命科学研究者にとってどれだけ実際に役立つかを測定するベンチマークテスト「LifeSciBench」を発表しました。従来の科学系ベンチマークと異なり、実際の研究運用に沿った評価が可能な設計とされてお...
AI・サービス

AIのカンニングを防ぐコーディング性能測定「DeepSWE」登場

ソフトウェア開発へのコーディングAI活用が一般化する中、既存のAIコーディングベンチマークが抱える欠点を改善した新たなベンチマーク「DeepSWE」が登場しました。近年のコーディングAIは既存ベンチマークのテストケースや解答パターンを学習デ...