Content keyword · Concept
ベンチマーク
AIモデルやシステムの能力を共通条件で測定・比較する評価方法。
- 系統
- 用語
- 実践記事
- 0件
- ニュース
- 25件
Practice
実践記事
ベンチマークを仕事でどう使うか、実際に試した記事です。
News
ニュース
ベンチマークに関するニュースを、新しい順に確認できます。
AIは人間のように「考える」のか。知能の測り方
Quanta Magazine
コンピューター科学者のメラニー・ミッチェルが、AIは人間のように「思考」も「推論」もしていないと指摘し、機械の認知を測るより良い方法を模索すべきだと語る。知能の定義を問い直す示唆に富んだインタビュー。
AIエージェント経営テスト、500日で利益残せたのは3モデルのみ
THE DECODER
プリンストン大の研究チームが開発したCEO-Benchで、AIエージェントに500日間のスタートアップ経営をシミュレートさせたところ、ほとんどのモデルが破産。生き残ったのは3モデルのみで、単純なルールベースの戦略が最も優秀だった。
厳密な数学検定で人間がAIを上回ったとの結果
Nature Technology
高度な厳密性が求められる数学検定で、人間がAIモデルを上回る成績を出したとする実証研究が報じられた。AIが数学領域で人間を凌駕するという楽観論への反証であり、推論の厳密性と検証可能性が依然として人間側に残る競争領域だと示唆している。
AnthropicがClaude Opus 4.8公開——主要指標でGPT-5.5を上回る
Anthropic
Anthropic は5月28日、新フラッグシップモデル Claude Opus 4.8 を公開した。コーディングや金融分析などの標準評価で前モデルを上回り、多くのベンチマークで GPT-5.5 を超えたとする。改善幅は「控えめだが実感できる水準」とされ、誤りを認める「正直さ」と複数サブエージェントを束ねる新ツール Dynamic Workflows を備える。
報道: [THE DECODER](https://the-decoder.com/anthropic-ships-claude-opus-4-8-as-a-modest-but-tangible-improvement-that-tops-gpt-5-5-in-most-benchmarks/)