AIの実力を測る最新の評価テスト「FrontierBench v0.1」で、Anthropicの新モデル「Claude Opus 5」が最大出力時に43.3%を記録し、OpenAIの最上位モデルGPT-5.6 Solの37.5%を上回って首位に立ちました。 Opus 5は7月24日に登場したばかりのモデルで、「最上位のFable 5に迫る性能を半額で」という位置づけ。作業の重さに応じてAIの”がんばり具合”を低・中・高から選べるのが特徴です。 ただしベンチマークはあくまで特定の能力を測るもので、実際の使い勝手は用途によって変わります。 数字だけを鵜呑みにせず、自分がよく使う作業で試してみるのが一番確実、というのが専門家の共通見解です。

出典: FrontierBench / Build Fast With AI