
Mistral AIが形式検証に特化したオープンソースモデル「Leanstral 1.5」を公開しました。
miniF2Fで100%、Putnam競技会の672問中587問を正解し、オープンソースモデルとして複数のベンチマークで最高性能です。
数学の形式証明だけでなく、実際のコード検査でも未発見のバグを検出する能力があり、HuggingFaceと無料APIで誰でも利用できます。
何が起きたか
Mistral AIが、数学証明とソフトウェアの正確性を形式的に検証する「Leanstral 1.5」をApache 2.0ライセンスで無料公開しました。miniF2Fベンチマークで100%、Putnam数学競技会の672問中587問を解く性能を持っています。
なぜ重要か
オープンソースモデルとしてPutnamBench、FATE-H、FATE-Xで最高性能を達成し、閉鎖モデルのAleph Proverを除いて他を上回っています。実際のテストではRustライブラリvarintegerのオーバーフロー脆弱性を含む、これまで見つかっていなかった5つのバグを検出し、数学だけでなくコード検証でも実用性があることが示されました。
注目点
HuggingFaceと無料APIを通じて利用可能です。訓練には中盤学習(mid-training)、教師あり微調整、強化学習が用いられました。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
イスラエルの新興企業DataAgent Ltd.は、顧客のKubernetesクラスター内の本番障害を修復するプラットフォームを発表し、1000万ドルのプレシード資金を調達した
SK海力士はSEMICON Taiwan 2026で、ベースダイに演算機能を組み込んだカスタムHBMの構想を発表

桃園はAIデータセンター(AIDC)の北部ハブとして自らを位置づけ、大潭地区とLNG冷却の利点を挙げている

米国防総省は8月31日、AIプラットフォーム「GenAI.mil」にOpenAIのChatGPTを軍事用にカスタマイズした「ChatGPT Mil」を導入したと発表した

エヌビディアの決算は注目に値する一方で退屈な内容となり、統合された世界を避ける姿勢が反映された

AnthropicがNvidia支援のクラウド事業者Lambdaと、$35bnのクラウドコンピューティング契約を結んだ
