
何が起きたか
Sakana AIは10月9日、日本仕様のLLM「Sakana Namazu」が、医療AI企業Irisの医師向けエビデンス検索ツール「Evidence Finder」に採用されたと発表した。
なぜ重要か
Irisの検索・検証アルゴリズムとSakana Namazuを組み合わせ、医師向けに論文を選定・比較・統合して回答を生成する部分を担う。
誰に効くかIrisのEvidence Finderを使う医師はSakana Namazuが作成した回答を得られるようになり、同様のエビデンスツールを手がける医療AIの製品チームは、Irisのモデル選定を参考にする可能性がある。
こういう要約が、毎朝あなたのメールに届きます。
今回の採用は単純な調達ではなく、評価プロセスを経て決まった。Irisによると、Sakana Namazuを使ったEvidence Finderの評価モデルは、2月の第120回医師国家試験で96.4%の正答率を記録し、経済産業省のGENIACに指定された国内基盤モデルの中で最高スコアだったという。
Sakana AIによると、この試験結果に加え、実用的な有用性が認められた実際の回答に対する定性評価を踏まえ、Evidence FinderへのSakana Namazu採用が決まった。
役割分担は明確だ。医師の質問に対して関連論文を選定・比較・統合するのはIrisの検索・検証アルゴリズムで、Sakana Namazuが回答を生成する。医療AI企業Irisが提供するEvidence Finderは引用を表示し、AIが引用した論文の実在を自動で確認する「Verify」機能を備える。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
AnthropicはClaudeモデル、オンサイトエンジニア、脅威リサーチを提供するAnthropic Cyber Missionを始動

OpenAIのDecisions APIでgpt-6-lunaを使い「おもちゃが見えるか」「左か中央か右か」に答えるパイプラインを構築しSO-101アームを動かした

Claude Codeを4時間おきに無人起動し、各作業場のgit statusで未commitの変更を持ち主別に分け、完成ならcommit、壊れていればgit restoreで戻す

SKILL.mdは6月17日から2,116バイト(1.2.0)のまま更新されず、20:05のTelegramリクエストで20:08までに1.3.0、4,513バイトが生成された

OpenAIはロシアの「Dark Clark」作戦関与アカウントを無効化と発表

Opperは、JevやGPT-6 Luna Decisionsを含む6つのAIモデルをパックマンで各100回プレイさせ、スコア等で順位付けするベンチマーク「jevman」を公開した
