
Anthropic FellowsがAI安全研究の審査用ベンチマークTASTEを開発。モデルが専門家と一致するのは60%のみ。
人間同士の一致率は約77%。
AI審査役はまだ信頼できないことを示す。
何が起きたか
Anthropic Fellowsが92組のAI安全研究提案からなるベンチマーク「TASTE」を開発。専門家が優れた提案を選んだところ、モデルはその判断と一致したのは60%にとどまり、人間の一致率を下回った。
なぜ重要か
AI安全の進展には明確な正解が乏しい。信頼できるAI審査役があれば研究評価を低コストで行えるが、現行モデルは専門家の判断には及ばない。
注目点
TASTEは専門家の議論と強い自信を示すラベルを活用し、推定一致率77%を達成。将来のモデルはTASTEで改善する可能性があるが、現時点でその成果は報告されていない。
TASTEはAnthropic Fellows Programの一環として作られ、多くのAI安全研究の問いは検証可能な報酬で評価できないという課題に対応している。このベンチマークは提案のペアを用い、議論と自信度フィルタリングを通じて人間の高い一致率を目指す。モデルの60%という成績は、現行のAIモデルがこうした研究の審査役としてまだ信頼できないことを示す。専門家の判断が不可欠な領域で評価の自動化がいかに難しいかを浮き彫りにしている。今後の研究はモデルの判断力向上に焦点を当てる可能性があるが、本記事ではそのような成果は報告されていない。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
数十人の抗議者が木曜、オースティンのベンチャーキャピタル企業8VCの外に集まり、医療分野におけるパランティアのAI技術に抗議した

非営利の患者安全団体ECRIが、報告制度の対象を医療現場での人工知能関連の誤りにまで拡大している

看護師100人以上が8月27日、パロアルトのPalantir旧本社前で交通を遮断し、病院経営陣と当局者に同社との関係断絶を求めて抗議した

AIシステムが、ワシントン州東部で危険物輸送列車を大災害へ突入させかけたとTri-City Heraldが報じた

Palo Alto NetworksのUnit 42は、AIが防御の対応速度を超える速度でサイバー攻撃を可能にしていると警告

AI自動化の導入障壁は能力ではなく信頼だと論じる意見記事
