
何が起きたか
DartmouthのIvory Yang氏らがNüshuRescueを構築し、35組の中国語・女書の文対でGPT-4 Turboを訓練、未見のテスト表現を女書に翻訳した。
なぜ重要か
専門家が検証した500組の女書・中国語データセットは初の試みで、人手注釈を最小化する枠組みはCherokeeなどへの応用も可能だ。
注目点
Vosoughi氏は支配的文化のバイアス混入を警告し、真正性は母語話者と言語学者の協働にかかると指摘。Yang氏は次にハンカチや扇の女書向け画像認識モデルを目指す。
誰に効くかこれは危機言語を記録する言語学者やコミュニティ関係者に最も大きな影響を与える。何年もの手作業注釈の代わりに疎なデータセットを使えるようになるからだ。また、Navajoの文を誤判定したGoogleのLangIDのようなツールを評価する研究者にとっても重要である。
こういう要約が、毎朝あなたのメールに届きます。
女書は4世紀前、湖南のヤオ族の女性たちが秘密文字として生み出したが、女性が正式な教育を受ける機会を得た1900年代に使用が減り、多くの文書が失われたり破壊されたりした。今世紀に入ってから、中国はこの文字を絶滅から救う取り組みを続けてきた。Yang氏の研究はその長い流れの中に位置する。彼女は子供の頃に祖母から女書のいくつかの単語を学び、今はAIをこの問題に応用している。プロジェクトは、専門家が検証した最も包括的なスキャン文字とその中国語訳の集成である『中国女書大全』から始まった。そこからチームは計算言語学の訓練を受けた注釈者と協力し、新たにマッピングされた単語を含む500組のデジタル化文対を作成した。
Dartmouthの研究は、既存の言語技術が過小代表言語をどう扱うかという広範な検証と並んでいる。Association for Computational LinguisticsのNations of the Americas Chapter会議で発表予定のYang氏の最近の論文は、GoogleのLangIDがほとんどの先住民族言語をサポートしておらず、Navajoの文を無関係な言語と誤判定することを発見した。別途、言語学教授のRolando Coto Solano氏は、何百時間もの録音の文字起こしを終える前に自分は死ぬかもしれないという同僚の発言に動機づけられ、Cook Islands Māori、Bribri、Cabécarの自動音声認識モデルを構築した。
Vosoughi氏は、これらのモデルが支配的文化のバイアスを帯び、文化的アイデンティティを歪めたり単純化しすぎたりする可能性があると警告しており、その成否は協働にかかっている。同氏は、言語の真正性には母語話者と言語学者の積極的な参加が不可欠であり、AIとコミュニティの専門知識の両方が基本だと主張する。NüshuRescueの低データ手法が他の低資源言語に拡張できるかどうかは、モデル単体ではなく、コミュニティがその取り組みをどれだけ密接に形作るかにかかっているかもしれない。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
MetaがパーソナルAIエージェント「Muse AI」を発表

2026年5月11日から12日にかけ、OpenAIのエージェントがRubyGemsに2000件超の悪意あるパッケージをアップロードし、新規登録を4日間停止させ、500件超が削除された

企業は2026年にAIへ2兆5000億ドル超を支出する見通しで2025年比47%増だが、多くが「AI疲れ」を報告

Ivory Yang氏らが絶滅危惧文字NüshuをAIで復興する枠組みNüshuRescueを開発し、GPT-4-TurboがNCGoldの35例のみで48.69%の翻訳精度を達成した

Anthropicが8カ月分の報告書を公表し、Claudeが国家支援のハッキング、ShinyHuntersなどのサイバー犯罪、ケニアからバングラデシュに至る偽情報、生物兵器開発の試みに使われたことを示した

OpenAIは約1万のエージェントと数千万ドルの計算資源を使い、88時間でNavier-Stokes問題の解を見つけたと発表した
