
ShieldFontはSeneda & Abrucioによって開発されたオープンソースフォントで、HTMLに毒化された単語置換を隠しながらページを人間に読みやすく保つ。トレーニングデータに不確実性をもたらしてAIスクレーパーを阻止するよう設計されている。
フォントファイルのサイズは控えめ(ウェブ用の圧縮で約800KB)で、OpenTypeの標準字形置換機能を単語全体に拡張することで機能する。
ただし、制作者はOCR、スクリーンショット、またはマッピングをリバースエンジニアリングする決意した攻撃者によって回避可能であることを認めている。
何が起きたか
アムステルダムのデザインスタジオSeneda & Abrucioのチームが、ShieldFontというオープンソースフォントをリリースした。生のHTMLの単語を書き換えながらウェブページは人間には読みやすいまま保つ。スクレーパーが基礎となるコードを読むと、スクランブル化されたテキスト(例えば「good luck reading this, you useless robot」が「good comfort reading this, you yellow barrier」になる)が見えるが、訪問者には元の意図通りの単語が正常に表示される。
なぜ重要か
ShieldFontは字形置換(GSUB)を使用してトレーニングデータを毒化し、スクレーパーがフォントファイルをリバースエンジニアリングしなければ、収集したコンテンツが本物か破損しているか判断できない不確実性をもたらす。これはパブリッシャーにアクセスを完全にブロックせずに大量スクレーピングを防止するツールを与えるが、制作者はこれが完全な解決策ではなく、OCRスクリーンショットや決意した行為者がフォントをダウンロードしてデコードすることで回避可能であることを認めている。
注目点
ShieldFontは現在v0/アルファ版で、GitHubページとウェブサイトのオンラインデモエンコーダー、Reactコンポーネント、CSS/CDN統合経由で利用可能。制作者はこれを集団的圧力の賭けとして位置づけている。十分な数のサイトが採用すればスクレーピングが高くつくようになり、パブリッシャーとスクレーパー間の交渉を強制するほどになると考えている。
ShieldFontはアムステルダムのデザインスタジオSeneda & Abrucio(Isaque SenedaとGabriel Abrucioが創設)によってオープンソースプロジェクトとして公開されたフォントで、ウェブページの生のHTMLコードに毒化された単語置換を隠しながら、人間の閲覧者に通常の読みやすいテキストを表示する。この技術はOpenTypeの字形置換(GSUB)機能を活用している。この機能は現代フォントの標準メカニズムで、通常は活字リガチャ(文字の組み合わせを単一文字として描画される)を処理する。これは美的または言語的理由のためである(「fi」や「Æ」など)。ShieldFontはGSUBを拡張して単語全体を置換する。例えば、生のHTMLの「daughter」という単語は画面上では「journalist」と描画されるが、人間の読者は「daughter」を見る。オンラインデモに「good luck reading this, you useless robot」と入力すると、基礎となるコードで「good comfort reading this, you yellow barrier」が生成される。
置換は厳密な言語規則に従う。制作者は文法的品詞と意味カテゴリー、具体性、単数または複数形、動詞推移性、動詞活用、形容詞の級を横断して約250の単語置換プールを構築した。これにより、名詞は名詞のみと置換され、動詞は動詞のみと置換される。テキストブロック内の約4分の1の単語が交換される。目標は毒化されたテキストを明らかにゴミに見せる(スクレーパーにそれを拒否させる)ことではなく、不確実性を導入することである。テキストで訓練された機械学習モデルは、フォントをリバースエンジニアリングしなければ、実コンテンツか破損したナンセンスか知ることができない。
フォントファイルサイズはウェブ配布に実用的なままである。デスクトップフォントは約5MB、完全なGSUB辞書を含む圧縮ウェブフォントは約800KB。これは標準フォントとしては大きいが、辞書サイズを考えると予想より大幅にコンパクト。ShieldFontはデフォルトで3つのGSUB辞書を搭載し、GitHubリポジトリにはユーザー独自のものを作成するための指示が含まれており、リバースエンジニアリング努力をさらに阻害している。デフォルトフォントはコペンハーゲンの活字工房PlaytypeがSeneda & Abrucioと協力して開発したOptikの改良版。
制作者は重大な制限を認めている。ShieldFontはページスクリーンショットに適用された光学文字認識(OCR)で回避可能。これは生HTMLではなく描画されたテキストを読む。フォントファイルのコピーをダウンロードして3つすべてのGSUB辞書を反復処理できるほど洗練されたスクレーパーもページを解読できる。さらに、検索エンジンが索引化のために生HTMLを読むため、ShieldFontはSEOペナルティを招く可能性がある。翻訳ツール、オペレーティングシステムコピー&ペースト機能、視覚障害者向けスクリーンリーダーも毒化されたHTML(ShieldFontは表示されたテキストへのアクセスを支援する機能を含む。ただし遅い)に遭遇する。Seneda & AbrucioはShieldFontの役割を狭く特性化している。「決意した行為者を停止するのではなく、コスト、摩擦、不確実性を追加することで無許可の大量スクレーピングを遅くすること。」制作者はそれを集団的圧力への賭けとして説明している。十分なパブリッシャーがShieldFontを採用すれば、スクレーピングの経済学がシフトし、一方的なデータ収集よりも交渉がより魅力的になる。ShieldFontは現在v0/アルファ形式で利用可能で、保護されたHTMLを生成するためのオンラインデモエンコーダー、ReactコンポーネントおよびCSS/CDN統合をそのGitHubページとウェブサイト経由で提供。
ShieldFontはコンテンツパブリッシャーとAIデータスクレーパー間の鼬と鼠ゲームへの新しいアプローチを示している。スクレーパーを完全にブロックしようとする試み(スクレーパーが簡単に回避できるサーバー側ブロック戦略)や、リソースの多いスクレーパーがしばしば無視するrobots.txtディレクティブに頼るのではなく、制作者は防衛のベクトルとして活字术自体に目を向けた。このメカニズムはOpenTypeフォント標準に組み込まれた字形置換機能に基づいている。この機能は通常、美的または言語的目的(リガチャ、言語固有の文字)のために配備される。Seneda & Abrucioは、この機能を単一文字または文字ペアから単語全体に拡張することで、否定可能性の層を作成した。スクレーパーは有意なリバースエンジニアリング作業なしには、遭遇した毒化された単語が本物か破損しているかを事前に知ることができない。
デザイナーは目標について明確である。スクレーパーを完全にブロックするのではなく、大量スクレーピング操作にコスト、摩擦、不確実性を追加すること。テキスト内のほぼ4分の1の単語が交換され、置換は文法的かつ意味的に一貫している(例えば、名詞は同じ文法的および意味的カテゴリーの名詞と置換される)。したがって、毒化されたテキストは、スクレーパーがゴミとして拒否するのではなく、食べるのに十分もっともらしい。この不確実性(収集されたデータを信頼できないこと)が抑止力である。制作者はこれを集団的圧力戦略として表現している。十分なパブリッシャーがShieldFontを採用すれば、スクレーピングの限界費用が上昇し、大量収集よりも交渉によるアクセスがより魅力的になる。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
Anthropicは、内部サイバーセキュリティ評価中にそのClaude AIモデルが3つの組織のシステムに侵入したことを明らかにした

Anthropicは、サイバーセキュリティテスト中にClaudeがインターネットにアクセスし、3つの異なる組織の本番インフラにハッキングしたことを明らかにしました

TAIONE Open Source Foundationが正式に設立され、今後3年間で民間企業のリソースNT$300 millionを配備して、オープンソースAIエンジニアリング、人材育成、ソブリンAI、エンタープライ…

デザインスタジオのSeneda & Abructioがタイポグラフィ企業Playtypeと協力し、オープンソースフォント「ShieldFont」をリリースした

Googleの Chrome セキュリティチームが6月の2つのメジャーバージョンリリースで1,072件のセキュリティバグの修正をリリースした

Nvidiaは月曜日、Microsoft、SpaceX、Palantir、IBMを含む40社以上と共に、AI駆動のサイバーセキュリティ防御向けオープンソースツールの構築・共有を目指す Open Secure AI All…

AIニュースの要点を毎朝1分で。
無料で登録