多言語・少数言語の視点から見た偽情報対策の空白 ―DCU「MULTIDISIN」報告書

多言語・少数言語の視点から見た偽情報対策の空白 ―DCU「MULTIDISIN」報告書 偽情報の拡散

 ダブリン・シティ大学(DCU)応用言語・異文化研究学部のイケル・エルドシア(Iker Erdocia)氏とデレク・ウォルシュ(Derek Walsh)氏は2026年7月、多言語および少数言語の観点から偽情報・誤情報を検証する報告書「Understanding and Countering Dis/Misinformation from a Multilingual and Minority Language Perspective」を発表した。本報告書はResearch Ireland New Foundations助成金(学際研究ネットワーキング助成)により実施されたMULTIDISINプロジェクトの成果であり、DCU未来メディア・民主主義・社会研究所(FuJo)およびADAPTセンターの支援を受けている。プロジェクトは政策提言を明示的な目的として設計されており、欧州連合(EU)政策担当者、アイルランド政策担当者、プラットフォーム事業者・AI開発者に対する11項目の具体的勧告を含む政策志向の報告書である点に留意する必要がある。

 報告書は、偽情報が言語間で均等に経験されているわけではないという命題を出発点とする。世界に7,000以上存在する生活言語のうち、およそ90%が低リソース言語に分類され、AIシステムの訓練データにおいて意味のある代表性を持つのは約100言語に過ぎない。オンラインコンテンツの大部分は英語を筆頭とする少数の優勢言語で生産されており、その結果として、プラットフォームのコンテンツモデレーション、ファクトチェック基盤、言語技術によって最も保護されていない言語こそが、虚偽・操作的コンテンツが最も長く検出・訂正されずに流通する言語となる構造的な「保護の格差」が生じていると報告書は指摘する。

背景:2つの転換点

 報告書はまず、誤情報と偽情報の概念区分を確認する。誤情報は害意なく共有される虚偽・誤解を招くコンテンツを指し、偽情報は政治的・金銭的・社会的目的のために意図的に作成・拡散される虚偽・誤解を招くコンテンツを指す。この区別は政策上重要である一方、実際には両者が同時に流通するため、報告書はイーリーン・カロティ(Eileen Culloty)とジェーン・サイター(Jane Suiter)による2021年の整理に依拠し、両者を「偽/誤情報」として一括して扱う。

 報告書は現在の局面を規定する2つの発展を挙げる。第一は生成AIの登場である。大規模言語モデル(LLM)は無視できるコストでコンテンツの作成・翻訳・現地化・個人化を可能にし、マルチモーダルシステムは画像・音声・動画にまで対象を広げている。この技術が偽情報の力学をどれだけ変えるかについて研究者の見解は分かれており、供給が偽情報の律速要因になったことは一度もないとして懸念を誇張とみなす立場(サイモン、アルタイ、メルシエによる2023年の分析)がある一方、操作の規模において具体的な新しい能力が生じたと論じる立場(チェンとシューによる2024年の研究、欧州デジタルメディア観測所(EDMO)によるボンチェバらの2024年白書)もある。ただし、この技術が言語間の力関係を不均等に変化させ、一部の主体を強化し他を弱体化させるという点については異論がない。第二の発展は規制面である。EUのデジタルサービス法(DSA)とAI法は、超大規模プラットフォームおよびAI提供者に初めて拘束力のある義務を課した。ただし、その義務が少数言語コミュニティにとってどれだけの価値を持つかは、実施と執行のあり方に完全に依存すると報告書は強調する。

なぜ多言語・少数言語の視点が重要か

 報告書はまず、コンテンツモデレーションにおける言語間格差を指摘する。プロジェクトのウェビナーシリーズで報告された数値によれば、ある大手動画プラットフォームは15,000人を超える英語コンテンツ担当モデレーターを雇用する一方、一部のEU公用語については一桁台、アイルランド語についてはゼロという水準にとどまる。流出したフェイスブック内部文書(Facebook Papers)では、偽情報分類予算のおよそ87%が英語コンテンツに割り当てられていたことが示されたが、同プラットフォームの利用者に占める英語母語話者の割合はごく少数にすぎない。優勢言語のデータで調整された自動モデレーションは、有害コンテンツを見逃す過小執行と、正当な少数言語コンテンツを誤って削除する過剰執行という二重のリスクを生む。

 第二に、言語はアイデンティティを標識する機能を持つがゆえに、偽情報が組織化される軸そのものとなる。プロジェクトが参照した北大西洋条約機構(NATO)支援のバルセロナ会議の事例やウェビナーの報告は、ウクライナ・モルドバにおけるロシア語話者を標的としたロシア語偽情報、スペイン語とカタルーニャ語の間で一貫性を欠くモデレーション(アイラとセティーナ・プレスエルによる2024年研究)、新型コロナウイルス感染症流行下で信頼できる健康情報から取り残されたインドのサンタル語話者コミュニティ、そしてアイルランドにおいてナショナル・アイデンティティの排他的定義に奉仕する形で展開されたアイルランド語をめぐる偽情報を挙げる。欧州対外行動庁(EEAS)による外国情報操作・干渉(FIMI)監視は2024年以降、言語を含むアイデンティティに基づく標的化を、個別対応を要する脅威カテゴリーとして扱い始めている。

 第三に、民主的プロセスへの影響として、プロジェクトのウェビナーで議論された2024年インド総選挙が挙げられる。政治指導者のAI生成ディープフェイクが複数言語で数百ものWhatsAppグループを通じて数百万人の有権者に届いた事例であり、検出資源はほとんど存在しなかった。欧州では15か国以上にまたがる選挙監視の実務から、偽情報の語り(ナラティブ)は国境と言語を越えて反復する一方、監視の関心は各国の優勢言語に集中していることが明らかになっている。メキシコの数十に及ぶ先住民言語とその欧州における対応言語は監視対象外に置かれており、監視されない言語における選挙操作は、その影響が可視化されるまで存在しないものとして扱われる。

 第四に、報告書は言語技術における「マタイ効果」を指摘する。市場のインセンティブは、すでにデータを持つ言語により多くのデータ・優れたモデル・投資をもたらし、持たない言語にはその逆をもたらす。この構造的不平等はブラジ、アナスタソプロス、ヌービグによる2022年の研究で定量化されている。LLMはこの状況を継承・増幅する。ベンチマークは英語で設計され、安全性訓練は英語中心に偏り、性能は高リソース言語の中核圏を離れると急激に低下する。プロジェクト初回ウェビナーで示された文献レビューによれば、低リソース言語におけるLLM性能を評価した研究の大半が、固有名詞・地名・文化的概念に関する幻覚(ハルシネーション)の増加と偽情報検出精度の低下を報告しており、安全性研究では有害なプロンプトを低リソース言語に翻訳するだけでGPT-4の安全策の大半を回避できることが示されている(ヨン、メンギーニ、バッハによる2023年の研究)。批評家はこの現象を「デジタル植民地主義」の一形態と呼んでいる。

アイルランドの二重露出

 報告書は、アイルランドを問題の両側面を同時に経験する事例として詳述する。英語圏国家であるアイルランドは、米国・英国という規模の大きい情報圏から翻訳の遅延なしに偽情報を輸入する。具体例として、2018年の人工妊娠中絶に関する国民投票における輸入型の反対キャンペーン広告、「大置換」陰謀論がアイルランド版として「大農地化」という形で局地化された事例、2023年ダブリン暴動時にアイルランド人利用者になりすました外国運営アカウントが挙げられる。

 一方、アイルランド語自体は特異な位置を占める。アイルランド語話者はほぼ全員が英語とのバイリンガルであり、アイルランド語のみを使う孤立した聴衆が過激化の対象になるとは言い難く、アイルランド語そのものによる偽情報はアイルランド語をめぐる偽情報より少ない。後者の例として、ゲールタハト(アイルランド語公用地域)が「侵食されている」とする捏造された証拠や、言語が意図的に軽視されているという主張が、アイデンティティ対立を煽るために作られている。同時に、複数言語にまたがる無差別配信型の操作がアイルランド語にも偶発的に到達するようになっている。

 その典型例が親ロシア派の「プラウダ(Pravda)」ネットワークによるアイルランド語ニュースサイトである。アイルランドのオンラインメディア「ザ・ジャーナル(The Journal)」のファクトチェッカーと、EDMOアイルランド拠点の関係者が、数十言語にまたがる協調運営の一部としてこのサイトを特定した(クブシュによる2025年の調査)。この発見は生成AI時代の2つの現実を示している。自動翻訳によって非常に小規模な言語さえも情報操作に組み込むことが事実上無償で可能になっていること、そしてこのようなアイルランド語での作戦を体系的に検出する監視体制がそもそも存在しなかったことである。サイトの発見は、構造化された監視ではなく、ファクトチェッカー間の非公式な情報交換を通じてもたらされた。

 ポーランド語話者コミュニティは別の種類の格差に直面する。アイルランド語を保護する制定法上の公的情報提供義務は、ポーランド語のような大規模なコミュニティ言語には及ばない。ザ・ジャーナルが実施した公益情報プロジェクトでは、アイルランド在住のポーランド系第一世代の相当数が英語メディアと限定的にしか関わっておらず、アイルランドのニュースやファクトチェック情報源をほとんど認知していないことが判明した。同紙は解説記事をポーランド語に翻訳し、ポーランド語土曜学校を通じて配布し、生徒が家庭に持ち帰る形で伝達した。この取り組みはプロジェクト終了とともに終わっており、継続的な資金源が存在しないためである。アイルランドにおける公的情報提供義務はアイルランド語には適用されるが、話者数の多寡にかかわらずコミュニティ言語には及んでいない。

学際的知見:言語学・自然言語処理・ジャーナリズム

 言語学分野では、スペインで実施された10年に及ぶヘイトスピーチとフェイクニュースに関する研究プログラムが、プロジェクトのワークショップで報告された(フランシスコらによる2022年の研究)。批判的談話分析とAIを組み合わせたこの研究チームは、間接的に交流する利用者間の言語パターンと「深い関係性」の双方に基づくオープンアクセスの検出アルゴリズムを開発し、現在ではスペインおよびカタルーニャの警察とユーロポール(Europol)で利用されている。ドイツ語・英語・スペイン語・カタルーニャ語・バスク語という多言語データに対し、新型コロナウイルス感染症・ポピュリズム・気候変動という3つの事例研究で適用した結果、偽情報は圧倒的に意見の形をとり、しばしばニュース記事を伴って偽装されること、移民を「津波」「侵略」と呼ぶメタファーが最も頻出する欺瞞的戦略であること、ヘイトスピーチと偽情報が法的地位を理由に移民を標的として体系的に共起することが明らかになった。この知見から導かれる示唆は、欺瞞的戦略(メタファー、暗示、感情的訴え)が言語・文化に強く依存するため、英語で訓練された検出システムは他言語への転用性が低いという点である。

 自然言語処理分野では、インド工科大学パトナ校のアシフ・エクバル(Asif Ekbal)氏とカリンガ工科大学のリナ・クマリ(Rina Kumari)氏がプロジェクトウェビナーで報告した研究が紹介される。22の公用語を含む1,500以上の言語と広範なコードミキシング(複数言語の混在使用)を抱えるインドにおいて、新規性検出と感情認識を偽情報検出の補助タスクとして扱うマルチタスク・アーキテクチャを構築し、単一タスクのベースラインに対し7〜28%の精度向上を達成した(クマリらによる2022年の研究)。続く研究では、ヒンディー語・ベンガル語・タミル語にまたがる10,473件のマルチモーダルデータセットを構築し、多言語エンコーダー・対照学習・ウェブ検索による背景知識を用いて、本物の画像が偽の文脈で再利用されるケースを検出した。

 シェフィールド大学のカロリーナ・スカートン(Carolina Scarton)氏が発表したウェビナーは、LLMの二面性を示す。訓練データに存在しない文字体系を持つ言語では従来の微調整はほとんど機能しないが、高リソース言語への単語・文レベルの簡易な辞書的対応付けを併用したゼロショット・プロンプティングにより、ティグリニャ語のような専用ツールを持たない言語でも実用的な分類精度が得られた。この手法は訓練コーパスではなく辞書のみを必要とするため、スタンス検出や説得技術分類といった偽情報関連タスクに原理的に転用可能であり、フランス通信社(AFP)を含むファクトチェック機関が数万人規模の実務者が使うブラウザ拡張機能に学術的検出ツールを組み込む事例がすでに存在する。

 一方で同じウェビナーは、LLMが偽情報の「敵」となる側面も報告している。商用3モデル・オープンウェイト5モデルの計8モデルに対し、英語・ロシア語・ポルトガル語・ヒンディー語で国・世代・政治的立場に応じて個人化された偽ニュース記事の生成を66,000回超要求した大規模評価では、全モデルが高い割合で偽情報を生成し、最も許容度の高いモデルはほぼすべての要求に応じて最も説得力のある出力を生成し、最も安全性に配慮したモデルでも約半数の要求に応じた。個人化された出力は固有名詞や内集団への帰属を示す言語表現をより多く含んでおり、これらはまさに偽情報を説得力あるものにする特徴である。安全フィルターが低リソース言語で最も脆弱であるという知見と組み合わせると、生成面の脅威は非対称であり、最も保護されていないコミュニティほど狙いやすいということになる。

 ジャーナリズム分野では、アイルランド初のオンライン専業ニュースメディアであるザ・ジャーナルのスーザン・デイリー(Susan Daly)氏が、同社ファクトチェック部門の10年間の変遷をウェビナーで報告した。2016年当時は政治家がレガシー放送メディアで行った主張を検証していたが、現在では大半の主張がデジタルプラットフォーム上で発信されるようになり、それらをふるい分ける作業自体が検証作業以上の労力を要するようになっている。ファクトチェックへの信頼そのものが意図的な攻撃の対象となっており、パンデミック後のニュース回避傾向は訂正情報の受け手を縮小させている。同部門の対応は構造的なものであり、検証スキルを編集部全体に組み込むこと、訂正よりも事前防止(プレバンキング)を優先すること、説明記事の公開データベースを構築すること、読者からの質問を混乱の所在を示す一次シグナルとして扱うことを含む。

 アイルランドの情報環境は、地理ではなく言語が実質的な境界であることを示す。米国発の語りはそのまま即座に到達し、英国の主体はアイルランドの出来事を自らの文化戦争の論拠として利用する。スペインのファクトチェック機関マルディータ(Maldita)によるX(旧Twitter)のコミュニティノートに関する研究では、ザ・ジャーナルが世界で最も引用されたファクトチェック情報源の一つとして、その規模とアイルランドという枠を超えて不釣り合いに多く登場しており、これは英語圏以外のコミュニティがいかに過小に扱われているかを示す代理指標となっている。

規制の現状と欠落

 政治学・規制分野では、DSA第34条・第35条が超大規模プラットフォームに対しシステミックリスクの評価・低減義務を課し、第40条が研究者によるデータアクセスを保障している。2025年2月に強化された偽情報に関する行動規範がDSA枠組みに統合されたことで、署名プラットフォームにとって同規範の遵守がリスク低減措置として適切とみなされうるようになった。しかし、プラットフォームのコンプライアンスを評価するロドリゴ・セティーナ(Rodrigo Cetina)氏を含むワークショップ参加者は、これまでに公表されたリスク評価が言語別に分類されることは稀であり、透明性報告書の大半が非優勢言語に言及すらせず、研究者データアクセスが圧倒的に英語に偏って行使されていると指摘した。AI法についても、生成モデルに対する義務は現状では主に透明性(利用者が機械と対話していることを知る権利)にとどまり、ワークショップ参加者はこれを偽情報問題への対応として不十分と評価した。

 規制の実例として、報告書はエクアドル司法府向けに策定されたガイドラインを挙げる。同ガイドラインは、キチュワ語・シュアール語話者が関与する裁判手続きにおけるAI利用について、恒久的禁止ではなく、モデルがスペイン語と同等の信頼性を各言語で実証的に達成した場合に解除される認証条件としてのモラトリアムを設定している。技術的平等性(利用対象となる全員に等しく機能すること)と多層的透明性(提供者は言語別の訓練データの限界を開示し、裁判所はAIが関与した判断を開示すること)を組み合わせたこの枠組みは、少数言語公共サービスからAIを一律に排除するのでも、性能低下を黙認するのでもなく、認証された妥当性を条件として展開を許可するという、欧州の議論にも直接応用可能なモデルを提示する。

 アイルランド国内については、2025年4月に国家対策戦略(National Counter Disinformation Strategy)が政府によって公表されたが、ワークショップ参加者の評価では、その基盤となる持続可能で資金を伴う研究能力が存在しない限り、戦略は依拠すべき根拠を欠くままになるとされる。アイルランドは関係プラットフォームの多くの欧州本部を有しており、規制機関コイミシューン・ナ・メアン(Coimisiún na Meán)のDSA執行における重要性はEU全体に及ぶにもかかわらず、英語についてすら、ましてやアイルランド語について、アイルランド国内の偽情報を体系的に監視する仕組みは存在しない。

提言と今後の研究課題

 報告書は欧州・アイルランド・研究・プラットフォームの4つの対象層に向けて計11項目の勧告を提示する。

対象主な勧告内容
EU政策担当者・規制当局DSAにおける言語別に分解された透明性報告の義務化、リスクの規模ではなく害の程度に応じたモデレーション資源配分、FIMI監視における言語標的化の位置づけ強化、AI法における多言語安全性評価の実装
アイルランド政策担当者偽情報監視のための恒久的・独立した研究基盤への資金投入、英語・アイルランド語を超えたコミュニティ言語への公的情報提供拡大、アイルランド語コーパス・検出ベンチマーク等のデータ基盤への投資
研究者・助成機関・高等教育機関低リソース言語向け多言語ベンチマークとコミュニティ管理型データセットの構築、社会言語学・民族誌学・ジャーナリズムを組み合わせた学際的研究設計、短期プロジェクトを超えた継続的な研究能力の維持
プラットフォーム・AI開発者言語別モデレーションデータの公表、非公用語における文化的知見を持つモデレーターの増員、低リソース言語への安全性訓練・評価の拡張、影響を受ける言語コミュニティとの共同設計

 今後の研究課題として、報告書はアイルランド国内で流通する偽情報の量・発信源・標的を英語・アイルランド語・主要コミュニティ言語別に把握する基礎調査を、アイルランド政策にとって最も基盤的な単一のプロジェクトと位置づける。これに加え、検証済みの真偽情報コーパスに基づくアイルランド語検出ベンチマークの構築、多言語微調整・辞書拡張ゼロショット・言語横断的根拠検索といった転移学習手法のアイルランド語への体系的評価、機械生成テキスト検出の少数言語への拡張、閉鎖型メッセージング(WhatsApp、Telegramなど)における倫理的な調査手法の開発、言語別のDSA・行動規範遵守状況の縦断的監査、そしてアイルランド語・ウェールズ語・バスク語・カタルーニャ語等を比較するレジリエンス研究を今後の優先課題として挙げている。

 報告書全体を貫く論点は、言語をデジタル規制における分析単位として位置づけるべきだという主張である。DSAのリスク評価、行動規範、AI法の評価義務、FIMI監視はいずれも少数言語コミュニティを保護しうる潜在力を持つが、現状ではいずれも言語別の報告・資源配分・執行を体系的に求めていない。報告書は、これは是正可能な設計上の選択であり、その是正の費用は既に義務の対象となっているプラットフォーム側が負うべきものだと結論づける。

コメント

タイトルとURLをコピーしました