あまり知られていないAI手法は、プライバシーを脅かすことなく健康データをトレーニングできます

ジョン・ムーア|ゲッティ





2017年、Googleは静かに ブログ投稿を公開しました 機械学習への新しいアプローチについて。データを1か所に集中させる必要がある標準的な方法とは異なり、新しい方法では、複数のデバイスに分散された一連のデータソースから学習できます。この発明により、Googleは、Androidユーザーが送受信するすべてのメッセージについて、実際にメッセージを読んだり、携帯電話から削除したりすることなく、予測テキストモデルをトレーニングすることができました。

その巧妙さにもかかわらず、研究者がそれを呼んだように、連合学習は当時AIコミュニティ内でほとんど牽引力を獲得しませんでした。まったく新しい分野でのアプリケーションが見つかると、それは変化する準備ができています。プライバシーを第一に考えたアプローチは、今日の医療におけるAIの採用が直面している最大の障害に対する答えになる可能性があります。

患者データのプライバシーと社会へのデータの有用性の間には誤った二分法があります、とコンピューターサイエンスのMIT准教授であるRameshRaskarは言います。彼の研究は健康におけるAIに焦点を合わせています。人々は砂が足元で移動していることに気づいていません。そして、私たちが実際にプライバシーと実用性を同時に達成できるようになったことを認識しています。



過去10年間で、ディープラーニングの劇的な台頭により、数十の業界に驚くべき変革がもたらされました。これにより、自動運転車の追求が促進され、デバイスとのやり取りの方法が根本的に変わり、サイバーセキュリティへのアプローチが一新されました。しかし、ヘルスケアでは、病気の検出と診断の可能性を示す多くの研究にもかかわらず、実際の患者を支援するためのディープラーニングの使用の進歩は非常に遅いです。

現在の最先端のアルゴリズムでは、学習するために膨大な量のデータが必要です。ほとんどの場合、データが多いほど優れています。病院や研究機関は、有用であるほど大きく多様なデータのプールが必要な場合は、データの予約を組み合わせる必要があります。しかし、特に米国と英国では、機密性の高い医療情報の連なりをテクノロジー企業の手に集中させるというアイデアは、繰り返し、そして当然のことながら、非常に人気がないことが証明されています。

その結果、AIの診断用途に関する研究は、範囲と適用範囲が狭いままです。同じ病院の数千人の患者に対してのみトレーニングを受けている場合、世界中に乳がん検出モデルを導入することはできません。



これはすべて、連合学習によって変わる可能性があります。この手法では、複数の異なる病院に保存されているデータを使用してモデルをトレーニングできます。そのデータは、病院の敷地を離れたり、テクノロジー企業のサーバーにアクセスしたりすることはありません。これを行うには、まず各病院で利用可能なローカルデータを使用して個別のモデルをトレーニングし、次にそれらのモデルを中央サーバーに送信してマスターモデルに結合します。各病院は時間の経過とともにより多くのデータを取得するため、最新のマスターモデルをダウンロードし、新しいデータで更新して、中央サーバーに送り返すことができます。プロセス全体を通じて、生データが交換されることはありません。モデルのみが交換され、そのデータを公開するためにリバースエンジニアリングすることはできません。

連合学習にはいくつかの課題があります。 1つは、別々のモデルを組み合わせると、各パーツよりも実際に悪いマスターモデルが作成されるリスクがあります。研究者たちは現在、それが起こらないようにするために既存の技術を改良することに取り組んでいます、とラスカーは言います。もう1つは、連合学習では、すべての病院が機械学習モデルをトレーニングするためのインフラストラクチャと人員の能力を備えている必要があります。また、すべての病院でデータ収集を標準化することにも摩擦があります。しかし、これらの課題は克服できないものではありません、とラスカーは言います。さらに多くの作業を行う必要がありますが、それは主にバンドエイドの作業です。

実際、他のプライバシーファースト 分散学習技術 それ以来、これらの課題に対応して成長してきました。たとえば、ラスカーと彼の学生は最近、分割学習と呼ばれるものを発明しました。連合学習と同様に、各病院は別々のモデルをトレーニングすることから始めますが、途中でしかトレーニングしません。次に、中途半端なモデルが中央サーバーに送信され、結合されてトレーニングが終了します。主な利点は、これにより病院の計算負荷の一部が軽減されることです。この手法は依然として主に概念実証ですが、初期のテストで、Raskarの研究チームは、データの集中プールでトレーニングされた場合とほぼ同じくらい正確なマスターモデルを作成したことを示しました。



IBM Researchを含む少数の企業は、現在、連合学習を使用して、ヘルスケア用の実際のAIアプリケーションを進歩させることに取り組んでいます。パリを拠点とするスタートアップ、Owkin GoogleVenturesが支援 は、さまざまな治療法や薬に対する患者の抵抗力や、特定の疾患での生存率を予測するためにも使用しています。同社は、米国とヨーロッパのいくつかのがん研究センターと協力して、モデルにデータを利用しています。創設者によると、この共同研究により、患者の病理画像に基づいてまれな形態の癌の生存オッズを予測する新しいモデルに関する研究論文が発表されました。このホワイトペーパーでは、実際の環境でこの手法の利点を検証するための大きな一歩を踏み出します。

私は本当に興奮しています、とOwkinの共同創設者である臨床研究医のThomasClozelは言います。今日の腫瘍学における最大の障壁は知識です。私たちがその知識を抽出し、医学的な画期的な発見をする力を持っていることは本当に驚くべきことです。

Raskarは、分散学習のアプリケーションは、ヘルスケアだけでなく、人々がデータを共有したくない業界にも拡張できると考えています。分散した信頼できない環境では、これは将来非常に強力になるだろうと彼は言います。



このストーリーは、もともとAIニュースレターTheAlgorithmに掲載されました。受信トレイに直接配信するには、ここから無料でサインアップしてください。

隠れる