211service.com
ゲノムのマイニング
記者が訪れたとき、ラリー・ハンターはちょうど彼の新しいオフィスに引っ越したばかりだったので、部屋には小物や家族のスナップショットがありませんでした。しかし、ハンターは彼の本を開梱し始めており、それらはすでに興味深いパターンを形成し始めていました。ロジャーシャンクの 動的メモリ 、人工知能の古典的なタイトルは、GeorgSchulzの隣に棚上げされました タンパク質構造の原理。機械学習 隣接 癌遺伝子 。 人工生命 寄りかかった 医療情報学 。
適切に解釈されると、ハンターの本棚のパターンは生物学の最新の傾向を明らかにします。この分野は情報に圧倒され、ハンターのようなコンピューター科学者がその発見を理解することにますます依存するようになっています。コンピューターが微妙なパターンを認識するように教えられる機械学習として知られる人工知能研究の派生物の専門家であるハンターは、最近、国立医学図書館の孤独な理論的ポストから、国立医学の分子統計とバイオインフォマティクスのセクションを率いるように誘われました。 Cancer Institute(NCI)-生物学的発見のスラリーをふるいにかけるために数学的ノウハウを使用するために1997年に結成されたグループ。
すべてのデータはどこから来ていますか?簡単な答えは、それがヒトゲノムプロジェクトから洗い流されているということです。商業部門との意外な競争に後押しされて、推定100,000人のヒト遺伝子をカタログ化する公的資金による取り組みは終盤に近づいています。いくつかの大規模な学術センターは、来春までに大まかなドラフトを完成させることを目指しています。それまでに、彼らは数百億ビットのデータを、メリーランド州ベセスダの国立衛生研究所(NIH)にある国立バイオテクノロジー情報センター(NCBI)によって維持されているGenBankとして知られるオンライン遺伝子配列リポジトリにダンプします。増加しているデータの種類はDNA配列だけではありません。科学者はDNAチップを使用して、生細胞内で数千の遺伝子がオン/オフされているパターンを検出できるようになりました。これにより、大量の発見が追加されます。
CompaqComputerのライフサイエンス情報学部長であるNatGoodman氏は、新しい種類のデータが驚異的なペースで利用できるようになっています。コンパックは、バイオインフォマティクスにおける重要な商業的機会を求めている多くの企業の1つです。このコンピューターと生物学の会議は活況を呈しているビジネスですが、これまでのところ、遺伝子データの山を生成および管理するためのソフトウェアを中心に展開してきました。現在、製薬会社は、病気の新しい治療法につながる発見のために、その山を採掘するためのより高速な方法を必要としています。
そこで、ラリーハンターなどの起業家の研究者が登場します。ハンターの本棚には、2,000,000ドルのシリーズA優先のガラスの安物の宝石が置かれています。 1999年3月5日-彼が共同設立した会社であるMolecularMiningによって調達されたベンチャーキャピタルファンドのお祝い。オンタリオ州キングストンに本拠を置く同社は、データマイニング手法を使用して、生細胞の主要な生物学的パターン(特に危険な腫瘍でどの遺伝子がオンになっているのか、どの薬が腫瘍は反応します。また、データマイニングツールを作成するために、他の12の新興企業(バイオテクノロジー業界の最新トレンドの最良の指標)が結成されました(ゲノムマイナーを参照)。ハンターは、生物学は、大量の分子データから隠れた構造を見つけることができるアルゴリズムによってますます支えられるだろうと予測しています。 Hunterが専門とするこの種のデータマイニング作業は、パターン認識としてよく知られており、バイオインフォマティクスで最も動きの速い分野の1つです。確かに、ハンターが正しければ、パターン認識は新しい治療法の金を生み出す選択であることが判明するかもしれません。
ゲノムマイナー
パターン認識ソフトウェアを専門とする企業のサンプル。
会社 位置 ハイライト バイオ理由
(プライベート)Santa Fe、N.M。人工知能ソフトウェアは化学データを理解します。 Compugen
(民間)イスラエルのテルアビブ元イスラエルの防衛請負業者は、遺伝子データマイニングで大きな得点を挙げています。顧客には、米国特許庁が含まれます。 IBM
(公開)ニューヨーク州アーモンク高度なパターン認識アルゴリズムは、タンパク質発見のための1997年のモンサント同盟に力を与えています。 ライオンバイオサイエンス
(プライベート)ドイツ、ハイデルベルク麻薬の巨人バイエルとの1億ドルの協定は、バイオインフォマティクスの記録を打ち立てました。 分子マイニング
(プライベート)オンタリオ州キングストン3月にベンチャーキャピタリストから200万ドルのスタートアップ資金を調達しました。 ネオモルフィック
(プライベート)カリフォルニア州バークレー。隠れマルコフモデルは、この1996年のスタートアップの高度な遺伝子発見ツールの1つです。 パルテック
(プライベート)ミズーリ州セントピーターズニューラルネットワークのスペシャリストは、1998年に生物学市場に参入しました。 シリコンジェネティクス
(プライベート)カリフォルニア州サンカルロススタンフォードスピンオフは、利益のために遺伝子データを採掘します。 シリコングラフィックス
(公開)カリフォルニア州マウンテンビュー鉱山セットのビジュアルデータマイニングツールは、金融、通信、製薬業界で人気があります。
最初にそれらを見つける必要があります
マウンテンハンターと彼の同僚がどれほど大きくトンネルを掘っているのかを知るために、すべての人間の細胞が約35億ペアのヌクレオチド、化学文字A、C、G、Tを含む23ペアの染色体を持っているという事実を考えてみましょう。 DNAの遺伝暗号。しかし、タンパク質を作るためのコードを運び、遺伝病や癌でうまくいかない実際の遺伝子は、ゲノムの3パーセント未満しか占めていません。残りは遺伝的ノイズです。遺伝子を発掘するのがさらに難しいのは、細胞がそれらをつなぎ合わせてそれらの発現を導くために使用する遺伝子シグナルと同様に、それらのタンパク質コード要素が散在しているという事実です:タンパク質を作るためにそれらを活性化するプロセス。ゲノムを理解するための鍵は、これらの信号の言語を理解することです、とカリフォルニア大学サンタクルーズ校の主要な計算生物学者であるデビッド・ハウスラーは言います。しかし、彼らは隠されており、騒々しいです。
最初の重大な問題は、この無関係なコードの迷路からそれらを抽出することです。オークリッジ国立研究所では、Edward Uberbacherの計算生物科学セクションが人工ニューラルネットワークの遺伝子発見問題に取り組んでいます。これは、経験から学ぶ能力が特徴の人工知能(AI)プログラムの一種です。オークリッジでは、ファジー衛星画像で敵の戦車を認識するなどの作業にニューラルネットが使用されていました。 1991年、Uberbacherはこれらの方法を採用して、遺伝子を選択できるGRAILと呼ばれるプログラムを作成しました。それ以来、GRAILには少なくとも12の遺伝子発見プログラムが加わり、その多くはオンラインの研究者が利用できます。
現在の遺伝子位置特定プログラムは完璧にはほど遠いものであり、実際には存在しない遺伝子を予測することもあれば、存在する遺伝子が欠落していることもあります。 Uberbacher氏によると、精度の問題もあり、これらの方法はしばらくの間、限界に達しています。しかし、ゲノムデータの洪水が加速していることを考えると、生物学者はそれらに依存し、それらを改善することを余儀なくされます。国立ヒトゲノム研究所のゲノム情報学部門のプログラムディレクターであるリサブルックス氏は、バイオインフォマティクスデータベースをサポートし、新しいデータマイニング手法を開発するために年間2,000万ドルを費やしていると述べています。 。
パターン認識プログラムは、遺伝子を発見するためだけに使用されるのではありません。それらはまた、遺伝子が何をするかについて研究者に手がかりを与えるために大いに利用されています。今日最も広く使用されているプログラムであるNCBIのBasicLocal Alignment Search Tool(BLAST)は、新たに発見されたDNA配列と、その役割がすでに理解されているDNA配列との類似点を検索する研究者から、1日あたり50,000件のヒットを受け取ります。同様の配列が与えられると、科学者は2つの遺伝子が同様の機能を持っていると推測できることがよくあります。
リサーチスピークでは、遺伝子の機能を解釈してデータベースに入力するプロセスは、アノテーションと呼ばれます。 5月、ロンドンのサンガーセンターと、英国のヒンクストンにある多国籍の欧州分子生物学研究所の支部である欧州バイオインフォマティクス研究所(EBI)は、EnsEMBLとして知られる急いで組織されたプロジェクトを発表しました。 EnsEMBLの目標は、EBIのAlan Robinsonによると、ヒトゲノムの最初のドラフトに注釈が付けられるようにすることです。 EnsEMBLの最初の活動は、遺伝子発見アルゴリズムを送信してゲノムを調べ、遺伝子がどこにあるかを大まかに把握することです。これは、プロスペクターの手描きの地図です。マップが描画されると、EnsEMBLはBLASTなどのツールを使用して遺伝子の機能を推測します。
このようなコンピューター化された発見パイプラインの計画は、病気の原因となる遺伝子を特定し、特許を取得しようと競争している製薬会社にとって重要です。たとえば、6月、ドイツの麻薬大手バイエルは、ハイデルベルクの新興企業であるライオンバイオサイエンスに、遺伝子データベースをマイニングする自動システムに1億ドルを支払うことに合意しました。ライオンは、バイオインフォマティクスの責任者であるレインハードシュナイダーによると、コンピューター化されたアプローチをi-biologyと呼んでおり、5年以内にコンピューターが500の新しい遺伝子を発見し、バイエルがすでに発見した70の遺伝子に注釈を付けることを約束しています。データベースの毎日の精査を推進するパターン認識アルゴリズムは、i-biologyの中核にあります。
バイエル-ライオン協定は記録破りですが、製薬大手と計算に精通した新興企業との間の数十のデータマイニング提携の1つにすぎません。これは、数学的手法がゲノム研究の中心的な舞台になっている証拠です。また、アルゴリズムを作成する学者は、特に業界でスターが上昇していることに気づきます。ライオンは、ハイデルベルクに本部を置く欧州分子生物学研究所のトップバイオインフォノートによって設立されました。遺伝暗号を解読する計画を立てているメリーランド州ロックビルのセレラゲノミクスでは、ヒトゲノムプロジェクトを揺るがし、公的資金による作業を加速させました。成功は、パターン分析の専門家であるユージンマイヤーズの専門知識にかかっています。セレラは、アリゾナ大学の在職中の立場からマイヤーズを誘惑し、情報科学の取り組みを主導し、コンパックを雇って、世界で最も強力な民間スーパーコンピューターとして宣伝されているものを構築しました(The Gene Factory、TR 1999年3月/ 4月を参照)。 Hausslerによると、ほとんどの科学者は、マイヤーズの方法の成功がセレラを成功または失敗させると考えています。
がん分類器
重要なのは、手がかりとなる遺伝子を特定してその機能と比較することは、医学的関連性への長い道のりの最初の一歩にすぎません。薬の開発には何年もかかる可能性があります。しかし、計算科学者は、遺伝子発現プロファイルとして知られている別のタイプのゲノムデータに適用した場合、パターンマイニングははるかに短期的な見返りをもたらす可能性があると述べています。
遺伝子の発現レベルとは、特定のタンパク質のコピーを何部作成するかを指します。タンパク質は細胞内の実際の主力製品であり、代謝の日常的なタスクを実行します。それぞれのレベルは時間の経過とともに劇的に変化する可能性があり、多くの場合、病気の細胞ではキルターから外れています。 DNAマイクロアレイ、またはよりよく知られているDNAチップとして知られるデバイスのおかげで、科学者は初めて、一度に数千の遺伝子の発現レベルを定期的に測定できるようになりました。 DNAチップは、タンパク質を作るために、細胞が最初に遺伝子をメッセンジャーRNA(mRNA)と呼ばれる分子の複数のコピーに変換するという事実を利用しています。細胞内のmRNAの種類と量は、注文したタンパク質に対応しています。また、数千の異なるmRNAのレベルを一度に測定することで、DNAチップは数千の遺伝子の活動のスナップショットを作成できます。
NCBIの主任研究員であるMarkBuguskiは、遺伝子発現レベルに関する新しいデータは、生物学者がこれまでに暴露したものとは異なると述べています。以前は、生物学者は一度に数個の遺伝子の活動しか分析できませんでした。現在、DNAチップは、細胞の活動の超並列読み出しを生成できます。健康と病気の違いは通常、単一の遺伝子の活性ではなく、遺伝子発現の全体的なパターンにあるため、これは重要な進歩です。
Whitehead / MIT Center for Genome Researchのチームは、この超並列読み出しを使用して、さまざまな癌間の明らかな違いを特定しています。分子パターン認識グループとして知られるこのグループは、昨年、ゲノムセンターのディレクターであるエリックランダーによって開始され、分子生物学者のトッドゴラブが率いています。他のメンバーには、元IBMの数学者ジルメシロフ、コンピューター科学者のドナスロニム、スーパーコンピューター会社のシンキングマシンズからホワイトヘッドに加わった計算物理学者のパブロタマヨが含まれます。
この学際的なブレーントラストは、パターン認識における非常に重要な問題を解決しようとしています。腫瘍は微妙に異なり、顕微鏡で同じように見えるがん細胞は、薬剤に対して非常に異なった反応を示します。ランダー氏によると、私たちが単一の種類のがんと呼んでいるのは確かに多くの種類のがんですが、何を探すべきか[違い]はわかりません。
新しい方法のベンチマークを提供するために、Landerのグループは、顕微鏡ですでに区別できる2種類の白血病、急性骨髄性白血病(AML)と急性リンパ性白血病(ALL)から始めました。彼らは、38人の白血病患者の骨髄サンプル中の約6,800の異なる遺伝子のレベルを測定しました。これは、AMLとALLを区別できるパターンを探すためのものです。しかし、6,800個のパラメーター(遺伝子)と38個のデータポイント(サンプル)のみを使用して、12人をポーリングして選挙を予測しようとするようなタスクを作成しました。鉛筆とスクラッチペーパーの1年間の供給を実行した後、彼らは解決策を思いつきました。
重要なステップは、自己組織化マップと呼ばれる学習アルゴリズムにデータポイントを供給することでした。 38個のサンプルを高次元の数学的空間にプロットすることにより、マップアルゴリズムは、サンプルを2つのグループ(癌のタイプごとに1つ)に分割することができました。ランダー氏によると、既知の腫瘍タイプに関する情報と照合すると、クラスターがALLサンプルとAMLサンプルをほぼ完全に分離したことが明らかになりました。これら2種類の白血病の違いを知らなかった場合(実際には確立するのに40年の作業が必要でした)、ある午後にそれを要約することができたはずだと彼は言います。
研究チームはまた、彼らの方法(TRが報道された時点ではまだ公開されていない)が患者にとってどれほど価値があるかについても理解しました。ある時点で、アルゴリズムはサンプルをいずれかの白血病カテゴリーに分類できませんでした。数学に欠陥がありましたか?いいえ-診断はでした。プログラムの結果に促されて、医師は別の調査を行い、白血病は実際には非常に悪性の筋肉癌であり、現在患者が治療を受けていると信じていたことがわかりました。マサチューセッツ州ケンブリッジに本拠を置くMillenniumPharmaceuticalsでは、社内ソフトウェアに最新のデータマイニングアルゴリズムをインストールするためにMillenniumに雇われた元天体物理学者、Dave Ficenecによると、研究者は同様のアプローチが癌の最適な診断テストにつながると確信しています。同社はランダーのセンターと緊密に協力しています。ランダーはミレニアムの共同創設者であり、同社の取締役会に所属しています。
遺伝子発現のスナップショットを作成するための新しい並列メソッドは、新薬候補の評価にも使用されています。ワシントン州カークランドのスタートアップRosettaInpharmaticsでは、科学チームが遺伝子パターンのデータベースを組み立ててマイニングし、創薬をスピードアップしています。ロゼッタは酵母細胞を研究し、それらを潜在的な新薬にさらし、次に遺伝子発現のレベルを分析して、薬の作用の手がかりを探します。たとえば、細胞を迅速にチェックして、それらの応答が毒性の副作用に典型的なパターンと一致するかどうかを確認できます。このような敗者を早期に排除することは、創薬の効率を改善するロゼッタのプログラムの一部であると、ロゼッタの最高科学責任者であり、シアトルのフレッドハッチンソンがん研究センターの分子薬理学プログラムの責任者を兼務するスティーブンフレンドは述べています。製薬会社は注目を集めており、8社がRosettaパートナーとして登録しています。
頭脳流出
企業や大学の研究者がデータマイニングの時流に乗っている間、彼らは将来の道でたくさんの衝突に遭遇する可能性があります。たとえば、一部の投資家は、さまざまな生物学的結果のデータベースがまだ十分に相互接続されておらず、品質が不均一であることに懸念を抱いています。ベンチャー企業CWグループのパロアルトオフィスの投資家であるLarryBock氏は、次のように述べています。マイニングの能力はデータベースの品質に直接関係しているため、データマイニングは少し早いかもしれません。それでも、ペンシルバニア州ウェストコンショホッケンにあるベンチャー企業SROneの副社長であるBarbaraDalton氏は、長期的な見通しは良好に見えると述べています。 SR Oneは、ニュージャージー州プリンストンのCardinal Health Partnersとともに、LarryHunterのスタートアップであるMolecularMiningに資金を提供するために200万ドルを調達しました。データマイニングは創薬の中核となるだろう、とダルトンは予測している。
しかし、それが起こる前に、フィールドはその最も深刻なボトルネックを打破しなければならないかもしれません:メンターの深刻な不足。バイオインフォマティクスは1990年代に爆発的に成長し、最高の大学の教師や研究者の多くを高給の民間部門に引き込みました。私たちはバイオインフォマティクスへの関心がほとんどなかったので、ほとんどの人が企業で働いていたと、マサチューセッツ州ケンブリッジのバイオテクノロジー企業であるVariagenicsで働くためにアカデミックトラックを離れたMarkAdamsは言います。大学が彼らの最も明るい心のいくつかを使い果たしているので、多くの人は次世代の計算生物学者を誰が訓練するのか疑問に思います。
答えの一部は、NIHのディレクターであるハロルドバーマスによって召集された特別諮問委員会が、米国政府が生物医学コンピューティングの優れた20の新しいプログラムに資金を提供するために1,000万ドルも費やすべきであると結論付けた6月に来ました。バロウズウェルカム基金からの250万ドルの助成金のおかげで、新しい計算生物学プログラムが進行中のジョンズホプキンスを含むいくつかの大学もこの法案に参加しました。スタンフォード大学、プリンストン大学、シカゴ大学はすべて、物理科学者と生物学者を結びつける主要なセンターを計画しています。
業界では、収束はすでに現実のものです。 Rosetta Inpharmaticsの100人の従業員の3分の1は計算科学者であり、ソナー検出、航空交通管制、天体物理学などの多様な分野から選ばれています。チーフサイエンティストのスティーブンフレンドは、1997年の入社以来、重要な認識に達したと述べています。生物学者は依然として最良の質問をし、最も説得力のある実験を設計する可能性がありますが、最良の答えは物理学者または数学者からのものです。これらの答えは、重要な新しい治療法につながる可能性があります-パターン認識のツールによってヒトゲノムプロジェクトの山から抽出された金。