211service.com
燃えよドラゴン
ボストンを見下ろす丘の上にある3階建てのレンガ造りの建物の周りを案内してくれるジャネット・ベイカーは、すべての建物に名声があると言います。かつて工場だったこの建物は、清掃、改修、オフィス化されました。現在は、1982年にジャネットと夫のジムベイカーが設立したドラゴンシステムズの本社です。
これは何ですか?お願いします。
この話は1998年9月号の一部でした
- 残りの問題を見る
- 購読
ジョンウィルクスブースを吊るしたロープはここで作られました、と彼女は笑顔で言います。
工業ビルの過去を知ると、その兆候はいたるところにあります。 2階と3階の床はわずかに傾斜しているため、1世紀前の労働者は巨大なロープの巻きを巻くことができました。 3階には空いたスペースに通じるドアがあり、滑車がスプールを下で待っている馬車に降ろしました。滑車とローラーはまだ建物の天井からぶら下がっています。
しかし、21世紀を振り返る歴史家は、ドラゴンシステムズがコンピューターサイエンスの大きな課題を解決した場所であるよりも、エイブラハムリンカーンの暗殺者の首を絞めた縄のために、この古い製粉所を覚えている可能性は低いです。人間のスピーチ。
前世紀以来、エンジニアは主人の声に耳を傾ける機械を作ろうとしてきました。アレクサンダーグラハムベルでさえ、彼の手を試してみました。そして、単一の話し言葉を認識できるコンピューターは何十年も前から存在していましたが、1995年の秋、専門家たちは、継続的な会話を書き写すことができるデスクトップマシン(人々が実際に話すのが速く、時には混乱する方法)は、少なくとも2000年…そしておそらくずっと後の年。
現在、Dragon SystemsのNaturallySpeakingをコンピューターストアで99.95ドルで購入し、2,000ドル未満の新しいPCで実行できます。
では、このテクノロジーで何ができるのでしょうか。今年の初め、私はドラゴンの本社の会議室に懐疑的なテクノロジーライターの集まりと一緒に座り、ドラゴンシステムの主任アーキテクトであるジョエルグールドが彼の作成を支援したプログラムのデモを行いました。グールドは会議室の前に歩いて行き、ラップトップをプロジェクターに接続し、軽量の電話ヘッドセットを着用して話し始めました。
最初にデモンストレーションを行い、次に戻って、あなたが見たもののいくつかがすぐに通り過ぎるのをお見せします、とグールドは言いました。数秒後、同じ単語が画面に表示され、コンピューター自体が魔法のように入力しました。グールドはこの会話スタイルで進み、機械が彼の言ったことをすべて書き写しました。時折ミスがありましたが、マシンの精度は抜群でした。プログラムを困らせることを望んで、記者は、同じように聞こえるが綴りが異なる単語を区別できるかどうか尋ねました。グールドは微笑んで、やっかいなことをしました:ライト夫人に今すぐ手紙を書いてください。 2つは購入するには多すぎることを彼女に伝えます。システムは単語を完全に認識しました。
Dragonの経営陣は、5年後、このような音声認識ソフトウェアを備えていないコンピューターは、今日のマウスを備えていないコンピューターと同じくらい原始的に見えるだろうと自信を持って予測しています。手紙や電子メールは、電話で話すのと同じくらい簡単に口述されます。それを一歩超えただけで、PCベースの同時翻訳は言語の壁を打破する可能性があります。
音声認識が予定より数年早く到着したのは、主に、1982年にDragonを設立したカップルであるJimとJanet Bakerの忍耐力によるものです。研究者として、このペアは、すべての音声認識製品で今日使用されている基本的なアルゴリズムのいくつかを発明するのに役立ちました。 。起業家として、彼らは誰のスケジュールよりも何年も前にテクノロジーを商業化するために戦いました。スピーチがデスクトップ上にあるので、私たちのコンピューティングの未来は、ドラゴンシステムズとそれを生み出した夫婦チームによって少なからず形作られることは明らかです。
Janetmaciverとjimbakerは、どちらもニューヨーク市のロックフェラー大学の大学院生だったときに恋に落ちました。それは1970年の秋でした。人懐っこくて外向的な生物物理学者であるジャネットは、情報が神経系によってどのように処理されるかを研究していました。ジムは、有望な論文のトピックを探している非常に恥ずかしがり屋の数学者でした。
ある日、ジムがジャネットの研究室を訪れ、動く波線を表示しているオシロスコープの画面を見たとき、彼らの関係の3番目の参加者である音声認識の謎が現場に入りました。信号は、MITのジェロームレトビン教授によって最初に発明された一種の小さなアナログ回路によって生成された進行中のイベントの継続的なログであるとジャネットは説明しました。彼女の画面上のイベントは人間のスピーチの音でした。
それは非常に興味深いパターン認識の問題として私を驚かせました、とジムはその運命的な波線を振り返って言います。スピーカーに送られる信号は、人が理解できる音、つまり言語を生成します。しかし、画面に表示された情報は、侵入できませんでした。
そしてそれについてもっと学ぶにつれて、私は問題が本当にどれほど難しいかを学びました、と彼は思い出します。重要な課題は、個々の単語を識別できるコンピューターを構築することだけではありませんでした。ベル研究所のチームは、1952年にそれを行いました。ベルの単純なコンピューターは、話された音をに保存されている一連のパターンと照合することで、0から9までの数字を認識できました。アナログメモリ。そして1970年代までに、このような個別の認識システムは、システムが最初に話者の声で訓練され、話者が各単語の間で一時停止することを条件として機能し、数百語に達していました。
実際のタスクは、自然に話された文を理解できるアルゴリズムを設計することでした。個々の単語の音は、コンテキストによって偽装されます(図p.61を参照)。それはそれをより面白くした、とジムは言います。それでも、継続的な音声認識は彼を理想的な研究問題として捉えました。彼はそれを非常に難しいが不可能ではないと特徴づけています。
ジムとジャネットが1971年に結婚式の準備をしたとき、米国国防高等研究計画局(DARPA)は、スピーチ理解研究と呼ばれる野心的な5年間のプロジェクトを開始しました。エージェンシーは、兵士がコンピューターとより速く通信できるようにする技術は、特に戦場で重要な戦略的利点になる可能性があると感じました。プロジェクトの目標は、1,000語の語彙から90%の精度で継続的な人間の音声を認識できるシステムです。
DARPAイニシアチブのタイミングは、ジムの科学的背景と同様に、パン屋にとって偶然でした。学部生として、彼はロシアの数学者アンドレイ・マルコフ(1856-1922)によって開拓された方法に基づいて、明らかにランダムなイベントを分析するための数学的手法を開発しました。ジムは、そのような隠れマルコフモデルがスピーチの謎を解くために使用される可能性があることに気付いた最初の人でした。
ほとんどの新婚夫婦は、結婚式の陶器にどのパターンを選択するかなどの課題を解決するために協力しています。パン屋はこれらのタスクをスキップしませんでした(彼らはドラゴンを選びました)が、音声認識の問題にも一緒に取り組むことにしました。それでも、彼らはロックフェラーでますます孤立していることに気づきました。ロックフェラーには音声理解の専門家がいなくて、ジムのテクニックを試すためのコンピューターの能力が不足していました。そこで翌年、彼らは荷物をまとめて、DARPAプロジェクトの元請業者の1つであり、人工知能(AI)研究の温床であるカーネギーメロン大学に転校しました。
カーネギーメロン大学で、ベイカーズは音声認識へのアプローチが主流とはかけ離れていることを発見しました。当時、多くのAI研究者は、話者が誰であるか、話者が何を知っているか、話者が何を言おうとしているのかなど、多くのコンテキストを最初に理解できた場合にのみ、機械が話された文を認識できると信じていました。英文法のルール。言い換えれば、音声を認識するためには、機械は非常にインテリジェントである必要があります。
パン屋は完全に異なるタックを試みました。マルコフモデルに関するジムの経験に基づいて、彼らは純粋に統計的な領域で動作するプログラムを作成しました。最初に、彼らは英語で任意の2つの単語または3つの単語が次々に現れる確率を計算し始めました。次に、それらの単語グループの音を使用して音声辞書を作成しました。次のステップは、良好な音の一致だけでなく、誰かがその順序で話す確率に基づいて、話された単語の文字列を解読するアルゴリズムでした。このシステムには、英文法の知識、知識ベース、ルールベースのエキスパートシステム、インテリジェンスがありませんでした。数字以外の何物でもありません。
それは非常に異端的で急進的な考えでした、とジャネットは言います。多くの人が言った、それはスピーチや言語ではなく、数学です!それは別のことです!」
MITのコンピュータサイエンス研究所の副所長であり、スピーチ研究のパイオニアであるビクターズー氏は、ベイカーズの考えは広く懐疑的でしたが、この種のアプローチを追求する上で時間は正しいことが証明されました。確かに、彼らが彼らの陶磁器セットを飾った生き物にちなんでドラゴンと名付けたベイカーズのシステムは、すぐに競合する方法を一貫して上回り始めました。
1975年にベイカーズがカーネギーメロン大学から博士号を取得したとき、彼らの先駆的な仕事はすぐにニューヨーク市の外にあるIBMのトーマスJ.ワトソンリサーチセンターに両方の仕事をもたらしました。当時、IBMは、大量の語彙、継続的な音声認識に取り組んでいる唯一の組織の1つでした。私たちは[IBM]に行って、「あなたは私たちの両方を雇わなければならない」と言いませんでした」とジムは回想します。それはちょうどそのようにうまくいきました。しかし、それは繰り返されるパターンでした。今日、ジムが会長/ CEO、ジャネットがドラゴンシステムズの社長として、ベイカーズはほぼ同じ履歴書を持っていることに誇りを持っています。
IBMで、ベイカーズは1,000語の語彙からの連続音声を認識できるプログラムを設計しました。しかし、それはリアルタイムにはほど遠いものでした。このプログラムはIBM370コンピューターで実行され、1つの口頭文をデコードするのに約1時間かかりました。しかし、メインフレームで時間を待つこと以上にベイカーを苛立たせたのは、IBMが実際の条件下で音声認識をテストすることを拒否したことでした。
IBMは優れた研究機関であり、そこで働くことを楽しんだとJanetは言います。しかし、私たちは物事を市場に出し、実際のユーザーを獲得することに非常に熱心でした。確かに、実際のユーザーは、コンピューターが文章を書き写すのを1時間待つことができませんでした。しかし、彼女は、はるかに少ない[コンピューター]リソースを使用して、より単純なことを行うことができたはずだと述べています。 IBMの経営陣は違った感じで、ベイカーズに時期尚早だと語った。
それはIBMでの機会を逃した全盛期であり(同社が商品化できなかった主要な発明の中にリレーショナルデータベースとRISCマイクロプロセッサを数えます)、1979年にベイカーズの欲求不満は沸騰しました。夫婦は、ボストンに本拠を置くExxon Enterprisesの子会社であるVerbexに飛びつきました。この子会社は、電話で数字を使ってデータを収集するシステムを構築していました。ジム(新任の先進開発担当副社長)とジャネット(研究担当副社長)は、プログラムに継続的なスピーチを処理させるために着手しました。
しかし、3年も経たないうちに、エクソンは音声認識ビジネスから抜け出し、ベイカーズは再び仕事を探していました。今回、彼らのそっくりさんの履歴書は問題を綴りました-どちらにも仕事はありませんでした。デュオは、自分たちが選択に直面していることに気づきました。フィールドを変更して音声認識から離婚するか、自分で出発するかです。
1982年、ベンチャーキャピタルも事業計画も、就学前の2人の子供と大きな住宅ローンもなく、ベイカーズはドラゴンシステムズを設立しました。彼らは居間から会社を経営し、彼らの貯蓄は18か月続く可能性があると考えました。
少し重いですが、実際には形が崩れているわけではありませんが、今日のパン屋は、成功した起業家というよりも、幸せに年をとった学者のように見えます。しかし、ドラゴンの豪華な本部を歩いていると、両方が両方であることがすぐにわかります。 Dragon Systemsは、過去16年間、毎年ほぼ50%成長しています。現在、260人以上を雇用しています。彼らの秘密は、10年の自立であったとジャネットは言います。ベイカーズ氏は、負債を積み上げたり、会社の株式を部外者に売却したりするのではなく、給与と経費を収入から支払わなければならないと主張した。その結果、Dragonは現在のテクノロジーで現実の問題を解決することに焦点を合わせ、なんとか実現することができました。
ドラゴンの孵化から数年後、ますます堅牢な個別認識アプローチに依存するカスタムプロジェクト、研究契約、および初めての製品の洗濯物リストがもたらされました。ランドマークの中には、ドラゴンの最初の取引がありました。アプリコットコンピューターズと呼ばれる小さな英国の会社が、ドラゴンのテクノロジーを使用して、人々が簡単なコマンドを話すことでファイルを開いたりプログラムを実行したりできる最初のパーソナルコンピューターを販売しました。 (残念ながら、アプリコットは時代を先取りして熟成し、すぐに破産しました。)1986年、マイクと無線送信機を装備したゼロックスの労働者は、ドラゴンテクノロジーを使用して、同社の220万個の部品の在庫全体の監査を実施しました。
1990年に、DragonはDragonDictate 30Kを導入しました。これは、汎用ディクテーション用の最初の大規模な語彙、音声からテキストへのシステムです。このプログラムにより、ユーザーは音声のみを使用してPCを制御できるようになり、俳優のクリストファーリーブを含む障害者の間ですぐに好意を示しました。
しかし、ドラゴンのディスクリートテクノロジーは一般市場に浸透できませんでした。多くの人がDragonDictateを使用して入力するよりも速くテキストを入力できましたが、話された各単語の間に一時停止することを余儀なくされることを楽しんだ人は誰もいませんでした。さらに悪いことに、競合他社は独自の個別の音声認識技術で力を発揮していました。ユーザーが本当に望んでいたのは継続的な音声認識であり、最初に市場に投入した企業が優位に立つ準備ができていることは誰もが知っていました。しかし、継続的な製品が少なくとも5年、場合によっては10年先にあることも誰もが知っていました。
その後、1993年後半のある時点で、ベイカーズは従来の知識が間違っていることに気づきました。彼らは、コンピューターの速度とメモリが向上している速度を知っており、最高級のデスクトップマシンには、数年以内に継続的な認識を行う能力があるはずだと計算しました。ペアがかつて音声認識への風変わりな新しいアプローチでキャリアを危険にさらしたように、1994年の前半に、ベイカーズはチャンスをつかみ、彼らのアイデアを市場にもたらすために会社を作り直し始めました。
ジムがドラゴンの最初の連続音声認識装置を構築するために新しい開発チームを設立した一方で、ジャネットはカリフォルニアを拠点とするハードディスクメーカーのシーゲイトテクノロジーズとの契約を仲介し、ドラゴンの株式の25%を購入しました。同社はその現金を使用して、エンジニアリング、マーケティング、営業の各部隊を配置しました。 1年以内に、ドラゴンには世界最大の音声研究チームがあり、50人以上の科学者とソフトウェアエンジニアがいました。
新しい継続的な製品は、実際には1つのプログラムで2つのプログラムになります。最初の認識機能は、話された発話を英語のテキストに変換する実際の仕事に取り掛かります。 2番目のプログラムは、レコグナイザーをユーザーとコンピューターの残りのオペレーティングシステムの両方に接続するインターフェイスでした。前半が純粋な科学(パン屋の初期の仕事に基づいて構築されたもの)であった場合、後半は科学を市場性のある製品に変えるために必要な工学と芸術の苛立たしい組み合わせでした。
これらの現実の問題の中で最も難しいのは、ソフトウェアをWindows環境でうまく動作させることでした。 Windowsはひどいもので、ユーザーインターフェイスの設計という重要なタスクを引き受けたDragon’sGouldは嘆きます。それはバグがあり、文書化が不十分で、一貫性がなく、その一部はほとんど使用できません。それでも、それはすべてのお客様が実行していることです。
1997年4月までに、Dragonのチームは主要なハードルをクリアし、業界アナリストに何か大きなものが来ることをほのめかし始めました。私たちは懐疑的でした、と市場調査会社DataquestのPeterFfoulkesは覚えています。それから彼はデモを見ました-それは23万語の語彙を誇示しました。私たちはその能力にかなり驚かされました。今日ここにあるとは思っていませんでしたが、実際はそうです、とFfoulkesは言います。
パン屋は彼らの会社を賭けていて、彼らは正しく賭けていました。 Dragon NaturallySpeakingと呼ばれる新しい継続的な認識製品は、瞬く間にヒットしました。 Janet Bakerのオフィスは、Dragonのテクノロジーをソフトウェアアプリケーションと統合することを望んでいる企業からの要求でいっぱいになり始めました。 NaturallySpeakingに関する記事は、世界中の出版物に掲載されました。グールドはCNNでプログラムをデモしました。その秋、NaturallySpeakingは業界のCOMDEXトレードショーを席巻し、すべての主要な製品賞を受賞しました。
しかし、脚光を浴びているドラゴンの時間だけは短いものでした。同社が1997年6月にNaturallySpeakingを最初に出荷したとき、IBMは、ディスクリート音声認識機能のVoiceTypeの価格を49.95ドルに値下げしました。そして、NaturallySpeakingの差し迫ったリリースの言葉が数か月前に漏れていたため、IBMは、独自の継続的な音声認識プログラム(1970年代にベイカーズが働いていたのと同じラボで開発された)をできるだけ早く戸外に移動するためのクラッシュの取り組みをすでに開始していましたできるだけ。この製品であるIBMViaVoiceは、8月の価格がわずか99ドルで売られていた店頭に並ぶ。
音声認識市場を研究しているVoiceInformationAssociatesの社長であるJohnOberteufferは、IBMは本当に物事を吹き飛ばしたと言います。私はそれらの両方を使用しました、そして純粋な認識精度に関しては、それらは同等であると私は言うでしょう、と彼は言います。ドラゴンは、その価格を、700ドルの高額な初期費用から、299ドル、そして199ドルに引き下げ、値下げすることを余儀なくされました。 PC Dataによると、年末までに、DragonはNaturallySpeakingを29,463部販売し、IBMはViaVoiceを46,182部販売しました。しかし、全体的な製品収益では、ドラゴンはビッグブルーを打ち負かしていました。
