211service.com
クックブック、ウィキペディア、および自動生成されたSpanglish:AI研究者がデータを収集する風変わりな方法
ジョーレイドル/ゲッティイメージズ
データはAI開発を促進する原油であり、YouTubeのキャプション、Spotifyの音楽のおすすめ、インターネット上であなたをフォローしている不気味な広告など、私たちが当たり前と思っている多くの進歩をもたらします。
しかし、有用なデータを収集することになると、AIの専門家は創造性を発揮しなければならないことがよくあります。自然言語処理(NLP)を取り上げます。これは、人間の言語を解析する方法をコンピューターに教えることに焦点を当てたAIのサブフィールドです。 NLPの経験的方法に関する年次会議で、専門家は、いくつかの独創的な方法で収集された情報を利用した幅広い研究を発表しました。以下に、お気に入りの4つのプロジェクトをまとめました。
スペイン語
今年の多言語NLPに関する論文の中で、Microsoft 提示されたもの これは、コード混合言語(2つの言語間で流動的に切り替わるテキストまたは音声)の処理に重点を置いていました。世界の人口の半分以上が多言語であることを考えると、この十分に研究されていない地域は重要です。
研究者たちはスペイン語(スペイン語と英語)から始めましたが、マシンをトレーニングするのに十分なスペイン語のテキストが不足していました。多言語会話ではコードミキシングが一般的ですが、テキストで見つかることはめったにありません。この課題を克服するために、研究者たちは英語をMicrosoft Bing翻訳者にポップし、スペイン語の翻訳からいくつかのフレーズを元のテキストに織り戻すプログラムを作成しました。プログラムは、交換された単語とフレーズが同じ意味を持つことを確認しました。そのように、彼らは必要なだけのスパングリッシュを作成することができました。
結果として得られたNLPモデルは、スペイン語と英語だけで別々にトレーニングされた以前のモデルを上回りました。研究者たちは、彼らの仕事が最終的にコード混合言語で自然に話すことができる多言語チャットボットの開発に役立つことを望んでいます。
クックブック
レシピは食べ物を作るのに最適ですが、機械に栄養を与えることもできます。それらはすべて同様の段階的なパターンに従い、テキストに対応する画像が含まれていることがよくあります。これは、テキストと画像を同時に理解するための教育機関向けの構造化データの優れたソースです。そのため、トルコのハジェテペ大学の研究者は 巨大なデータセットをコンパイルしました 約20,000のイラスト入り料理レシピの。彼らは、それが画像とテキストの共同理解のパフォーマンスをベンチマークするための新しいリソースになることを望んでいます。
彼らがRecipeQAと呼ぶものは、機械の読解と視覚の理解に別々に焦点を合わせた以前の研究に基づいています。前者の場合、マシンは答えを見つけるために質問と関連するパッセージを理解する必要があります。後者では、代わりに関連する写真で答えを検索します。テキストと写真を並べて配置すると、写真とテキストが補完的または冗長な情報を共有する可能性があるため、タスクが複雑になります。
短い文
グーグルはAIがあなたの散文を整えることを望んでいます。この目的のために、そこでの研究者は 史上最大のデータセット 長い文を同等の意味を持つ小さな文に分割するため。大量の編集データはどこにありますか?もちろん、ウィキペディア。
ウィキペディアの豊富な編集履歴から、研究チームは人々が長い文を分割する事例を抽出しました。結果:このタスクの以前のベンチマークデータセットで見つかったものの60倍の明確な文分割の例と90倍の語彙。データセットは複数の言語にもまたがっています。
新しいデータで機械学習モデルをトレーニングすると、91%の精度が達成されました。 (ここでは、パーセンテージは、書き直された後も意味と文法の正確さを保持した文の割合を反映しています。)比較すると、以前のデータでトレーニングされたモデルは32%の精度にしか達しませんでした。両方のデータセットを組み合わせて別のモデルをトレーニングすると、95%の精度が達成されました。研究者たちは、さらに多くのデータソースを見つけることで将来の改善が可能であると結論付けました。
ソーシャルメディアバイアス
調査によると、私たちが生成する言語は、たとえその情報が明示的に述べられていなくても、人種、性別、年齢の優れた予測因子になり得ることが示されています。そのことを念頭に置いて、イスラエルのバルイラン大学とアレン人工知能研究所の研究者は、AIを使用してテキストのバイアスを解除しようとしました。 それらの埋め込まれたインジケーターを削除する 。
さまざまな人口統計の言語パターンを表すのに十分なデータを取得するために、彼らはTwitterを利用しました。彼らは、非ヒスパニック系白人と非ヒスパニック系黒人の間で均等に分散されたユーザーからのツイートを集めました。男性と女性の間; 18〜34歳と35歳以上の年齢層の人々の間。
次に、敵対的なアプローチ(2つのニューラルネットワークを互いに対比させる)を使用して、ツイート内の固有の人口統計指標を自動的に削除できるかどうかを確認しました。 1つのニューラルネットは人口統計を予測しようとしましたが、もう1つは、最初のモデルの予測精度を50%(または偶然)に下げることを目的として、テキストを完全にニュートラルになるように調整しようとしました。このアプローチは、最終的に人種、性別、年齢の指標を大幅に軽減しましたが、完全には軽減しませんでした。