生成AI
生成AIは、新しい人工知能のデータを生成するよう設計されたモデルの分類です。これらのモデルは、テキスト、画像、動画、音声に含まれるパターンや構造を識別できるよう、大規模なデータセットを使ってトレーニングされます。トレーニングが完了すると、モデルのアルゴリズムは、ユーザーの入力に応じて、似た特性を持つ新しいデータを生成できます。モデルによっては、自然な文章の段落を生成したり、さまざまな芸術的スタイルの画像を描画したり、音声サンプルを作成したりできます。
大規模言語モデル
生成テキストモデル(大規模言語モデルとも呼ばれます)は、ユーザーのプロンプトに基づいてテキストのまとまりを生成できます。出力は人が書いたように見えることがありますが、生成テキストは実際には高度な予測入力の一種です。モデルは一度に1語ずつ生成し、トレーニングに使ったデータに基づいて、文章の次に来る単語を予測します。十分に大規模なデータセットがあれば、生成言語モデルはエッセイ、歌詞、さらには複数のプログラミング言語で書かれた機能的なソースコードまで生成できます。
大規模言語モデルごとに、使用するトレーニングデータのセットは異なります。最大規模のモデルは、本、ニュース記事、ソーシャルメディアへの投稿、研究論文、エッセイなど、さまざまなテキストを使用します。生成テキストモデルの例として、ChatGPT、Google Bard、Bing Chatがあります。
拡散モデル
生成画像モデルは、拡散モデリングと呼ばれる手法を使って画像を作成します。これらのモデルは、各画像の内容と芸術的スタイルを説明するタグを人間のトレーナーが付けた大規模なデータセットを分析する機械学習によってトレーニングされます。モデルはトレーニング中にこれらのタグを使い、画像内の特定のパターンや構造と、それに関連するテキストを結び付けます。
トレーニング中、拡散モデルはまず、ランダムなノイズを少しずつ加えながら、画像を長い一連の手順で分解します。元の画像を静止画のような状態まで変化させた後、モデルはランダムなノイズを置き換える細部を生成し、画像の内容タグに基づいて画像を少しずつ再構成します。モデルはこの処理を数え切れないほど繰り返しながら、ニューラルネットワークが変数を調整し、再現した画像が元の画像に似るようにします。トレーニングが完了すると、モデルは学習したキーワードやタグを使い、ユーザーのプロンプトからまったく新しい画像を作成できます。生成画像モデルの例として、DALL-E、Midjourney、Stable Diffusionがあります。
倫理的懸念
生成AI技術の急速な発展には、いくつかの倫理的懸念が伴います。これらのモデルには膨大なトレーニングデータが必要です。言語モデルでは数十テラバイトのテキスト、拡散モデルでは数億枚の画像が必要になります。これらのトレーニングセットには著作権で保護された素材が含まれていることが多く、元の制作者に credit や報酬を与えずに、そうした作品に基づく二次的な素材を作成する可能性があります。トレーニングセットには、本人の同意を得ずに収集された人々の写真が含まれていることもあります。さらに、生成AIの出力に著作権が認められるかどうか(また、その著作権を誰が所有するのか)は、法律上まだ決着していない問題です。
生成AIモデルの性能は、使用できるトレーニングデータのセットに左右され、データセット内の問題がモデルの出力に現れることがあります。モデルのトレーニングデータセットに偏った言葉遣いや画像を含む素材があると、モデルがその偏りを取り込み、出力に含める可能性があります。生成AIモデルの開発者は、ヘイトスピーチを取り除くためにフィルタリングすることが多い一方、微妙な偏りを検出して除去するのははるかに困難です。また、事実と異なる情報を含むデータでトレーニングされたモデルは、その情報を伝えてしまい、ユーザーを誤解させる可能性があります。
知識をテストする