ディープラーニングの応用例
G検定 学習ガイド / 30問 / 更新:2026年9月8日
画像認識、自然言語処理、音声、生成モデルなどの応用を学びます。モデルの名前を暗記する前に、何を入力し、どのような形の結果を出すタスクかを確かめましょう。
理解のポイント
画像分類は画像全体、物体検出は位置とクラス、セグメンテーションは画素ごとの領域を扱います。生成AIでは、生成方法、事前学習、追加学習、検索による補助を同じ仕組みと考えないことが大切です。
このページは解答を確認しながら読む教材です。答えを見ずに挑戦したい場合は、演習ページの単元一覧から該当する単元を選んでください。
30問の解答と解説
問題文を開くと、正解・考え方・各選択肢の理由を確認できます。
01道路画像の各画素に「車」「歩道」「空」のクラスを割り当て、同じクラスの個体は区別しないタスクを選べ。
画像認識 / 問題ID:g-026
正解:セマンティックセグメンテーション
セマンティックセグメンテーションは画素ごとに意味的なクラスを割り当てます。車Aと車Bを別個体として分けるならインスタンスセグメンテーションです。物体検出は通常、領域を枠などで示します。
選択肢ごとの理由
- セマンティックセグメンテーション(正解)
画素ごとにクラスを付けるタスクです。
- 画像全体の分類
画像全体に対するラベルでは画素ごとに分かりません。
- 物体検出
通常は物体位置をバウンディングボックスなどで示します。
- 話者識別
音声から話者を識別するタスクです。
覚える要点:画素のクラス=セマンティック、個体まで分ける=インスタンス。
公式シラバスを確認02文中の一部の単語を隠し、左右の文脈を利用して予測する事前学習で知られるモデルを選べ。
自然言語処理 / 問題ID:g-027
正解:BERT
BERTの代表的な事前学習課題はMasked Language Modelです。文中の一部を隠し、前後の文脈から予測します。得られた表現を文書分類や質問応答などに利用できます。
選択肢ごとの理由
- BERT(正解)
双方向の文脈を利用する言語モデルです。
- k-means
クラスタリングの手法です。
- YOLO
物体検出のモデル群です。
- 主成分分析
線形の次元削減手法です。
覚える要点:BERTは、隠した語を前後の文脈から考える。
公式シラバスを確認03録音データから「何を話したか」ではなく「誰が話したか」を推定するタスクを選べ。
音声処理 / 問題ID:g-028
正解:話者識別
話者識別は声の特徴から話者を推定します。音声認識は発話内容を文字などに変換する処理です。同じ録音を使っても、推定したい対象によってタスク名は異なります。
選択肢ごとの理由
- 話者識別(正解)
話している人の識別が目的です。
- 音声認識
発話の内容を認識します。
- 音声合成
テキストなどから音声を生成します。
- 機械翻訳
ある言語の内容を別の言語へ変換します。
覚える要点:「誰」なら話者識別、「何を」なら音声認識。
公式シラバスを確認04RLHFという学習アプローチの説明として、最も適切なものを選べ。
深層強化学習 / 問題ID:g-029
正解:人間の評価を強化学習に利用する
RLHFはReinforcement Learning from Human Feedbackです。例えば人間の出力比較をもとに報酬モデルを学習し、それを用いて方策を調整します。評価者の偏りや報酬の不完全さも考慮が必要です。
選択肢ごとの理由
- 人間の評価を強化学習に利用する(正解)
人の評価を学習信号に利用するアプローチです。
- 人間がすべての重みを手で設定する
人が全パラメータを直接決めるわけではありません。
- 報酬を一切使わずに強化学習する
強化学習では報酬の信号を使います。
- 訓練データを常に公開することを意味する
データ公開の方式を表す用語ではありません。
覚える要点:RLHFのHFはHuman Feedback。
公式シラバスを確認05拡散モデルによる画像生成の基本的な考え方を選べ。
データ生成 / 問題ID:g-030
正解:ノイズの除去過程を学び、ノイズから画像を作る
拡散モデルでは画像を段階的にノイズ化する過程に対応して、ノイズを除去する方向のモデルを学びます。生成時はノイズから段階的に構造を作ります。単なる画像検索とは異なります。
選択肢ごとの理由
- ノイズの除去過程を学び、ノイズから画像を作る(正解)
ノイズ除去を繰り返す生成の考え方です。
- 保存済み画像を検索し、そのまま一枚を取り出す
生成モデルであり、単なる検索とは異なります。
- 画像を入力して、そのカテゴリだけを予測する
分類ではなく画像の生成が目的です。
- 各画素を同じ値に固定し、単色の画像を出力する
一様な画像しか得られず、構造を生成できません。
覚える要点:拡散モデルはノイズから少しずつ画像を作る。
公式シラバスを確認06学習済みモデルを新しいタスクに追加学習したところ、以前できたタスクの性能が大幅に下がった。この現象を選べ。
転移学習・ファインチューニング / 問題ID:g-031
正解:破滅的忘却
破滅的忘却は、新しいデータへの学習で重みが変わり、既存の知識や能力が損なわれる現象です。旧データの再利用や重み変化への制約などで緩和を試みますが、転移学習で自動的に防げるものではありません。
選択肢ごとの理由
- 破滅的忘却(正解)
新しい学習に伴う既存能力の喪失です。
- コールドスタート問題
推薦などで履歴が不足している問題です。
- マージン最大化
SVMなどの学習基準です。
- バッチ正規化
中間表現の統計を整える手法です。
覚える要点:新しく覚えた代わりに以前の能力を失う=破滅的忘却。
公式シラバスを確認07画像とその説明文を対応付けて学習し、画像と言語の表現を結び付けるモデルとして適切なものを選べ。
マルチモーダル / 問題ID:g-032
正解:CLIP
CLIPは画像とテキストの対応を利用して表現を学習します。同じ内容の画像と文章の表現が近くなるように学ぶことで、ラベル候補を文章として与える画像分類などに利用できます。
選択肢ごとの理由
- CLIP(正解)
画像と言語を対応付けるモデルです。
- 単回帰モデル
一つの説明変数から数値を予測するモデルです。
- k-means単体
クラスタリング自体は画像と言語の対応学習を意味しません。
- ARモデル
過去の値から時系列を表す自己回帰モデルです。
覚える要点:複数の情報形式を扱うことがマルチモーダル。
公式シラバスを確認08画像分類の判断に関係した領域を、勾配と特徴マップを使って可視化する手法を選べ。
モデルの解釈性 / 問題ID:g-033
正解:Grad-CAM
Grad-CAMは対象クラスの勾配を使って特徴マップを重み付けし、判断に関係する画像領域を可視化します。判断の手掛かりを調べる方法であり、因果関係や判断の正しさを保証するものではありません。
選択肢ごとの理由
- Grad-CAM(正解)
勾配を使うクラス活性化の可視化手法です。
- ドロップアウト
過学習の抑制を狙う手法です。
- 量子化
数値の表現精度を下げる軽量化です。
- データ拡張
訓練入力に変換を加える手法です。
覚える要点:可視化は判断の点検に役立つが、正しさの証明ではない。
公式シラバスを確認09大きなモデルの出力分布を教師信号として、小さなモデルを学習させる方法を選べ。
モデルの軽量化 / 問題ID:g-034
正解:知識蒸留
知識蒸留では教師モデルの振る舞いを生徒モデルに学ばせます。正解ラベルだけでなく、ほかのクラスにもどの程度の確率を与えるかという情報を伝えられます。小さいモデルで性能を保つことを目指します。
選択肢ごとの理由
- 知識蒸留(正解)
教師の出力を生徒が学ぶ手法です。
- プルーニング
不要な重みや構造を取り除く方法です。
- 量子化
重みなどの数値表現に使うビット数を減らします。
- パディング
画像などの周辺に値を追加する操作です。
覚える要点:蒸留=教える、枝刈り=削る、量子化=表現を小さくする。
公式シラバスを確認10物体検出が画像分類に追加して求める代表的な出力を選べ。
画像認識 / 問題ID:g-181
正解:物体の位置を示す枠
画像分類は画像に何があるかを答えます。物体検出は、それが画像のどこにあるかも出し、通常はバウンディングボックスを使います。複数の物体を扱えます。
選択肢ごとの理由
- 物体の位置を示す枠(正解)
カテゴリに加えて位置を出します。
- 画像全体に一つのラベルだけ
通常の画像分類の出力です。
- 音声の話者名
画像の位置検出ではありません。
- 単語の活用形
形態素解析に関わります。
覚える要点:検出は「何が・どこに」。
公式シラバスを確認11同じ「人」クラスでも一人ずつ別のマスクに分けるタスクを選べ。
画像認識 / 問題ID:g-182
正解:インスタンスセグメンテーション
インスタンスは個体を意味します。同じクラスの対象が複数あっても、それぞれを別の領域として切り分けます。セマンティックとの違いは同一クラス内の個体識別です。
選択肢ごとの理由
- インスタンスセグメンテーション(正解)
クラスと個体を画素単位で分けます。
- 画像全体の分類
個々の画素を区分しません。
- 音声合成
対象が違います。
- 通常のセマンティックセグメンテーションのみ
同じクラスの個体は区別しません。
覚える要点:同じ種類でも別の個体として分ける。
公式シラバスを確認12YOLOやSSDに代表されるOne-stage型の物体検出の特徴を選べ。
画像認識 / 問題ID:g-183
正解:位置とクラスを単一段階で予測する
One-stage型は画像から直接、位置やクラスを予測する構成です。Two-stage型は候補領域の提案と分類などを分けます。速度や精度の比較はモデルと条件で変わります。
選択肢ごとの理由
- 位置とクラスを単一段階で予測する(正解)
高速化を狙った構成です。
- 一枚に一物体しか検出できない
複数物体を検出できます。
- 必ず教師ラベル不要である
通常は位置とクラスの教師を使います。
- 画像を生成することが主目的である
検出モデルです。
覚える要点:One-stageは、検出を一段階でまとめて行う。
公式シラバスを確認13U-Netの特徴として適切なものを選べ。
画像認識 / 問題ID:g-184
正解:縮小・拡大経路の対応する特徴を結ぶ
U-Netは画像を縮小して意味を捉え、拡大する経路で位置情報を復元します。対応する特徴をつなぐことで、詳細と文脈の両方を利用します。
選択肢ごとの理由
- 縮小・拡大経路の対応する特徴を結ぶ(正解)
細かい位置情報を使うセグメンテーションに役立ちます。
- 時間方向だけに回帰する
RNNではありません。
- 語彙頻度だけを数える
BoWではありません。
- 全画素を一つの数にしかできない
画素単位の出力を作れます。
覚える要点:U字の縮小・拡大と、対応する特徴の接続。
公式シラバスを確認14Vision Transformerが画像を扱う典型的な入力処理を選べ。
画像認識 / 問題ID:g-185
正解:画像パッチをトークン系列として扱う
ViTは画像パッチを埋め込みに変換し、Transformerで関係を学びます。画像認識に畳み込み以外の構造を使う代表例です。位置情報も与えます。
選択肢ごとの理由
- 画像パッチをトークン系列として扱う(正解)
画像を系列表現に変換します。
- 必ず画像を文字に手入力する
手入力は不要です。
- 音声波形に変換してだけ使う
画像のパッチを利用できます。
- 全画素を削除する
入力情報がなくなります。
覚える要点:画像パッチをトークンとしてTransformerへ。
公式シラバスを確認15Bag-of-Wordsの基本表現で失われやすいものを選べ。
自然言語処理 / 問題ID:g-186
正解:単語の並び順
BoWは単語が何回現れたかなどを数えます。同じ単語が同じ回数含まれていれば、語順が違う文でも同じ表現になることがあります。
選択肢ごとの理由
- 単語の並び順(正解)
単語の出現数などで表します。
- 単語の出現回数
出現頻度は使います。
- 語彙の種類すべて
語彙ごとの軸を使います。
- 文章の存在
文章を特徴ベクトルで表します。
覚える要点:単語の袋なので、順序は基本的に残らない。
公式シラバスを確認16TF-IDFで高く重み付けされやすい語を選べ。
自然言語処理 / 問題ID:g-187
正解:対象文書に多く、他文書に少ない語
TFはその文書内での頻度、IDFは多くの文書に現れる一般的な語の重みを下げる要素です。例えば多くの文書に共通する語より、その記事に特徴的な語を重視します。
選択肢ごとの理由
- 対象文書に多く、他文書に少ない語(正解)
文書の特徴を示しやすい語です。
- すべての文書で同じように頻出する語
IDFが小さくなります。
- 対象文書に一度も出ない語
通常TFが0です。
- 必ず文字数が最も長い語
文字数は定義ではありません。
覚える要点:文書内で多く、文書全体では珍しい語を重視。
公式シラバスを確認17word2vecのCBOWとスキップグラムの対応を選べ。
自然言語処理 / 問題ID:g-188
正解:CBOWは周辺語から中心語、Skip-gramは中心語から周辺語
word2vecは語の共起する文脈を手掛かりに分散表現を学びます。二つの方式を、どちらを入力にして何を予測するかで覚えると混同しにくくなります。
選択肢ごとの理由
- CBOWは周辺語から中心語、Skip-gramは中心語から周辺語(正解)
予測の方向が逆です。
- 両者とも画像の画素を入力し、物体の位置とクラスを予測する
画像検出ではありません。
- CBOWは画像の生成に使い、Skip-gramは音声の生成に使う
単語表現の学習です。
- 両者とも予測対象を設定せず、誤差を求めないまま学習する
文脈を教師信号にします。
覚える要点:CBOWは周辺→中心、スキップグラムは中心→周辺。
公式シラバスを確認18ワンホット表現に対する分散表現の利点を選べ。
自然言語処理 / 問題ID:g-189
正解:低次元の連続ベクトルで類似性を表す
ワンホットは語ごとに別の軸を持ち、異なる語の距離は一様になりやすい表現です。分散表現では学習したベクトルの関係に、使われ方の類似性が反映されます。
選択肢ごとの理由
- 低次元の連続ベクトルで類似性を表す(正解)
学習した空間の近さを利用できます。
- すべての語が必ず直交する
それはワンホットに近い性質です。
- 語彙が増えるほど意味が消える
そのような定義ではありません。
- 外部の文脈を一切利用できない
文脈から学習できます。
覚える要点:異なる語の近さを、学習したベクトルで表す。
公式シラバスを確認19形態素解析の代表的な処理を選べ。
自然言語処理 / 問題ID:g-190
正解:文を形態素に分割し、品詞などを付ける
日本語では単語の境界に空白がないことが多いため、語の切れ目や品詞を判定する処理が重要です。文の係り受けを調べる構文解析とは段階を区別します。
選択肢ごとの理由
- 文を形態素に分割し、品詞などを付ける(正解)
単語の分割や品詞の解析です。
- 文章全体を画像に変換し、一枚にまとめる
画像化とは違います。
- 発話者の声を分析し、誰の音声かを判別する
音声処理の別タスクです。
- 画像に含まれるノイズを推定し、除去する
対象が違います。
覚える要点:形態素解析は語の単位、構文解析は構造。
公式シラバスを確認20MFCCが表す特徴の対象として最も適切なものを選べ。
音声処理 / 問題ID:g-191
正解:音声のスペクトルの特徴
MFCCは音声認識などで使う特徴量です。周波数情報を人間の聴覚に近いメル尺度で処理し、スペクトル包絡の特徴を表します。音声の内容や話者を学ぶ入力として利用できます。
選択肢ごとの理由
- 音声のスペクトルの特徴(正解)
人間の聴覚を考慮した周波数尺度を利用します。
- 画像の物体枠
音声の特徴ではありません。
- 契約の条項番号
法律の識別子ではありません。
- データの著作権者
権利情報ではありません。
覚える要点:MFCCは音声の周波数的な特徴。
公式シラバスを確認21CTCが音声認識で役立つ代表的な理由を選べ。
音声処理 / 問題ID:g-192
正解:フレームと文字の位置対応なしに学べる
音声は多数の時間フレームを持ち、文字数とは一致しません。CTCは空白記号などを使い、可能な対応をまとめて扱います。正解文字列は必要でも、各文字の細かな時間位置を付けずに学べます。
選択肢ごとの理由
- フレームと文字の位置対応なしに学べる(正解)
長さが違う系列の対応を扱います。
- 音声を必ず一つの数値にする
文字列の出力を扱えます。
- 正解の文字列が一切不要になる
通常は出力系列の教師を使います。
- すべての話者を同じ声にする
音声変換ではありません。
覚える要点:文字列は必要でも、一文字ごとの時刻は不要にできる。
公式シラバスを確認22DQNがニューラルネットワークで近似する主なものを選べ。
深層強化学習 / 問題ID:g-193
正解:行動価値関数Q
DQNは状態から各行動の価値をニューラルネットワークで予測します。表形式で全状態・行動の価値を持つことが難しい高次元の問題に対応するための方法です。
選択肢ごとの理由
- 行動価値関数Q(正解)
各行動からの収益を評価します。
- 画像の著作権
権利の判定ではありません。
- 教師ラベルの名前順
価値関数ではありません。
- 環境の全状態の完全な一覧
近似によって大きな状態空間を扱います。
覚える要点:DQNはQ値をネットワークで近似。
公式シラバスを確認23sim2realで問題となるシミュレーションと現実の差を緩和する方法を選べ。
深層強化学習 / 問題ID:g-194
正解:物理条件を変えたシミュレーションで学ぶ
仮想環境だけに過度に適合すると、現実の物理特性などの差に弱くなります。学習中の条件を広く変えることで、特定条件に依存しない方策を目指します。
選択肢ごとの理由
- 物理条件を変えたシミュレーションで学ぶ(正解)
ドメインランダマイゼーションの例です。
- 現実は必ずシミュレーションと同じと仮定する
差を無視しています。
- 現実での検証を常に省く
移行後の確認が必要です。
- すべての報酬を削除する
差の緩和策にはなりません。
覚える要点:仮想環境の条件を広げ、現実との差に備える。
公式シラバスを確認24オフライン強化学習が主に使うデータを選べ。
深層強化学習 / 問題ID:g-195
正解:事前に集めた行動・報酬などの履歴
オフライン強化学習は既存のログなどから学びます。新しい試行のリスクや費用を抑えられる一方、データに少ない行動の価値を過大評価しない工夫が重要です。
選択肢ごとの理由
- 事前に集めた行動・報酬などの履歴(正解)
学習中の新たな環境試行を前提にしません。
- 必ず学習中に毎回現実の装置を動かした結果
オンラインの試行とは区別します。
- 報酬を除いた単語辞書だけ
行動価値の学習に必要な情報が不足します。
- 未来の全行動の正解表
そのような表は通常ありません。
覚える要点:過去のログで学ぶため、ログ外の行動評価に注意。
公式シラバスを確認25GANの基本的な学習の関係を選べ。
データ生成 / 問題ID:g-196
正解:生成器と識別器を競わせる
GANでは生成側が本物らしいデータを作り、識別側が見分けようとします。この相互作用で生成を改善しますが、学習の不安定さや生成の多様性が失われる問題もあります。
選択肢ごとの理由
- 生成器と識別器を競わせる(正解)
敵対的な学習を行います。
- 正解クラスを常に一つに固定する
生成の仕組みではありません。
- すべての重みを人が手入力する
データから学習します。
- 入力を検索してコピーするだけ
生成分布を学びます。
覚える要点:作る側と見分ける側の競争で学ぶ。
公式シラバスを確認26NeRFに最も関連する用途を選べ。
データ生成 / 問題ID:g-197
正解:複数の観測視点から新しい視点を合成する
NeRFは位置や視線方向などから色や密度を表すモデルを学びます。撮影されていない視点からの見え方を合成する研究で使われます。単なる2D分類とは異なります。
選択肢ごとの理由
- 複数の観測視点から新しい視点を合成する(正解)
空間の放射場を表現します。
- 文書中の品詞を付ける
自然言語処理の別タスクです。
- 個人情報の第三者提供を契約する
法務ではありません。
- 数値データの中央値だけを求める
統計集計ではありません。
覚える要点:NeRFは、場面を学んで新しい視点を描く。
公式シラバスを確認27自己教師あり学習の教師信号の作り方を選べ。
転移学習・ファインチューニング / 問題ID:g-198
正解:元データから予測用の課題を作る
例えば文中の語を隠して当てると、元の文から正解を作れます。ラベルを人手で大量に用意する代わりに、データ内の構造を利用して表現を学ぶ考え方です。
選択肢ごとの理由
- 元データから予測用の課題を作る(正解)
外部の手付けラベルを減らせます。
- 人間が全例に分類ラベルを付けることだけ
通常の教師あり学習です。
- どんな目的関数も使わない
学習目標はあります。
- モデルが真実を無条件に知る
自己という語の意味ではありません。
覚える要点:正解の手掛かりを、データ自身から作る。
公式シラバスを確認28ファインチューニングの典型的な操作を選べ。
転移学習・ファインチューニング / 問題ID:g-199
正解:事前学習した重みを対象タスクで更新する
事前学習で得た特徴や知識を使い、目的のデータで調整します。少ないデータでも有効な場合がありますが、過学習や破滅的忘却を避けるため更新範囲などを検討します。
選択肢ごとの理由
- 事前学習した重みを対象タスクで更新する(正解)
既存の知識を出発点にします。
- 全重みを必ず0に戻してから学ぶ
事前学習の利用を失います。
- 出力を表示するだけで重みを更新しない
通常の推論です。
- 問題文の文字を大きくする
学習手法ではありません。
覚える要点:学習済みの重みを出発点に、目的へ調整する。
公式シラバスを確認29Permutation Importanceで行う典型的な操作を選べ。
モデルの解釈性 / 問題ID:g-200
正解:特徴をシャッフルした後の性能低下を見る
一つの特徴の値を入れ替えて入力と目的の対応を壊し、性能がどれだけ落ちるかを見ます。相関する特徴がある場合などには解釈上の注意が必要で、因果効果そのものではありません。
選択肢ごとの理由
- 特徴をシャッフルした後の性能低下を見る(正解)
その特徴へのモデルの依存を測ります。
- すべての特徴を永久に削除する
重要度の検証とは異なります。
- 最も大きい重みだけを正解とする
重みの絶対値だけではありません。
- 出力を常に平均値にする
比較対象を壊す方法ではありません。
覚える要点:特徴の対応を壊したときの性能変化を見る。
公式シラバスを確認30量子化とプルーニングの違いとして適切なものを選べ。
モデルの軽量化 / 問題ID:g-201
正解:量子化は数値のビット数、剪定は重みや構造を減らす
量子化は例えば32ビットの実数を低ビットで表現します。プルーニングは重要度の低い結合やチャネルを削ります。どちらも精度と速度・容量の兼ね合いを再評価します。
選択肢ごとの理由
- 量子化は数値のビット数、剪定は重みや構造を減らす(正解)
軽くする対象が異なります。
- 両者とも教師データを新規に集め、データ件数を増やす
データ収集ではありません。
- 量子化は数値表現を保ったまま、重みの個数を半減する
主に値の表現精度を変えます。
- 剪定はすべての重みを倍にして、モデルの規模を拡大する
不要な要素を削ります。
覚える要点:表現を小さくする量子化、構造を削るプルーニング。
公式シラバスを確認