AI-For-Beginners/translations/ja/lessons/4-ComputerVision/07-ConvNets
leestott 3ac667ea23 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00
CNN_Architectures.md 🌐 Update translations via Co-op Translator 2025-08-24 22:28:16 +00:00
ConvNetsPyTorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00
ConvNetsTF.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-24 22:28:16 +00:00

README.md

畳み込みニューラルネットワーク (CNN)

これまでに、ニューラルネットワークが画像処理に非常に優れていることを見てきました。たとえ1層のパーセプトロンであっても、MNISTデータセットの手書き数字をある程度の精度で認識できることが分かっています。しかし、MNISTデータセットは非常に特殊で、すべての数字が画像の中心に配置されているため、タスクが簡単になっています。

講義前クイズ

現実世界では、画像内の正確な位置に関係なく、写真の中の物体を認識できることが求められます。コンピュータビジョンは一般的な分類とは異なります。なぜなら、写真の中で特定の物体を見つけようとする際、特定のパターンやその組み合わせを探すために画像をスキャンするからです。例えば、猫を探す場合、まず水平線を探してヒゲを形成し、その後、特定のヒゲの組み合わせが実際に猫の写真であることを示すかもしれません。特定のパターンの相対的な位置や存在が重要であり、画像上の正確な位置はそれほど重要ではありません。

パターンを抽出するために、畳み込みフィルタという概念を使用します。ご存知の通り、画像は2次元の行列、または色の深さを持つ3次元テンソルで表されます。フィルタを適用するとは、比較的小さなフィルタカーネル行列を使用し、元の画像の各ピクセルに対して隣接する点との加重平均を計算することを意味します。これは、小さなウィンドウが画像全体をスライドし、フィルタカーネル行列の重みに従ってすべてのピクセルを平均化するようなものと考えることができます。

垂直エッジフィルタ 水平エッジフィルタ

画像提供: Dmitry Soshnikov

例えば、MNISTの数字に3x3の垂直エッジフィルタと水平エッジフィルタを適用すると、元の画像で垂直および水平のエッジがある場所が強調されます例: 高い値が得られる。したがって、これら2つのフィルタはエッジを「探す」ために使用できます。同様に、他の低レベルのパターンを探すための異なるフィルタを設計することも可能です。

Leung-Malikフィルタバンクの画像

しかし、フィルタを手動で設計してパターンを抽出することもできますが、ネットワークを設計してパターンを自動的に学習させることも可能です。これがCNNの主要なアイデアの1つです。

CNNの主要なアイデア

CNNが動作する仕組みは、以下の重要なアイデアに基づいています:

  • 畳み込みフィルタはパターンを抽出できる
  • フィルタを自動的に学習するようにネットワークを設計できる
  • 元の画像だけでなく、高レベルの特徴においても同じアプローチを使用してパターンを見つけることができる。したがって、CNNの特徴抽出は、低レベルのピクセルの組み合わせから始まり、画像の部分の高レベルの組み合わせに至るまで、特徴の階層構造で機能する。

階層的特徴抽出

画像提供: Hislop-Lynchの論文研究内容に基づく

✍️ 演習: 畳み込みニューラルネットワーク

畳み込みニューラルネットワークがどのように機能するのか、またトレーニング可能なフィルタをどのように実現できるのかを、以下のノートブックを通じて学びましょう:

ピラミッドアーキテクチャ

画像処理に使用されるほとんどのCNNは、いわゆるピラミッドアーキテクチャに従っています。元の画像に適用される最初の畳み込み層は、通常、比較的少ない数のフィルタ816を持ち、水平/垂直の線やストロークなどの異なるピクセルの組み合わせに対応します。次のレベルでは、ネットワークの空間的次元を縮小し、フィルタの数を増やします。これにより、単純な特徴のより多くの組み合わせが可能になります。各層を進むにつれて、最終的な分類器に近づくにつれ、画像の空間的次元は減少し、フィルタの数は増加します。

例として、2014年にImageNetのトップ5分類で92.7%の精度を達成したVGG-16のアーキテクチャを見てみましょう:

ImageNetの層

ImageNetのピラミッド

画像提供: Researchgate

よく知られたCNNアーキテクチャ

よく知られたCNNアーキテクチャについてさらに学びましょう

免責事項:
この文書は、AI翻訳サービス Co-op Translator を使用して翻訳されています。正確性を追求しておりますが、自動翻訳には誤りや不正確な部分が含まれる可能性があります。元の言語で記載された文書を正式な情報源としてお考えください。重要な情報については、専門の人間による翻訳を推奨します。この翻訳の使用に起因する誤解や誤解釈について、当方は一切の責任を負いません。