AI-For-Beginners/translations/ja/lessons/4-ComputerVision/12-Segmentation
leestott 3ac667ea23 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00
..
lab 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00
README.md 🌐 Update translations via Co-op Translator 2025-08-24 22:28:16 +00:00
SemanticSegmentationPytorch.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00
SemanticSegmentationTF.ipynb 🌐 Update translations via Co-op Translator 2025-08-30 10:45:29 +00:00

README.md

セグメンテーション

以前、物体検出について学びました。物体検出では、画像内の物体を特定し、そのバウンディングボックスを予測することで位置を特定します。しかし、いくつかのタスクではバウンディングボックスだけでなく、より正確な物体の位置情報が必要です。このタスクはセグメンテーションと呼ばれます。

事前クイズ

セグメンテーションはピクセル分類として見ることができます。画像のピクセルについて、そのクラス(背景もクラスの一つを予測する必要があります。セグメンテーションには主に2つのアルゴリズムがあります

  • セマンティックセグメンテーションはピクセルのクラスを示すだけで、同じクラスの異なる物体を区別しません。
  • インスタンスセグメンテーションはクラスを異なるインスタンスに分割します。

例えば、インスタンスセグメンテーションではこれらの羊は異なる物体として扱われますが、セマンティックセグメンテーションではすべての羊が1つのクラスとして表されます。

画像出典:このブログ記事

セグメンテーションにはさまざまなニューラルネットワークのアーキテクチャがありますが、それらはすべて同じ構造を持っています。ある意味では、以前学んだオートエンコーダに似ていますが、元の画像を分解するのではなく、マスクを分解することが目的です。そのため、セグメンテーションネットワークは以下の部分で構成されています:

  • エンコーダ:入力画像から特徴を抽出します。
  • デコーダ:その特徴をマスク画像に変換します。このマスク画像は元の画像と同じサイズで、クラス数に対応するチャンネル数を持ちます。

画像出典:この論文

特にセグメンテーションで使用される損失関数について言及する必要があります。従来のオートエンコーダを使用する場合、2つの画像間の類似性を測定する必要があり、そのために平均二乗誤差MSEを使用できます。しかし、セグメンテーションでは、ターゲットマスク画像の各ピクセルがクラス番号一部は第三次元でワンホットエンコードされるを表すため、分類に特化した損失関数を使用する必要があります。具体的には、クロスエントロピー損失を全ピクセルにわたって平均化します。マスクがバイナリの場合は、バイナリクロスエントロピー損失BCEが使用されます。

ワンホットエンコーディングは、クラスラベルをクラス数と同じ長さのベクトルにエンコードする方法です。この記事でこの技術について詳しく学んでください。

医療画像におけるセグメンテーション

このレッスンでは、ネットワークをトレーニングして医療画像上で人間のほくろ(ネビ)を認識する方法を学びます。画像ソースとしてPH2データベースを使用します。このデータセットには、典型的なほくろ、非典型的なほくろ、メラーマの3つのクラスに分類された200枚の画像が含まれています。すべての画像には、ほくろを輪郭で示した対応するマスクも含まれています。

この技術はこの種の医療画像に特に適していますが、他にどのような現実世界の応用が考えられるでしょうか?

navi

画像出典PH2データベース

私たちはモデルをトレーニングして、背景からほくろをセグメント化することを目指します。

✍️ 演習:セマンティックセグメンテーション

以下のノートブックを開いて、さまざまなセマンティックセグメンテーションのアーキテクチャについて学び、それらを操作し、実際に動作を確認してください。

事後クイズ

結論

セグメンテーションは非常に強力な画像分類技術であり、バウンディングボックスを超えてピクセルレベルの分類を可能にします。この技術は医療画像を含むさまざまな応用分野で使用されています。

🚀 チャレンジ

人体セグメンテーションは、人の画像で行える一般的なタスクの1つにすぎません。他にも骨格検出ポーズ検出などの重要なタスクがあります。OpenPoseライブラリを試して、ポーズ検出がどのように使用されるかを確認してください。

復習と自己学習

このWikipediaの記事は、この技術のさまざまな応用についての良い概要を提供しています。インスタンスセグメンテーションやパノプティックセグメンテーションのサブドメインについてさらに学んでみてください。

課題

このラボでは、KaggleのSegmentation Full Body MADS Datasetを使用して人体セグメンテーションを試してみてください。

免責事項:
この文書は、AI翻訳サービス Co-op Translator を使用して翻訳されています。正確性を追求しておりますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご承知おきください。元の言語で記載された文書が公式な情報源とみなされるべきです。重要な情報については、専門の人間による翻訳を推奨します。この翻訳の使用に起因する誤解や誤認について、当方は一切の責任を負いません。