|
|
||
|---|---|---|
| .. | ||
| lab | ||
| README.md | ||
README.md
コンピュータビジョン入門
コンピュータビジョンは、コンピュータがデジタル画像を高レベルで理解できるようにすることを目的とした分野です。これは非常に広い定義であり、理解は多くの異なる意味を持つことができます。例えば、画像内の物体を見つけること(物体検出)、何が起こっているかを理解すること(イベント検出)、画像をテキストで説明すること、またはシーンを3Dで再構築することなどが含まれます。また、人間の画像に関連する特別なタスクもあります。例えば、年齢や感情の推定、顔の検出と識別、3Dポーズ推定などです。
講義前クイズ
コンピュータビジョンの最も簡単なタスクの一つは画像分類です。
コンピュータビジョンは、しばしばAIの一分野と考えられています。現在、コンピュータビジョンのタスクのほとんどはニューラルネットワークを使用して解決されています。このセクションでは、コンピュータビジョンに使用される特別なタイプのニューラルネットワークである畳み込みニューラルネットワークについて詳しく学んでいきます。
しかし、画像をニューラルネットワークに渡す前に、多くの場合、画像を強化するためにいくつかのアルゴリズム的手法を使用することが理にかなっています。
画像処理に利用できるPythonライブラリはいくつかあります:
- imageio は、さまざまな画像フォーマットの読み書きに使用できます。また、動画フレームを画像に変換するための便利なツールであるffmpegもサポートしています。
- Pillow(PILとしても知られています)は、もう少し強力で、モーフィングやパレット調整などの画像操作もサポートしています。
- OpenCV は、C++で書かれた強力な画像処理ライブラリで、画像処理の事実上の標準となっています。便利なPythonインターフェースもあります。
- dlib は、多くの機械学習アルゴリズムを実装したC++ライブラリで、コンピュータビジョンアルゴリズムのいくつかも含まれています。Pythonインターフェースもあり、顔や顔のランドマーク検出などの難しいタスクにも使用できます。
OpenCV
OpenCVは、画像処理の事実上の標準と見なされています。多くの便利なアルゴリズムがC++で実装されています。PythonからもOpenCVを呼び出すことができます。
OpenCVを学ぶのに良い場所はこのLearn OpenCVコースです。私たちのカリキュラムでは、OpenCVを学ぶことが目的ではなく、どのように使用できるかのいくつかの例を示すことが目標です。
画像の読み込み
Pythonでは、画像をNumPy配列で便利に表現できます。例えば、320x200ピクセルのグレースケール画像は200x320の配列に格納され、同じ寸法のカラ―画像は200x320x3の形状を持ちます(3つのカラーチャンネル用)。画像を読み込むには、次のコードを使用できます:
import cv2
import matplotlib.pyplot as plt
im = cv2.imread('image.jpeg')
plt.imshow(im)
伝統的に、OpenCVはカラ―画像にBGR(青-緑-赤)エンコーディングを使用していますが、他のPythonツールはより伝統的なRGB(赤-緑-青)を使用します。画像を正しく表示するためには、NumPy配列内の次元を入れ替えるか、OpenCVの関数を呼び出してRGBカラースペースに変換する必要があります:
im = cv2.cvtColor(im,cv2.COLOR_BGR2RGB)
同じ cvtColor function can be used to perform other color space transformations such as converting an image to grayscale or to the HSV (Hue-Saturation-Value) color space.
You can also use OpenCV to load video frame-by-frame - an example is given in the exercise OpenCV Notebook.
Image Processing
Before feeding an image to a neural network, you may want to apply several pre-processing steps. OpenCV can do many things, including:
- Resizing the image using
im = cv2.resize(im, (320,200),interpolation=cv2.INTER_LANCZOS) - Blurring the image using
im = cv2.medianBlur(im,3)orim = cv2.GaussianBlur(im, (3,3), 0) - Changing the brightness and contrast of the image can be done by NumPy array manipulations, as described in this Stackoverflow note.
- Using thresholding by calling
cv2.threshold/cv2.adaptiveThreshold関数は、明るさやコントラストを調整するよりも好まれることがよくあります。 - 画像にさまざまな変換を適用する:
- 光学フロー を使用して画像内の動きを理解すること。
コンピュータビジョンの使用例
私たちのOpenCVノートブックでは、コンピュータビジョンが特定のタスクを実行するためにどのように使用できるかのいくつかの例を示します:
- 点字本の写真の前処理。私たちは、しきい値処理、特徴検出、透視変換、NumPy操作を使用して、ニューラルネットワークによるさらなる分類のために個々の点字記号を分離する方法に焦点を当てています。
![]() |
![]() |
![]() |
|---|
画像はOpenCV.ipynbからのものです。
- フレーム差を使用した動画の動きの検出。カメラが固定されている場合、カメラフィードからのフレームはお互いに非常に似ているはずです。フレームは配列として表されるため、2つの連続するフレームの配列を単純に引き算することで、ピクセルの差分が得られます。静止フレームではこの差分は低く、画像に substantial な動きがあると高くなります。
画像はOpenCV.ipynbからのものです。
-
光学フローを使用した動きの検出。光学フローを使用すると、動画フレーム上の個々のピクセルがどのように動くかを理解できます。光学フローには2つのタイプがあります:
- 密な光学フローは、各ピクセルがどこに移動しているかを示すベクトルフィールドを計算します。
- 疎な光学フローは、画像内のいくつかの特徴(例えば、エッジ)を取り、それらの軌跡をフレームからフレームへと構築することに基づいています。
画像はOpenCV.ipynbからのものです。
✍️ 例ノートブック:OpenCV OpenCVを実際に試してみる
OpenCVノートブックを探求して、OpenCVを使った実験を行いましょう。
結論
時には、動きの検出や指先の検出といった比較的複雑なタスクが純粋にコンピュータビジョンによって解決できることがあります。そのため、コンピュータビジョンの基本的な技術や、OpenCVのようなライブラリができることを知っておくことは非常に役立ちます。
🚀 チャレンジ
AIショーのこのビデオを見て、Cortic Tigersプロジェクトについて学び、ロボットを通じてコンピュータビジョンタスクを民主化するためのブロックベースのソリューションをどのように構築したかを学んでください。この分野に新しい学習者を迎え入れるのを助ける他のプロジェクトについて調査してみてください。
講義後クイズ
レビューと自己学習
光学フローについては、この素晴らしいチュートリアルでさらに学んでください。
課題
このラボでは、シンプルなジェスチャーでビデオを撮影し、光学フローを使用して上下左右の動きを抽出することが目標です。
免責事項:
この文書は、機械ベースのAI翻訳サービスを使用して翻訳されています。正確性を追求していますが、自動翻訳には誤りや不正確さが含まれる可能性があることをご承知おきください。元の文書は、その母国語での権威ある情報源と見なされるべきです。重要な情報については、専門の人間翻訳を推奨します。この翻訳の使用から生じる誤解や誤訳について、当社は責任を負いません。




