|
|
||
|---|---|---|
| .. | ||
| lab | ||
| CBoW-PyTorch.ipynb | ||
| CBoW-TF.ipynb | ||
| README.md | ||
README.md
言語モデリング
Word2VecやGloVeのようなセマンティック埋め込みは、実際には言語モデリングへの第一歩です。これは、言語の性質を何らかの形で理解(または表現)するモデルを作成することを意味します。
講義前のクイズ
言語モデリングの主なアイデアは、ラベル付けされていないデータセットを教師なしで学習させることです。これは、ラベル付けされていないテキストが膨大に存在する一方で、ラベル付けされたテキストの量はラベル付けに費やせる労力によって常に制限されるため、重要です。多くの場合、テキスト内の欠損している単語を予測する言語モデルを構築できます。これは、テキスト内のランダムな単語をマスクして学習サンプルとして使用するのが簡単だからです。
埋め込みの学習
前回の例では、事前に学習されたセマンティック埋め込みを使用しましたが、それらの埋め込みがどのように学習されるかを見るのも興味深いです。以下のようなアイデアがいくつかあります:
- Nグラム言語モデリング:N個の前のトークンを見て次のトークンを予測する(Nグラム)
- 連続Bag-of-Words(CBoW):トークン列
W_{-N}, ...,W_Nの中間トークンW_0を予測する - Skip-gram:中間トークン
W_0から、隣接するトークンの集合{W_{-N},\dots, W_{-1}, W_1,\dots, W_N}を予測する
画像出典:この論文
✍️ 例ノートブック: CBoWモデルの学習
以下のノートブックで学習を続けてください:
結論
前回のレッスンでは、単語埋め込みがまるで魔法のように機能することを学びました!今回の内容で、単語埋め込みの学習がそれほど複雑な作業ではないことが分かりました。必要に応じて、特定の分野のテキストに特化した単語埋め込みを自分で学習させることも可能です。
講義後のクイズ
復習と自己学習
- PyTorch公式の言語モデリングチュートリアル
- TensorFlow公式のWord2Vecモデル学習チュートリアル
- gensimフレームワークを使用して、数行のコードで最も一般的な埋め込みを学習する方法はこちらのドキュメントに記載されています。
🚀 課題: Skip-Gramモデルを学習する
このラボでは、CBoWモデルのコードを変更してSkip-Gramモデルを学習させることに挑戦していただきます。詳細はこちら
免責事項:
この文書は、AI翻訳サービス Co-op Translator を使用して翻訳されています。正確性を追求しておりますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご承知おきください。元の言語で記載された文書が公式な情報源とみなされるべきです。重要な情報については、専門の人間による翻訳を推奨します。この翻訳の使用に起因する誤解や誤認について、当方は一切の責任を負いません。
