OpenAIは、1.5 billionのパラメータを持つ大規模なTransformerベースの言語モデルであるGPT-2,を導入しました。このモデルは、ゼロショット設定で幅広い自然言語処理タスクを実行することが可能です。WebTextと呼ばれる8 millionのウェブページからなる多様なデータセットでトレーニングされており、タスク固有の監督なしに、読解、要約、翻訳、質疑応答などのタスクにおいて顕著な能力を発揮すると報じられています。
研究によれば、GPT-2はテストされた8つの言語モデリングデータセットのうち7つにおいて、最先端のパフォーマンスを達成したとのことです。特に、これらのタスクを実行するモデルの能力は、特定の目的のための明示的な微調整(fine-tuning)ではなく、その規模とトレーニングデータの多様性によってもたらされていると述べられています。
欺瞞的なコンテンツや虐待的なコンテンツの生成といった悪用される可能性への懸念から、OpenAIはトレーニング済みモデルの全ウェイトを公開しないことを選択しました。その代わりに、同社は段階的なリリース戦略を採用しており、研究者が実験を行えるよう、モデルのより小規模なバージョンを提供しています。このアプローチは、責任ある開示(responsible disclosure)における実験として意図されており、AIコミュニティが大規模モデルの社会的影響や公開の規範について議論することを可能にします。
情報源:
- Due to concerns about malicious applications, GPT2 will not be released (2019) (Hacker News Frontpage, 2026-09-13)
- Read paper