このプロジェクトについて
## プロジェクト概要
Chinese-LLaMA-Alpaca は、中国語自然言語処理向けのオープンソース大規模言語モデルプロジェクトであり、中国語コミュニティにおける大規模モデルのオープンな研究を推進することを目的としています。このプロジェクトは、元の LLaMA に中国語の語彙を追加し、中国語コーパスを用いて二次事前学習を行うことで、中国語の基礎的な意味理解能力を向上させます。その上で、中国語 Alpaca モデルはさらに中国語の命令データを用いて命令調整を行い、命令の理解と実行能力を強化します。
プロジェクトに付随する技術レポートは『Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca』(arXiv:2304.08177)です。
## 主な機能
- 元の LLaMA に中国語語彙を追加し、中国語の符号化・復号化効率を向上。
- 中国語テキストで事前学習された中国語 LLaMA と、命令調整済みの中国語 Alpaca をオープンソース化。
- 事前学習スクリプトと命令調整スクリプトを提供し、ユーザーが必要に応じて継続学習可能。
- パソコン(ノートPC)の CPU/GPU 上でのローカル量子化とデプロイ体験をサポート。
- transformers、llama.cpp、text-generation-webui、LlamaChat、LangChain、privateGPT などのエコシステムツールと互換性あり。
## モデルバージョン
オープンソース化されているモデル規模は 7B、13B、33B で、各規模にベーシック版、Plus 版、Pro 版があります。Plus シリーズはより多くの学習データを使用し、Pro シリーズは応答が短すぎる問題を改善しています。モデルは2種類に分けられます。
- 中国語 LLaMA:ベースモデル。従来の CLM 学習を使用し、テキスト続きに適しています。命令理解やマルチターンチャットには適していません。
- 中国語 Alpaca:命令理解モデル。命令調整を使用し、QA、文章作成、提案、マルチターンの文脈理解に適しています。
元の LLaMA のライセンス制限により、プロジェクトが公開しているのは LoRA 重みであり、元の LLaMA とマージして初めて完全なモデルが得られます。単独では使用できません。
## 利用手順
1. Hugging Face、ModelScope、または百度網盤から対応する LoRA 重みをダウンロードします。
2. LoRA 重みを元の LLaMA とマージします。オンライン変換(Colab notebook)または手動変換チュートリアルを参照できます。
3. 推論とデプロイ方法を選択します。llama.cpp、Transformers、text-generation-webui、LlamaChat、LangChain、privateGPT、Colab Gradio Demo、OpenAI 風 API 呼び出し Demo などがあります。
4. タスクの種類に応じて適切なモデルと起動パラメータを選択します。例えば Alpaca はテンプレートに沿った入力形式を使用する必要があります。
マージ後のモデルサイズは規模によって異なります。例えば 7B の FP16 は約13GB、4ビット量子化後は約3.9GBです。33B の FP16 は約60GB、4ビット量子化後は約17.2GBです。
## 学習の詳細
学習プロセスは、語彙拡張、事前学習、命令調整の3つの部分から構成されます。語彙拡張のコードは merge_tokenizers.py にあります。事前学習と命令調整のコードは、transformers の run_clm.py と Stanford Alpaca のデータセット処理部分を参考にしています。関連する学習スクリプトは Wiki でオープンソース化されています。
## 評価状況
プロジェクトは C-Eval データセット上で複数のモデルを客観的に評価しました。テストセットは約12.3K問の選択問題を含み、52の学科をカバーしています。README には各モデルの valid/test セットにおける zero-shot と 5-shot の平均スコアが記載されています。例えば Chinese-Alpaca-Plus-33B の test 5-shot は43.5です。プロジェクトは生成結果の評価サンプルとオンライン対戦プラットフォームも提供しています。
## 限界と声明
プロジェクトは、モデルが予測不可能な有害なコンテンツや人間の好みに合わないコンテンツを生成する可能性があることを明示しています。計算資源とデータの制約により、学習は十分ではなく、中国語の理解能力にはまだ改善の余地があります。プロジェクト自体はオンラインのインタラクティブデモを提供しておらず、ユーザーは自分でローカルにデプロイする必要があります。関連リソースは学術研究のみを目的としており、商業利用は厳禁です。モデルの出力内容の正確性は保証されません。
## 関連プロジェクト
公式の後続プロジェクトには、Chinese-LLaMA-Alpaca-2(中国語 LLaMA-2、Alpaca-2 大規模モデル)と Visual-Chinese-LLaMA-Alpaca(マルチモーダル中国語 LLaMA & Alpaca 大規模モデル)があります。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.