Sobre el proyecto
## Resumen del proyecto
Chinese-LLaMA-Alpaca es un proyecto de código abierto de modelos de lenguaje grandes orientado al procesamiento del lenguaje natural en chino, cuyo objetivo es promover la investigación abierta de modelos grandes en la comunidad china. El proyecto amplía el vocabulario chino sobre la base del LLaMA original y realiza un segundo preentrenamiento con corpus chino para mejorar la comprensión semántica básica del chino; sobre esta base, el modelo chino Alpaca se ajusta aún más con datos de instrucciones en chino para mejorar la capacidad de comprensión y ejecución de instrucciones.
El informe técnico adjunto es "Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca" (arXiv:2304.08177).
## Capacidades principales
- Ampliación del vocabulario chino para el LLaMA original, mejorando la eficiencia de codificación y decodificación en chino.
- Publicación de código abierto del chino LLaMA preentrenado con texto chino, así como del chino Alpaca ajustado con instrucciones.
- Proporciona scripts de preentrenamiento y ajuste de instrucciones para que los usuarios puedan continuar el entrenamiento según sus necesidades.
- Soporta cuantificación local e implementación en CPU/GPU de computadoras personales (portátiles).
- Compatible con herramientas del ecosistema como transformers, llama.cpp, text-generation-webui, LlamaChat, LangChain, privateGPT, etc.
## Versiones del modelo
Los tamaños de modelo publicados incluyen 7B, 13B y 33B, cada uno con versiones básica, Plus y Pro. La serie Plus utiliza más datos de entrenamiento, y la serie Pro mejora el problema de respuestas demasiado cortas. Los modelos se dividen en dos categorías:
- Chino LLaMA: modelo base, entrenado con CLM tradicional, adecuado para continuación de texto, no para comprensión de instrucciones ni conversación multi-turno.
- Chino Alpaca: modelo de comprensión de instrucciones, ajustado con instrucciones, adecuado para preguntas y respuestas, escritura, sugerencias y comprensión de contexto multi-turno.
Debido a las restricciones de licencia del LLaMA original, el proyecto publica pesos LoRA, que deben fusionarse con el LLaMA original para obtener el modelo completo; no se pueden usar por separado.
## Flujo de uso
1. Descargue los pesos LoRA correspondientes desde Hugging Face, ModelScope o Baidu Netdisk.
2. Fusione los pesos LoRA con el LLaMA original; consulte la conversión en línea (Colab notebook) o el tutorial de conversión manual.
3. Elija el método de inferencia e implementación, incluyendo llama.cpp, Transformers, text-generation-webui, LlamaChat, LangChain, privateGPT, Colab Gradio Demo y una API similar a OpenAI para llamadas de demostración.
4. Seleccione el modelo y los parámetros de inicio adecuados según el tipo de tarea; por ejemplo, Alpaca requiere un formato de entrada que cumpla con la plantilla.
El tamaño del modelo fusionado varía según la escala; por ejemplo, 7B en FP16 es aproximadamente 13 GB, y después de cuantificación de 4 bits, aproximadamente 3.9 GB; 33B en FP16 es aproximadamente 60 GB, y después de cuantificación de 4 bits, aproximadamente 17.2 GB.
## Detalles de entrenamiento
El proceso de entrenamiento incluye tres partes: expansión del vocabulario, preentrenamiento y ajuste de instrucciones. El código de expansión del vocabulario se encuentra en merge_tokenizers.py; el código de preentrenamiento y ajuste de instrucciones se basa en run_clm.py de transformers y en el procesamiento de datos de Stanford Alpaca. Los scripts de entrenamiento relevantes se han publicado en la Wiki.
## Evaluación
El proyecto ha evaluado objetivamente varios modelos en el conjunto de datos C-Eval, que contiene aproximadamente 12.3K preguntas de opción múltiple en 52 disciplinas. El README enumera los puntajes promedio de zero-shot y 5-shot en los conjuntos valid/test para cada modelo, por ejemplo, Chinese-Alpaca-Plus-33B tiene un 5-shot de 43.5 en test. El proyecto también proporciona ejemplos de evaluación de generación y una plataforma de batalla en línea.
## Limitaciones y declaración
El proyecto señala explícitamente que los modelos pueden generar contenido dañino impredecible o contenido que no se ajusta a las preferencias humanas; debido a limitaciones de cómputo y datos, el entrenamiento no es suficiente y la comprensión del chino aún tiene margen de mejora; el proyecto en sí no proporciona una demo interactiva en línea, los usuarios deben implementarla localmente. Los recursos relacionados son solo para investigación académica, está estrictamente prohibido su uso comercial, y el contenido generado por el modelo no garantiza precisión.
## Proyectos relacionados
Los proyectos posteriores oficiales incluyen Chinese-LLaMA-Alpaca-2 (modelos grandes chinos LLaMA-2 y Alpaca-2) y Visual-Chinese-LLaMA-Alpaca (modelos grandes multimodales chinos LLaMA y Alpaca).
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.