Buckets:

153 GB
1,642,414 files
Updated 4 minutes ago
Name
Size
_app
unit0
unit1
unit2
unit3
unit4
unit5
unit6
README.html28.6 kB
xet
README.md6.4 kB
xet
_toctree.yml1.6 kB
xet
favicon.png1.57 kB
xet
llms-full.txt142 kB
xet
llms.txt2.22 kB
xet
README.md

Khoá học Mô hình ngôn ngữ cơ bản

Đây là một khoá học thực hành về việc huấn luyện các mô hình ngôn ngữ (LM) cho các trường hợp sử dụng cụ thể. Khoá học này là cách thuận tiện để bắt đầu với việc điều chỉnh các mô hình ngôn ngữ, bởi vì mọi thứ đều có thể chạy được trên hầu hết các máy tính cá nhân. Tại đây, chúng ta không cần quá nhiều tài nguyên GPUs hay các dịch vụ trả phí để học tập. Khoá học được xây dựng dựa trên series mô hình SmolLM2, nhưng bạn có thể áp dụng các kỹ năng học được ở đây cho các mô hình lớn hơn hoặc các mô hình ngôn ngữ nhỏ khác.

Lưu ý: Vì khóa học được dịch từ bản gốc tiếng Anh, chúng tôi sẽ giữ lại một số thuật ngữ gốc nhằm tránh gây hiểu lầm.

s

Tham gia học ngay!
Khoá học này mở và được đánh giá bởi cộng đồng. Để tham gia khoá học hãy tạo Pull Request (PR) và gửi bài làm của bạn để được review. Các bước thực hiện:

    Fork repo tại đây
    Đọc tài liệu, thực hiện thay đổi, làm bài tập, thêm ví dụ của riêng bạn
    Tạo PR trên nhánh december_2024
    Nhận review và merge

Điều này sẽ giúp bạn học tập và xây dựng một khoá học có cộng đồng tham gia và luôn được cải thiện.

Chúng ta có thể thảo luận về quá trình học tập và phát triển trong thread này.

Nội dung khoá học

Khoá học này cung cấp phương pháp thực hành để làm việc với các mô hình ngôn ngữ nhỏ, từ huấn luyện ban đầu đến triển khai lên sản phẩm.

Bài Mô tả Trạng thái Ngày phát hành
Tinh chỉnh theo chỉ thị (Instruction Tuning) Học về huấn luyện có giám sát (SFT), định dạng chat, và thực hiện các chỉ thị cơ bản ✅ Sẵn sàng 3/12/2024
Tinh chỉnh theo sự ưu tiên (Preference Alignment) Học các kỹ thuật DPO và ORPO để huấn luyện mô hình theo sự uy tiên của người dùng ✅ Sẵn sàng 6/12/2024
Tinh chỉnh hiệu quả tham số (Parameter-efficient Fine-tuning) Học về LoRA, prompt tuning và các phương pháp huấn luyện hiệu quả ✅ Sẵn sàng 9/12/2024
Đánh giá mô hình (Evaluation) Sử dụng benchmark tự động và tạo đánh giá theo lĩnh vực cụ thể 🚧 Đang thực hiện 13/12/2024
Mô hình đa phương thức (Vision-language Models) Điều chỉnh các mô hình đa phương thức (Multimodal models) cho các tác vụ thị giác-ngôn ngữ 🚧 Đang thực hiện 16/12/2024
Dữ liệu nhân tạo (Synthetic Datasets) Tạo và đánh giá tập dữ liệu tổng hợp cho huấn luyện 📝 Đã lên kế hoạch 20/12/2024
Triển khai mô hình (Inference) Triển khai mô hình một cách hiệu quả 📝 Đã lên kế hoạch 23/12/2024

Tại sao lại chọn Mô hình Ngôn ngữ Nhỏ?

Mặc dù các mô hình ngôn ngữ lớn đã cho thấy khả năng ấn tượng, chúng thường yêu cầu tài nguyên tính toán đáng kể và có thể quá mức cần thiết cho các ứng dụng tập trung. Các mô hình ngôn ngữ nhỏ mang lại nhiều lợi thế cho các ứng dụng theo lĩnh vực cụ thể:

  • Hiệu quả: Yêu cầu ít tài nguyên tính toán hơn đáng kể để huấn luyện và triển khai
  • Tùy chỉnh: Dễ dàng tinh chỉnh phù hợp cho các lĩnh vực cụ thể
  • Kiểm soát: Dễ dàng hiểu và kiểm soát hành vi mô hình hơn
  • Chi phí: Chi phí huấn luyện và triển khai thấp hơn đáng kể
  • Bảo mật: Có thể triển khai trên mạng cục bộ mà không cần gửi dữ liệu tới API bên ngoài
  • Công nghệ xanh: Sử dụng tài nguyên hiệu quả (carbon footprint giảm)
  • Nghiên cứu học thuật dễ dàng hơn: Khởi đầu dễ dàng cho nghiên cứu học thuật trên mô hình ngôn ngữ với ít ràng buộc về tài nghiên tính toán

Yêu cầu tiên quyết

Trước khi bắt đầu, hãy đảm bảo bạn có:

  • Hiểu biết cơ bản về machine learning (ML) và xử lý ngôn ngữ tự nhiên (NLP)
  • Quen thuộc với Python, PyTorch và thư viện transformers
  • Hiểu về mô hình ngôn ngữ và tập dữ liệu có nhãn

Cài đặt

Chúng tôi duy trì khoá học như một package để bạn có thể cài đặt dễ dàng thông qua package manager. Chúng tôi gợi ý sử dụng uv, nhưng bạn có thể sử dụng các lựa chọn thay thế như pip hoặc pdm.

Sử dụng uv

Với uv đã được cài đặt, bạn có thể cài đặt khoá học như sau:

uv venv --python 3.11.0
uv sync

Sử dụng pip

Tất cả các ví dụ chạy trong cùng một môi trường python 3.11, vì vậy bạn nên tạo môi trường và cài đặt dependencies như sau:

# python -m venv .venv
# source .venv/bin/activate
pip install -r requirements.txt

Google Colab

Nếu dùng Google Colab bạn sẽ cần cài đặt dependencies một cách linh hoạt dựa trên phần cứng bạn đang sử dụng. Như sau:

pip install -r transformers trl datasets huggingface_hub

Tham gia và chia sẻ

Hãy chia sẻ khoá học này, để cùng nhau phát triển cộng đồng AI Việt Nam.

Biểu đồ sao của khoá học

Total size
153 GB
Files
1,642,414
Last updated
Sep 1
Pre-warmed CDN
US EU US EU

Contributors