Bỏ qua tới nội dung chính
VNSO

Trung tâm AI · Hướng dẫn

Cài đặt môi trường huấn luyện AI trên máy chủ GPU

Từ lúc nhận máy chủ GPU Linux đến khi fine-tune được model: mỗi bước có giải thích ngắn cho người mới, lệnh để sao chép, cách kiểm tra đã làm đúng và link tài liệu chính thức.

  • Ubuntu 22.04 / 24.04 / 26.04 LTS
  • CUDA 13.4
  • PyTorch 2.14.0
  • Tra cứu 15/09/2026

Trước khi bắt đầu: máy chủ chạy Ubuntu LTS (22.04, 24.04 hoặc 26.04 — các bản được tài liệu driver NVIDIA và Docker liệt kê), có quyền sudo và đăng nhập được qua SSH. Chưa rõ SSH là gì? Đọc SSH là gì. Chưa có máy? Xem máy chủ GPU hoặc Cloud GPU theo giờ (mở tab mới).

Bạn làm trên:
  1. Bước 1Kiểm tra máy chủ đã nhận GPU

    Trước khi cài gì, hãy chắc chắn hệ điều hành nhìn thấy card NVIDIA. Nếu lệnh nvidia-smi đã chạy được nghĩa là driver đã có sẵn — bạn có thể bỏ qua bước cài driver.

    TerminalXem card NVIDIA gắn trên máy
    lspci | grep -i nvidia
    TerminalNếu driver đã cài: xem GPU, bộ nhớ, tiến trình đang chạy
    nvidia-smi

    Kiểm tra đã làm đúng

    lspci liệt kê được thiết bị NVIDIA. Nếu nvidia-smi báo không tìm thấy lệnh, chuyển sang mục “Cài NVIDIA driver”.

    Tài liệu chính thức: CUDA Installation Guide for Linux (bản 13.4) (mở tab mới) · nvidia-smi — tài liệu dòng lệnh (mở tab mới)

  2. Bước 2Cài NVIDIA driver

    Driver là phần mềm để hệ điều hành điều khiển GPU. Dù bạn cài thẳng lên máy hay dùng Docker, driver luôn phải nằm trên máy chủ (máy host) — container không mang driver theo.

    Tài liệu NVIDIA dùng dấu nhắc # cho lệnh cần quyền root — ở đây viết sẵn sudo. Thay ubuntu2404 bằng ubuntu2204 hoặc ubuntu2604 đúng phiên bản Ubuntu của bạn (máy x86_64).
    Terminal1. Cài kernel headers cho kernel đang chạy
    sudo apt install linux-headers-$(uname -r)
    Terminal2. Thêm kho phần mềm của NVIDIA (gói cuda-keyring)
    wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-keyring_1.1-1_all.deb
    sudo dpkg -i cuda-keyring_1.1-1_all.deb
    sudo apt update
    Terminal3. Cài driver (open kernel modules) rồi khởi động lại
    sudo apt install nvidia-open
    sudo reboot
    Máy chủ chỉ dùng để tính toán, không cần giao diện đồ hoạ: tài liệu NVIDIA có phương án gọn hơn là sudo apt -V install libnvidia-compute nvidia-dkms-open.

    Kiểm tra đã làm đúng

    TerminalSau khi khởi động lại
    nvidia-smi
    cat /proc/driver/nvidia/version

    Hai lệnh in ra tên GPU và phiên bản driver. Ghi lại số phiên bản driver: CUDA 13.x cần driver từ 580 trở lên, CUDA 12.x cần từ 525 (bảng driver tối thiểu trong CUDA Release Notes).

    Tài liệu chính thức: NVIDIA Driver Installation Guide — Ubuntu (mở tab mới) · NVIDIA Driver Installation Guide — Post-installation Actions (mở tab mới) · CUDA Toolkit Release Notes — bảng driver tối thiểu (mở tab mới)

  3. Bước 3Docker + NVIDIA Container Toolkit

    Docker đóng gói phần mềm và thư viện vào container, chạy giống nhau trên mọi máy. NVIDIA Container Toolkit là cầu nối để container dùng được GPU của máy chủ.

    Máy chủ riêng

    Nếu bạn cài thẳng lên máy chủ và không dùng container, có thể bỏ qua mục này. Chuyển sang tab “Container Docker” để xem lệnh.

    Kiểm tra đã làm đúng

    TerminalChạy nvidia-smi bên trong một container
    sudo docker run --rm --runtime=nvidia --gpus all ubuntu nvidia-smi

    Kết quả hiện bảng GPU giống như khi chạy nvidia-smi trên máy chủ là container đã thấy GPU.

    Tài liệu chính thức: Install Docker Engine on Ubuntu (mở tab mới) · Linux post-installation steps for Docker Engine (mở tab mới) · NVIDIA Container Toolkit — Installing (mở tab mới) · NVIDIA Container Toolkit — Running a Sample Workload (mở tab mới)

  4. Bước 4Cài CUDA Toolkit (tuỳ chọn)Tuỳ chọn

    CUDA Toolkit là bộ công cụ để biên dịch chương trình chạy trên GPU (trình biên dịch nvcc, thư viện). Theo trang cài đặt PyTorch, bạn chỉ phải tự cài CUDA khi build PyTorch từ mã nguồn. Hãy cài khi cần biên dịch mã CUDA — ví dụ build llama.cpp bản CUDA — hoặc khi thư viện bạn dùng yêu cầu.

    Máy chủ riêng

    TerminalCài từ kho NVIDIA đã thêm ở mục cài driver (hai lệnh chạy riêng)
    sudo apt update
    sudo apt install cuda-toolkit
    TerminalThêm đường dẫn CUDA vào PATH (thêm dòng này vào ~/.bashrc để giữ lâu dài)
    export PATH=/usr/local/cuda-13.4/bin${PATH:+:${PATH}}
    Terminal(Tuỳ chọn) cuDNN cho CUDA 13
    sudo apt-get -y install cudnn9-cuda-13

    Kiểm tra đã làm đúng

    TerminalMáy chủ riêng: kiểm tra thư mục cài đặt
    ls /usr/local/cuda-13.4/bin/

    Thư mục có nvcc là cài xong. Gặp lỗi “nvcc: No such file or directory” nghĩa là PATH chưa đúng (mục 15.2 trong hướng dẫn CUDA). Muốn kiểm tra kỹ, NVIDIA khuyên build và chạy mẫu deviceQuery trong kho cuda-samples. Số 13.4 là bản hiện hành lúc tra cứu — nếu kho đã lên bản mới, đổi theo tên thư mục thật trong /usr/local/.

    Tài liệu chính thức: CUDA Installation Guide for Linux (bản 13.4) (mở tab mới) · cuDNN — Installing on Linux (mở tab mới) · PyTorch — Get Started Locally (Stable 2.14.0) (mở tab mới) · PyTorch Release 26.08 (NGC) (mở tab mới)

  5. Bước 5Tạo môi trường Python riêng

    Môi trường ảo giữ thư viện của từng dự án tách biệt, tránh việc cài bản mới cho dự án này làm hỏng dự án khác. Chọn MỘT trong ba cách. PyTorch bản ổn định hiện yêu cầu Python 3.10 trở lên.

    Máy chủ riêng

    TerminalCách 1 — venv có sẵn của Python
    sudo apt install python3-venv
    python3 -m venv ~/venvs/ai
    source ~/venvs/ai/bin/activate
    TerminalCách 2 — uv (tạo môi trường nhanh, tự tải Python nếu thiếu)
    curl -LsSf https://astral.sh/uv/install.sh | sh
    uv venv --python 3.12 --seed
    source .venv/bin/activate
    TerminalCách 3 — conda qua Miniforge
    wget "https://github.com/conda-forge/miniforge/releases/latest/download/Miniforge3-$(uname)-$(uname -m).sh"
    bash Miniforge3-$(uname)-$(uname -m).sh
    conda create -n ai python=3.12
    conda activate ai

    Kiểm tra đã làm đúng

    Dấu nhắc lệnh hiện tên môi trường (ví dụ (ai) hoặc (.venv)). Gõ deactivate để thoát môi trường.

    Tài liệu chính thức: venv — Creation of virtual environments (mở tab mới) · Gói python3-venv (Ubuntu 24.04 noble) (mở tab mới) · uv — Installation (mở tab mới) · uv — Using Python environments (mở tab mới) · Miniforge README (mở tab mới) · conda — Managing environments (mở tab mới) · PyTorch — Get Started Locally (Stable 2.14.0) (mở tab mới)

  6. Bước 6Cài PyTorch đúng bản CUDA

    Mỗi bản PyTorch được đóng gói cho vài phiên bản CUDA. Chọn bản khớp với driver: driver từ 580 trở lên dùng được các bản CUDA 13.x. Lệnh dưới đây lấy từ trang “Get Started” của pytorch.org (Stable 2.14.0, Linux, pip).

    Máy chủ riêng

    TerminalCUDA 13.0 (lựa chọn mặc định trên trang PyTorch)
    pip3 install torch torchvision
    TerminalCUDA 13.2
    pip3 install torch torchvision --index-url https://download.pytorch.org/whl/cu132
    TerminalCUDA 12.6 (máy có driver dòng 525–579)
    pip3 install torch torchvision --index-url https://download.pytorch.org/whl/cu126

    Kiểm tra đã làm đúng

    PythonChạy trong môi trường (hoặc container) vừa tạo
    import torch
    x = torch.rand(5, 3)
    print(x)
    print(torch.cuda.is_available())

    In ra một ma trận số ngẫu nhiên và True là PyTorch đã dùng được GPU. Nếu ra False: kiểm tra lại driver (mục “Cài NVIDIA driver”) và bản CUDA của PyTorch.

    Tài liệu chính thức: PyTorch — Get Started Locally (Stable 2.14.0) (mở tab mới) · CUDA Toolkit Release Notes — bảng driver tối thiểu (mở tab mới) · PyTorch Release Notes (NGC) — Running PyTorch (mở tab mới) · PyTorch Release 26.08 (NGC) (mở tab mới)

  7. Bước 7Chạy Jupyter an toàn qua SSH tunnel

    Jupyter cho phép viết và chạy code ngay trên trình duyệt — nhưng ai vào được Jupyter là chạy được lệnh trên máy chủ của bạn. Đừng mở cổng Jupyter ra internet. Cách an toàn: để Jupyter chỉ nghe trên máy chủ, rồi dùng SSH “đào đường hầm” từ máy tính của bạn.

    Máy chủ riêng

    TerminalTrên máy chủ (trong môi trường Python đã kích hoạt)
    pip install jupyterlab
    jupyter lab

    Mặc định Jupyter Server chỉ nghe ở localhost (127.0.0.1:8888), máy khác trên mạng không vào được.

    Kiểm tra đã làm đúng

    TerminalTrên máy tính của bạn: mở đường hầm (-N: chỉ chuyển cổng, không chạy lệnh)
    ssh -N -L 8888:localhost:8888 user@IP_MAY_CHU

    Mở http://127.0.0.1:8888 trên trình duyệt và đăng nhập bằng token Jupyter in ra ở terminal máy chủ. Có thể đặt mật khẩu bằng lệnh jupyter server password.

    Tài liệu chính thức: JupyterLab — Installation (mở tab mới) · Jupyter Server — Running a public Jupyter Server (mở tab mới) · ssh(1) — OpenBSD manual page (tuỳ chọn -L, -N) (mở tab mới) · Docker — Port publishing and mapping (mở tab mới) · Docker — Packet filtering and firewalls (Docker và ufw) (mở tab mới)

  8. Bước 8Fine-tune bằng LoRA / QLoRA (ví dụ tối thiểu)

    Fine-tune là dạy thêm cho model có sẵn bằng dữ liệu của bạn. LoRA chỉ huấn luyện một phần rất nhỏ tham số gắn thêm vào model; QLoRA nạp model gốc ở dạng nén 4-bit để giảm VRAM. Ví dụ dưới đây ghép đúng các đoạn mã trong tài liệu PEFT và Transformers.

    TerminalCài thư viện
    pip install --upgrade transformers accelerate bitsandbytes
    pip install peft
    Pythonqlora_setup.py — nạp model 4-bit và gắn LoRA
    import torch
    from transformers import AutoModelForCausalLM, BitsAndBytesConfig
    from peft import LoraConfig, get_peft_model, prepare_model_for_kbit_training
    
    # Model mở, giấy phép Apache-2.0 (xem model card trước khi dùng)
    model_id = "Qwen/Qwen2.5-7B-Instruct"
    
    config = BitsAndBytesConfig(
        load_in_4bit=True,
        bnb_4bit_quant_type="nf4",
        bnb_4bit_use_double_quant=True,
        bnb_4bit_compute_dtype=torch.bfloat16,
    )
    model = AutoModelForCausalLM.from_pretrained(model_id, quantization_config=config)
    model = prepare_model_for_kbit_training(model)
    
    lora_config = LoraConfig(
        r=16,
        lora_alpha=8,
        target_modules=["q_proj", "k_proj", "v_proj", "o_proj"],
        lora_dropout=0.05,
        bias="none",
        task_type="CAUSAL_LM"
    )
    model = get_peft_model(model, lora_config)
    model.print_trainable_parameters()
    PythonHuấn luyện bằng Trainer rồi lưu adapter (khung theo PEFT quicktour)
    from transformers import Trainer, TrainingArguments
    
    training_args = TrainingArguments(
        output_dir="qwen-lora-adapter",
        num_train_epochs=2,
        save_strategy="epoch",
        save_total_limit=3,
        report_to="tensorboard",
    )
    
    trainer = Trainer(
        model=model,
        args=training_args,
        train_dataset=tokenized_datasets["train"],  # dữ liệu đã token hoá của bạn
        data_collator=data_collator,
    )
    trainer.train()
    model.save_pretrained("qwen-lora-adapter")
    Tên lớp q_proj, k_proj, v_proj, o_proj đã đối chiếu với danh sách trọng số của Qwen2.5-7B-Instruct. Đổi sang model khác phải kiểm tra lại tên lớp. Muốn biết cần bao nhiêu VRAM, dùng máy tính VRAM; muốn ước lượng số GPU-giờ, dùng công cụ ước lượng huấn luyện.

    Kiểm tra đã làm đúng

    print_trainable_parameters() in ra số tham số được huấn luyện chỉ chiếm một tỷ lệ nhỏ trong tổng số — đó là dấu hiệu LoRA đã gắn đúng. Trong lúc train, loss được ghi vào thư mục output_dir.

    Tài liệu chính thức: PEFT — Installation (mở tab mới) · PEFT — Quicktour (LoraConfig, get_peft_model) (mở tab mới) · PEFT — Quantization (QLoRA, prepare_model_for_kbit_training) (mở tab mới) · Transformers — bitsandbytes (mở tab mới) · Transformers — Trainer / TrainingArguments (mở tab mới)

  9. Bước 9Huấn luyện trên nhiều GPU

    Khi một GPU không đủ bộ nhớ hoặc chạy quá lâu, ta chia việc cho nhiều GPU. Data parallel: mỗi GPU giữ một bản model, chia nhau dữ liệu. FSDP và DeepSpeed ZeRO: “xẻ” trạng thái optimizer, gradient, thậm chí cả tham số model ra nhiều GPU để tiết kiệm bộ nhớ. Ba công cụ khởi chạy phổ biến:

    Terminaltorchrun — trình khởi chạy của PyTorch (1 máy, NUM_TRAINERS = số GPU)
    torchrun \
        --standalone \
        --nnodes=1 \
        --nproc-per-node=$NUM_TRAINERS \
        train.py
    TerminalAccelerate — hỏi cấu hình một lần, sau đó chạy
    accelerate config
    accelerate launch --multi_gpu --num_processes=4 train.py
    TerminalDeepSpeed — cài và chạy với Trainer
    pip install deepspeed
    deepspeed --num_gpus 4 train.py
    JSONds_config.json — ZeRO stage 2, để "auto" cho DeepSpeed lấy giá trị từ TrainingArguments
    {
      "bf16": { "enabled": "auto" },
      "zero_optimization": { "stage": 2 },
      "gradient_clipping": "auto",
      "train_micro_batch_size_per_gpu": "auto",
      "train_batch_size": "auto",
      "gradient_accumulation_steps": "auto"
    }
    PythonTrỏ Trainer tới file cấu hình DeepSpeed
    args = TrainingArguments(
        deepspeed="ds_config.json",
        ...
    )

    ZeRO stage 1 chia trạng thái optimizer; stage 2 chia thêm gradient; stage 3 chia cả tham số model. Với PyTorch thuần, FSDP2 dùng hàm fully_shard() và cũng khởi chạy bằng torchrun. Nếu dùng Docker, nhớ thêm --ipc=host như mục “Cài PyTorch đúng bản CUDA”.

    Kiểm tra đã làm đúng

    Mở nvidia-smi ở cửa sổ khác: tất cả GPU được giao việc đều có tiến trình và bộ nhớ đang dùng.

    Tài liệu chính thức: torchrun (Elastic Launch) — PyTorch 2.14 (mở tab mới) · Accelerate — Launching distributed code (mở tab mới) · Accelerate — Fully Sharded Data Parallel (mở tab mới) · Transformers — DeepSpeed (mở tab mới) · DeepSpeed — Getting Started (mở tab mới) · DeepSpeed — ZeRO tutorial (mở tab mới) · Getting Started with Fully Sharded Data Parallel (FSDP2) (mở tab mới)

  10. Bước 10Theo dõi GPU và quá trình huấn luyện

    Theo dõi giúp phát hiện sớm GPU “ngồi chơi” (thường do nạp dữ liệu chậm), bộ nhớ sắp đầy, hay loss không giảm.

    Terminalnvidia-smi: làm mới 5 giây một lần / dmon: in số liệu từng GPU theo dòng
    nvidia-smi -l 5
    nvidia-smi dmon
    TerminalTensorBoard: xem biểu đồ loss trên trình duyệt
    pip install tensorboard
    tensorboard --logdir=runs

    TensorBoard cũng là một trang web — mở bằng SSH tunnel như mục “Chạy Jupyter an toàn qua SSH tunnel”, dùng đúng cổng mà TensorBoard in ra. Với Trainer, đặt report_to="tensorboard" hoặc report_to="wandb" để tự ghi log.

    TerminalWeights & Biases (dịch vụ bên ngoài — cân nhắc nếu dữ liệu nhạy cảm)
    pip install wandb
    wandb login

    Tài liệu chính thức: nvidia-smi — tài liệu dòng lệnh (mở tab mới) · torch.utils.tensorboard (PyTorch 2.14) (mở tab mới) · Transformers — Trainer / TrainingArguments (mở tab mới) · Weights & Biases — Quickstart (mở tab mới) · DCGM Exporter (mở tab mới)

  11. Bước 11Lưu checkpoint và sao lưu

    Checkpoint là “bản lưu game” của quá trình huấn luyện. Máy chủ có thể khởi động lại, hết hạn thuê, hoặc bạn lỡ tay xoá — có checkpoint thì học tiếp từ chỗ dừng, không phải chạy lại từ đầu.

    PythonPyTorch thuần: lưu cả model, optimizer, epoch
    torch.save({
                'epoch': epoch,
                'model_state_dict': model.state_dict(),
                'optimizer_state_dict': optimizer.state_dict(),
                'loss': loss,
                }, PATH)
    
    checkpoint = torch.load(PATH, weights_only=True)
    model.load_state_dict(checkpoint['model_state_dict'])
    optimizer.load_state_dict(checkpoint['optimizer_state_dict'])
    PythonTrainer: học tiếp từ checkpoint mới nhất trong output_dir
    trainer.train(resume_from_checkpoint=True)

    save_total_limit giới hạn số checkpoint giữ lại để ổ đĩa không đầy. Nguyên tắc sao lưu: chép checkpoint quan trọng ra ngoài máy đang train (ví dụ kho lưu trữ riêng), vì dữ liệu chỉ nằm trên một máy là dữ liệu có thể mất.

    Tài liệu chính thức: Saving and Loading Models — checkpoint (mở tab mới) · Transformers — Trainer / TrainingArguments (mở tab mới)

  12. Bước 12Sự cố thường gặp

    Ba nhóm lỗi hay gặp khi mới làm quen và hướng xử lý theo tài liệu chính thức.

    1) CUDA out of memory — model, batch hoặc độ dài chuỗi vượt VRAM. Thử giảm batch size, dùng gradient accumulation, nạp model 4-bit (QLoRA) hoặc chia ra nhiều GPU (ZeRO/FSDP). PyTorch có biến môi trường PYTORCH_ALLOC_CONF để chỉnh bộ cấp phát bộ nhớ, ví dụ bật expandable_segments khi kích thước cấp phát thay đổi liên tục (tính năng thử nghiệm).

    TerminalBật expandable_segments trước khi chạy script
    export PYTORCH_ALLOC_CONF=expandable_segments:True

    2) Lệch phiên bản driver / CUDA — torch.cuda.is_available() trả về False hoặc báo driver quá cũ. So phiên bản driver (cat /proc/driver/nvidia/version) với bảng tối thiểu: CUDA 13.x cần driver từ 580, CUDA 12.x cần từ 525. Cách xử lý: nâng driver, hoặc cài bản PyTorch dựng cho CUDA thấp hơn.

    3) Lỗi NCCL / treo khi chạy nhiều GPU — NCCL là thư viện để các GPU trao đổi dữ liệu. Bật log để xem lỗi dừng ở đâu. Máy có nhiều card mạng có thể chỉ định card bằng NCCL_SOCKET_IFNAME. Trong Docker, thiếu bộ nhớ chia sẻ cũng gây lỗi — thêm --ipc=host hoặc --shm-size.

    TerminalBật log NCCL
    export NCCL_DEBUG=INFO

    Tài liệu chính thức: CUDA semantics — PYTORCH_ALLOC_CONF (PyTorch 2.14) (mở tab mới) · CUDA Toolkit Release Notes — bảng driver tối thiểu (mở tab mới) · CUDA Compatibility (mở tab mới) · NCCL Troubleshooting — Logging (mở tab mới) · NCCL — Environment Variables (mở tab mới) · PyTorch Release Notes (NGC) — Running PyTorch (mở tab mới)

Bước tiếp theo

Nguồn

Mọi lệnh, phiên bản và giấy phép trên trang được đối chiếu trực tiếp với các trang dưới đây. Tra cứu ngày 15/09/2026.

  1. CUDA Installation Guide for Linux (bản 13.4) (mở tab mới)NVIDIA · tra cứu
  2. nvidia-smi — tài liệu dòng lệnh (mở tab mới)NVIDIA · tra cứu
  3. NVIDIA Driver Installation Guide — Ubuntu (mở tab mới)NVIDIA · tra cứu
  4. NVIDIA Driver Installation Guide — Post-installation Actions (mở tab mới)NVIDIA · tra cứu
  5. CUDA Toolkit Release Notes — bảng driver tối thiểu (mở tab mới)NVIDIA · tra cứu
  6. Install Docker Engine on Ubuntu (mở tab mới)Docker · tra cứu
  7. Linux post-installation steps for Docker Engine (mở tab mới)Docker · tra cứu
  8. NVIDIA Container Toolkit — Installing (mở tab mới)NVIDIA · tra cứu
  9. NVIDIA Container Toolkit — Running a Sample Workload (mở tab mới)NVIDIA · tra cứu
  10. cuDNN — Installing on Linux (mở tab mới)NVIDIA · tra cứu
  11. PyTorch — Get Started Locally (Stable 2.14.0) (mở tab mới)PyTorch Foundation · tra cứu
  12. PyTorch Release 26.08 (NGC) (mở tab mới)NVIDIA · tra cứu
  13. venv — Creation of virtual environments (mở tab mới)Python Software Foundation · tra cứu
  14. Gói python3-venv (Ubuntu 24.04 noble) (mở tab mới)Canonical · tra cứu
  15. uv — Installation (mở tab mới)Astral · tra cứu
  16. uv — Using Python environments (mở tab mới)Astral · tra cứu
  17. Miniforge README (mở tab mới)conda-forge · tra cứu
  18. conda — Managing environments (mở tab mới)conda · tra cứu
  19. PyTorch Release Notes (NGC) — Running PyTorch (mở tab mới)NVIDIA · tra cứu
  20. JupyterLab — Installation (mở tab mới)Project Jupyter · tra cứu
  21. Jupyter Server — Running a public Jupyter Server (mở tab mới)Project Jupyter · tra cứu
  22. ssh(1) — OpenBSD manual page (tuỳ chọn -L, -N) (mở tab mới)OpenBSD · tra cứu
  23. Docker — Port publishing and mapping (mở tab mới)Docker · tra cứu
  24. Docker — Packet filtering and firewalls (Docker và ufw) (mở tab mới)Docker · tra cứu
  25. PEFT — Installation (mở tab mới)Hugging Face · tra cứu
  26. PEFT — Quicktour (LoraConfig, get_peft_model) (mở tab mới)Hugging Face · tra cứu
  27. PEFT — Quantization (QLoRA, prepare_model_for_kbit_training) (mở tab mới)Hugging Face · tra cứu
  28. Transformers — bitsandbytes (mở tab mới)Hugging Face · tra cứu
  29. Transformers — Trainer / TrainingArguments (mở tab mới)Hugging Face · tra cứu
  30. torchrun (Elastic Launch) — PyTorch 2.14 (mở tab mới)PyTorch Foundation · tra cứu
  31. Accelerate — Launching distributed code (mở tab mới)Hugging Face · tra cứu
  32. Accelerate — Fully Sharded Data Parallel (mở tab mới)Hugging Face · tra cứu
  33. Transformers — DeepSpeed (mở tab mới)Hugging Face · tra cứu
  34. DeepSpeed — Getting Started (mở tab mới)DeepSpeed · tra cứu
  35. DeepSpeed — ZeRO tutorial (mở tab mới)DeepSpeed · tra cứu
  36. Getting Started with Fully Sharded Data Parallel (FSDP2) (mở tab mới)PyTorch Foundation · tra cứu
  37. torch.utils.tensorboard (PyTorch 2.14) (mở tab mới)PyTorch Foundation · tra cứu
  38. Weights & Biases — Quickstart (mở tab mới)Weights & Biases · tra cứu
  39. DCGM Exporter (mở tab mới)NVIDIA · tra cứu
  40. Saving and Loading Models — checkpoint (mở tab mới)PyTorch Foundation · tra cứu
  41. CUDA semantics — PYTORCH_ALLOC_CONF (PyTorch 2.14) (mở tab mới)PyTorch Foundation · tra cứu
  42. CUDA Compatibility (mở tab mới)NVIDIA · tra cứu
  43. NCCL Troubleshooting — Logging (mở tab mới)NVIDIA · tra cứu
  44. NCCL — Environment Variables (mở tab mới)NVIDIA · tra cứu

Cần máy chủ GPU để làm theo hướng dẫn?

Cho VNSO biết model, dữ liệu và thời gian bạn định huấn luyện để được tư vấn cấu hình phù hợp.

Liên hệ tư vấn