|
Download README.md from mboy2k/llama-cpp-sm75-cuda-binary: direct link, hf CLI and curl.
- Browser
- Download file 951 Bytes
-
https://huggingface.co/mboy2k/llama-cpp-sm75-cuda-binary/resolve/main/README.md
- Command line
-
hf download hf://mboy2k/llama-cpp-sm75-cuda-binary/README.md
-
curl -L -o README.md https://huggingface.co/mboy2k/llama-cpp-sm75-cuda-binary/resolve/main/README.md
951 Bytes
metadata
license: mit
tags:
- llama.cpp
- cuda
- sm75
- turing
- qwen
llama.cpp CUDA binary (sm_75 / Tesla T4)
Binary llama-server build sẵn cho NVIDIA Tesla T4 (sm_75, Turing), dùng để
cache trong kernel Kaggle — tránh build lại từ source (~25 phút) mỗi lần khởi động.
- Commit llama.cpp:
4e416ee(2026-09-23) - Kiến trúc hỗ trợ:
qwen35moe(Qwen3.8-35B-A3B MoE) - Build flags:
-DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=75
Cách dùng trong kernel Kaggle
mkdir -p /kaggle/working/llama-bin && cd /kaggle/working/llama-bin
for f in llama-server libggml-base.so libggml-cpu.so libggml-cuda.so libggml.so \
libllama-common.so libllama-server-impl.so libllama.so libmtmd.so; do
curl -sL -o "$f" "https://huggingface.co/mboy2k/llama-cpp-sm75-cuda-binary/resolve/main/$f"
done
chmod +x llama-server
Sau đó chạy llama-server với LD_LIBRARY_PATH trỏ vào thư mục này.