Video-Text-to-Text
Transformers
Safetensors
English
gemma4
image-text-to-text
video-captioning
multimodal
gemma
parakeet
Instructions to use SulphurAI/sulphur-caption with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use SulphurAI/sulphur-caption with Transformers:
# Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("SulphurAI/sulphur-caption") model = AutoModelForMultimodalLM.from_pretrained("SulphurAI/sulphur-caption", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| set -euo pipefail | |
| cd "$(dirname "$0")" | |
| if [ ! -d vllm ]; then | |
| if [ ! -f vllm.zip ]; then | |
| echo "Missing vllm/ and vllm.zip" >&2 | |
| exit 1 | |
| fi | |
| unzip -q vllm.zip | |
| fi | |
| python3 -m venv .venv | |
| source .venv/bin/activate | |
| pip install --upgrade pip setuptools wheel | |
| pip install -r requirements.txt | |
| python - <<'PY' | |
| import vllm | |
| print("vLLM import OK:", getattr(vllm, "__version__", "unknown")) | |
| PY | |