Instructions to use onnx-internal-testing/tiny-random-Gemma3ForCausalLM with libraries, inference providers, notebooks, and local apps. Follow these links to get started.

Libraries

How to use onnx-internal-testing/tiny-random-Gemma3ForCausalLM with Transformers:

# Use a pipeline as a high-level helper
from transformers import pipeline

pipe = pipeline("text-generation", model="onnx-internal-testing/tiny-random-Gemma3ForCausalLM")
messages = [
    {"role": "user", "content": "Who are you?"},
]
pipe(messages)

# Load model directly
from transformers import AutoTokenizer, AutoModelForCausalLM

tokenizer = AutoTokenizer.from_pretrained("onnx-internal-testing/tiny-random-Gemma3ForCausalLM")
model = AutoModelForCausalLM.from_pretrained("onnx-internal-testing/tiny-random-Gemma3ForCausalLM")
messages = [
    {"role": "user", "content": "Who are you?"},
]
inputs = tokenizer.apply_chat_template(
	messages,
	add_generation_prompt=True,
	tokenize=True,
	return_dict=True,
	return_tensors="pt",
).to(model.device)

outputs = model.generate(**inputs, max_new_tokens=40)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:]))

Notebooks
Google Colab
Kaggle
Local Apps

vLLM

How to use onnx-internal-testing/tiny-random-Gemma3ForCausalLM with vLLM:

Install from pip and serve model

# Install vLLM from pip:
pip install vllm
# Start the vLLM server:
vllm serve "onnx-internal-testing/tiny-random-Gemma3ForCausalLM"
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:8000/v1/chat/completions" \
	-H "Content-Type: application/json" \
	--data '{
		"model": "onnx-internal-testing/tiny-random-Gemma3ForCausalLM",
		"messages": [
			{
				"role": "user",
				"content": "What is the capital of France?"
			}
		]
	}'

Use Docker

docker model run hf.co/onnx-internal-testing/tiny-random-Gemma3ForCausalLM

SGLang

How to use onnx-internal-testing/tiny-random-Gemma3ForCausalLM with SGLang:

Install from pip and serve model

# Install SGLang from pip:
pip install sglang
# Start the SGLang server:
python3 -m sglang.launch_server \
    --model-path "onnx-internal-testing/tiny-random-Gemma3ForCausalLM" \
    --host 0.0.0.0 \
    --port 30000
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:30000/v1/chat/completions" \
	-H "Content-Type: application/json" \
	--data '{
		"model": "onnx-internal-testing/tiny-random-Gemma3ForCausalLM",
		"messages": [
			{
				"role": "user",
				"content": "What is the capital of France?"
			}
		]
	}'

Use Docker images

docker run --gpus all \
    --shm-size 32g \
    -p 30000:30000 \
    -v ~/.cache/huggingface:/root/.cache/huggingface \
    --env "HF_TOKEN=<secret>" \
    --ipc=host \
    lmsysorg/sglang:latest \
    python3 -m sglang.launch_server \
        --model-path "onnx-internal-testing/tiny-random-Gemma3ForCausalLM" \
        --host 0.0.0.0 \
        --port 30000
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:30000/v1/chat/completions" \
	-H "Content-Type: application/json" \
	--data '{
		"model": "onnx-internal-testing/tiny-random-Gemma3ForCausalLM",
		"messages": [
			{
				"role": "user",
				"content": "What is the capital of France?"
			}
		]
	}'

Docker Model Runner
How to use onnx-internal-testing/tiny-random-Gemma3ForCausalLM with Docker Model Runner:
```
docker model run hf.co/onnx-internal-testing/tiny-random-Gemma3ForCausalLM
```

Xenova HF Staff commited on Mar 19

Commit

b1ee71d

1 Parent(s): affe9ba

Upload optimized ONNX model (#2)

Browse files

- Upload optimized ONNX model (3b2ae266746a9a6236ee5acd951bdc9c23e4765d)

Files changed (7) hide show

config.json +10 -5
onnx/model.onnx +3 -0
onnx/model.onnx_data +3 -0
onnx/model_fp16.onnx +3 -0
onnx/model_fp16.onnx_data +3 -0
tokenizer.json +2 -2
tokenizer_config.json +3 -2

config.json CHANGED Viewed

@@ -32,6 +32,8 @@
       "rope_theta": 1000000.0,
       "rope_type": "default"
     },
     "sliding_attention": {
       "rope_theta": 10000.0,
       "rope_type": "default"
@@ -40,14 +42,17 @@
   "sliding_window": 512,
   "tie_word_embeddings": true,
   "transformers.js_config": {
-    "kv_cache_dtype": {
-      "fp16": "float16",
-      "q4f16": "float16"
     },
-    "use_external_data_format": true
   },
   "transformers_version": "5.3.0.dev0",
   "use_bidirectional_attention": false,
   "use_cache": true,
   "vocab_size": 262144
-}

       "rope_theta": 1000000.0,
       "rope_type": "default"
     },
+    "rope_theta": null,
+    "rope_type": "default",
     "sliding_attention": {
       "rope_theta": 10000.0,
       "rope_type": "default"
   "sliding_window": 512,
   "tie_word_embeddings": true,
   "transformers.js_config": {
+    "use_external_data_format": {
+      "model.onnx": 1,
+      "model_fp16.onnx": 1
     },
+    "kv_cache_dtype": {
+      "q4f16": "float16",
+      "fp16": "float16"
+    }
   },
   "transformers_version": "5.3.0.dev0",
   "use_bidirectional_attention": false,
   "use_cache": true,
   "vocab_size": 262144
+}

onnx/model.onnx ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0e95268234b58d36540236e116554f34d3ba95c6a4ed2cf562bd3e4a38a13da7
+size 30111

onnx/model.onnx_data ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d3beb44efa24531572f67714b3a0015487e429e39d75f56918957e1a260a4ced
+size 69353472

onnx/model_fp16.onnx ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:38e091f02c03eb538fae5e3e9b297f4b055215ca15146a728780871f9dfac8e1
+size 39321

onnx/model_fp16.onnx_data ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:8afd6d6df73c564dddfd35a5d1b2a44f94a370c4b6e4379256eb27dce8dc17ec
+size 34676736

tokenizer.json CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:daab2354f8a74e70d70b4d1f804939b68a8c9624dd06cb7858e52dd8970e9726
-size 33384567

 version https://git-lfs.github.com/spec/v1
+oid sha256:b472c7c2d1a2ac607daa53c794575e59504c06b39579a0f2399bb95cea6a4949
+size 20323105

tokenizer_config.json CHANGED Viewed

@@ -20,5 +20,6 @@
   "spaces_between_special_tokens": false,
   "tokenizer_class": "GemmaTokenizer",
   "unk_token": "<unk>",
-  "use_default_system_prompt": false
-}

   "spaces_between_special_tokens": false,
   "tokenizer_class": "GemmaTokenizer",
   "unk_token": "<unk>",
+  "use_default_system_prompt": false,
+  "chat_template": "{{ bos_token }}\n{%- if messages[0]['role'] == 'system' -%}\n    {%- if messages[0]['content'] is string -%}\n        {%- set first_user_prefix = messages[0]['content'] + '\n\n' -%}\n    {%- else -%}\n        {%- set first_user_prefix = messages[0]['content'][0]['text'] + '\n\n' -%}\n    {%- endif -%}\n    {%- set loop_messages = messages[1:] -%}\n{%- else -%}\n    {%- set first_user_prefix = \"\" -%}\n    {%- set loop_messages = messages -%}\n{%- endif -%}\n{%- for message in loop_messages -%}\n    {%- if (message['role'] == 'user') != (loop.index0 % 2 == 0) -%}\n        {{ raise_exception(\"Conversation roles must alternate user/assistant/user/assistant/...\") }}\n    {%- endif -%}\n    {%- if (message['role'] == 'assistant') -%}\n        {%- set role = \"model\" -%}\n    {%- else -%}\n        {%- set role = message['role'] -%}\n    {%- endif -%}\n    {{ '<start_of_turn>' + role + '\n' + (first_user_prefix if loop.first else \"\") }}\n    {%- if message['content'] is string -%}\n        {{ message['content'] | trim }}\n    {%- elif message['content'] is iterable -%}\n        {%- for item in message['content'] -%}\n            {%- if item['type'] == 'image' -%}\n                {{ '<start_of_image>' }}\n            {%- elif item['type'] == 'text' -%}\n                {{ item['text'] | trim }}\n            {%- endif -%}\n        {%- endfor -%}\n    {%- else -%}\n        {{ raise_exception(\"Invalid content type\") }}\n    {%- endif -%}\n    {{ '<end_of_turn>\n' }}\n{%- endfor -%}\n{%- if add_generation_prompt -%}\n    {{'<start_of_turn>model\n'}}\n{%- endif -%}\n"
+}