Input

Prompt

Est. Tokens

0

Avg Tok/s

Max Tokens

Group 1

Deterministic Decoding

Always picks the most probable path

Greedy deterministic

Always picks the single highest probability token. No randomness. Same output every run.

Tokens

Latency

Tok/s

Finish

Token Replay

Beam Search

Explores multiple paths simultaneously. Keeps top N beams at every step.

Tokens

Latency

Tok/s

Finish

Token Replay

Group Output — Deterministic

Greedy

Waiting for results...

Beam Search

Within-Group Similarity — Group 1

Waiting for results...

Group 2

Pure Sampling

Draws randomly from the full distribution

Random Sampling temp=1.0

Samples from the full unfiltered distribution. Every token has a chance. Output varies every run.

Tokens

Latency

Tok/s

Finish

Token Replay

Temperature

Reshapes distribution before sampling. Low = focused. High = creative and random.

Tokens

Latency

Tok/s

Finish

Token Replay

Group Output — Pure Sampling

Random Sampling

Waiting for results...

Temperature

Waiting for results...

Within-Group Similarity — Group 2

Waiting for results...

Group 3A

Basic Constrained Sampling

Filters the distribution before sampling

Top-k

Keeps only the top k most probable tokens. All others set to zero probability.

Tokens

Latency

Tok/s

Finish

Token Replay

Top-p / Nucleus

Keeps smallest set of tokens covering p% probability. Dynamic nucleus size adapts to model confidence.

Tokens

Latency

Tok/s

Finish

Token Replay

Group Output — Basic Constrained

Top-k

Waiting for results...

Top-p / Nucleus

Waiting for results...

Within-Group Similarity — Group 3A

Waiting for results...

Group 3B

Hybrid Constrained Sampling

Combines multiple constraints simultaneously

Top-k + Top-p

Applies both k and p filters together.

Tokens

Latency

Tok/s

Finish

Token Replay

Temp + Top-k

Reshapes distribution then applies k filter.

Tokens

Latency

Tok/s

Finish

Token Replay

Temp + Top-p

Reshapes distribution then applies p nucleus filter.

Tokens

Latency

Tok/s

Finish

Token Replay

Temp + Top-k + Top-p

All three constraints applied together.

Tokens

Latency

Tok/s

Finish

Token Replay

Group Output — Hybrid Constrained

Top-k + Top-p

Waiting for results...

Temp + Top-k

Waiting for results...

Temp + Top-p

Waiting for results...

Temp + Top-k + Top-p

Waiting for results...

Within-Group Similarity — Group 3B

Waiting for results...

Deep Analysis

Attention, Consistency, Tradeoffs, Cross-Group

Runs after all strategies complete. Evaluates the model across all dimensions.

Attention Heatmap

What the model focused on

Self-attention matrix averaged across all layers and heads. Every token's relationship to every other token.

Waiting for Run Analysis...

Consistency Tracker

How much do outputs vary across runs?

Runs the selected strategy 5 times. Deterministic strategies always produce identical outputs. Sampling strategies vary.

Select a strategy and click Run 5×.

Inference Tradeoff Dashboard

Quality vs Speed — all strategies

Latency, token count, and tokens per second across all 10 strategies in one view.

Waiting for Run Analysis...

Cross-Group Semantic Similarity

Do strategies across groups say the same thing?

Cosine similarity between embeddings of outputs from different decoding families.

Waiting for Run Analysis...