decoderstack-d24 / README.md

Commit History

Model card: correct the recalibration — leaderboard is best-fit only, so the like-for-like gap is +0.019; both checkpoints now measured under both packings
4f60492
verified

ChrisMcCormick commited on

Model card: recalibrate val bpb under upstream packing; document the token_bytes regeneration
96ad938
verified

ChrisMcCormick commited on

Model card: step 5568 is now a ready-made nanochat checkpoint (+8-rank optimizer shards)
c92b43b
verified

ChrisMcCormick commited on

Flag that val bpb is not comparable across the batched/varlen pipelines
4c66da7
verified

ChrisMcCormick commited on

Converter now emits nanochat optimizer shards for an SFT warm-start
412ea12
verified

ChrisMcCormick commited on

Correct optimizer-state notes: SFT needs only the weights; W_O axis is a no-op at d24
162df34
verified

ChrisMcCormick commited on

Add model card, meta.json, logs, tokenizer, training source, and nanochat converter
11f07f9
verified

ChrisMcCormick commited on