Model card: correct the recalibration — leaderboard is best-fit only, so the like-for-like gap is +0.019; both checkpoints now measured under both packings 4f60492 verified ChrisMcCormick commited on 6 days ago
Model card: recalibrate val bpb under upstream packing; document the token_bytes regeneration 96ad938 verified ChrisMcCormick commited on 6 days ago
Model card: step 5568 is now a ready-made nanochat checkpoint (+8-rank optimizer shards) c92b43b verified ChrisMcCormick commited on 6 days ago
Flag that val bpb is not comparable across the batched/varlen pipelines 4c66da7 verified ChrisMcCormick commited on 6 days ago
Converter now emits nanochat optimizer shards for an SFT warm-start 412ea12 verified ChrisMcCormick commited on 6 days ago
Correct optimizer-state notes: SFT needs only the weights; W_O axis is a no-op at d24 162df34 verified ChrisMcCormick commited on 6 days ago
Add model card, meta.json, logs, tokenizer, training source, and nanochat converter 11f07f9 verified ChrisMcCormick commited on 7 days ago