# Tensor Roll — Recursive CUDA-Q Model Quantizer # Copyright (C) 2026 SnapKitty Collective # SPDX-License-Identifier: AGPL-3.0-or-later """Failure-resolution tests (F1-F6): out-of-core streaming, global planner, fidelity instrumentation, INT4 characterization, CLI wiring. Every test measures; none fabricates. The 31 pre-existing tests in test_tensor_roll.py are untouched and must stay green alongside these. """ import io import json import os import struct import tempfile import unittest import numpy as np from tensor_roll import fidelity as F from tensor_roll import model as M from tensor_roll import ooc from tensor_roll import planner from tensor_roll import quant as QT def _tiny_cfg(): return M.Config(vocab=16, d=16, heads=2, layers=1, dff=32, seq=8) def _write_safetensors(path, tensors): """Minimal honest safetensors writer for tests (F32/F16 only).""" header = {} blobs = [] off = 0 for name, arr in tensors.items(): arr = np.ascontiguousarray(arr) dt = {np.dtype("float32"): "F32", np.dtype("float16"): "F16"}[arr.dtype] blob = arr.tobytes() header[name] = {"dtype": dt, "shape": list(arr.shape), "data_offsets": [off, off + len(blob)]} blobs.append(blob) off += len(blob) raw = json.dumps(header).encode() with open(path, "wb") as f: f.write(struct.pack(" same penalty class pa = plan["a"]["fidelity_penalty"] self.assertAlmostEqual( pa, F.fidelity_penalty(1.0, plan["a"]["reconstruction_error"])) u = F.utility_breakdown(1000, {"reconstruction": 10.0, "logit": 5.0, "hidden": 2.0, "task": 1.0}) self.assertAlmostEqual(u["utility"], 982.0) class TestInt4(unittest.TestCase): def test_schemes_roundtrip_and_search(self): rng = np.random.default_rng(6) W = (rng.standard_normal((48, 64)) * 3).astype(np.float32) rep = QT.int4_scheme_report(W) for k in ("per-tensor", "per-channel", "group-wise", "int8"): self.assertIn("mse", rep[k]) # search picks the measured argmin mses = {r["group"]: r["mse"] for r in rep["group-wise"]["all"]} best = min(mses, key=mses.get) self.assertEqual(rep["group-wise"]["best_group"], best) # per-tensor round trip shape q, m = QT.quantize_int4_per_tensor(W) back = QT.dequantize_int4_per_tensor(q, m) self.assertEqual(back.shape, W.shape) # error map instrumentation em = QT.quant_error_map(W, back) for k in ("min", "max", "mean", "variance", "outlier_frac", "mse", "cosine_sim", "rel_err", "per_channel_mse", "per_group_mse"): self.assertIn(k, em) self.assertEqual(len(em["per_channel_mse"]), 48) def test_outlier_detection(self): rng = np.random.default_rng(9) clean = rng.standard_normal((8, 64)).astype(np.float32) dirty = clean.copy() dirty[0, 0] = 100.0 # planted outlier stretches the int4 scale qc, mc = QT.quantize_int4(clean) qd, md = QT.quantize_int4(dirty) em_c = QT.quant_error_map(clean, QT.dequantize_int4(qc, mc)) em_d = QT.quant_error_map(dirty, QT.dequantize_int4(qd, md)) # the outlier inflates measured error by an order of magnitude self.assertGreater(em_d["mse"], 10 * em_c["mse"]) self.assertGreater(em_d["max"], 1.0) self.assertGreaterEqual(em_d["outlier_frac"], 0.0) def test_mixed_precision_plan_within_budget(self): rng = np.random.default_rng(7) params = {"W1": rng.standard_normal((32, 32)).astype(np.float32), "W2": rng.standard_normal((16, 16)).astype(np.float32)} mp = QT.mixed_precision_plan(params, 10_000_000) self.assertTrue(mp["within_budget"]) self.assertEqual(set(mp["plan"]), {"W1", "W2"}) self.assertTrue(all(v in ("int4", "int8") for v in mp["plan"].values())) def test_recovery_train_measured(self): rng = np.random.default_rng(8) cfg = _tiny_cfg() tp = M.init_params(rng, cfg) sp = {k: v.astype(np.float32) for k, v in M.init_params(rng, cfg).items()} rep = QT.recovery_train(sp, cfg, tp, cfg, steps=2, batch=8, seed=0) for k in ("ppl_before", "ppl_after_train", "ppl_after_requant", "improved"): self.assertIn(k, rep) self.assertIsInstance(rep["improved"], bool) self.assertTrue(np.isfinite(rep["ppl_after_requant"])) class TestCLIWiring(unittest.TestCase): def test_doctor_and_compress_options(self): from tensor_roll import cli p = cli.build_parser() a = p.parse_args(["doctor"]) self.assertEqual(a.cmd, "doctor") a = p.parse_args(["compress", "--out-of-core", "--resume", "--teacher", "/tmp", "--target-params", "1000", "--memory-budget", "64MB"]) self.assertTrue(a.out_of_core) self.assertTrue(a.resume) self.assertEqual(a.teacher, "/tmp") self.assertEqual(a.target_params, 1000) self.assertEqual(a.memory_budget, "64MB") if __name__ == "__main__": unittest.main()