| bits lost to the block-16 scale, mean over channels, median over layers (312 layers) |
|
|
| modality lam=1 lam=all lam=video lam=text |
| ---------------------------------------------------------- |
| video 1.274 0.979 0.837 1.232 |
| text 1.087 0.850 1.303 0.949 |
| audio 2.085 2.031 2.327 2.144 |
|
|
| change vs no smoothing (negative = smoothing helps that modality) |
| modality lam=1 lam=all lam=video lam=text |
| ---------------------------------------------------------- |
| video -- -0.294 -0.437 -0.042 |
| text -- -0.237 +0.216 -0.138 |
| audio -- -0.053 +0.243 +0.060 |
|
|
| layers where lambda=video costs text the most, vs lambda=all: |
| transformer_blocks.33.attn.to_q text 0.691 -> 1.846 video 0.948 -> 0.756 |
| transformer_blocks.32.attn.to_k text 0.589 -> 1.718 video 0.810 -> 0.675 |
| transformer_blocks.32.attn.to_q text 0.637 -> 1.718 video 0.914 -> 0.675 |
| transformer_blocks.1.ff.net.2 text 2.941 -> 4.014 video 3.195 -> 1.438 |
| transformer_blocks.30.attn.to_k text 0.587 -> 1.590 video 0.739 -> 0.687 |
| transformer_blocks.34.attn.to_k text 0.674 -> 1.660 video 0.977 -> 0.789 |
| transformer_blocks.33.attn.to_k text 0.756 -> 1.716 video 1.004 -> 0.824 |
| transformer_blocks.35.attn.to_k text 0.705 -> 1.630 video 0.822 -> 0.577 |
|
|