from __future__ import annotations import torch from torch import nn class HighwayNetwork(nn.Module): def __init__(self, width: int = 32, layers: int = 8) -> None: super().__init__() self.input = nn.Linear(64, width) self.transforms = nn.ModuleList([nn.Linear(width, width) for _ in range(layers)]) self.gates = nn.ModuleList([nn.Linear(width, width) for _ in range(layers)]) self.output = nn.Linear(width, 10) for gate in self.gates: nn.init.constant_(gate.bias, -2.0) def forward( self, pixels: torch.Tensor, *, return_gates: bool = False, ) -> torch.Tensor | tuple[torch.Tensor, torch.Tensor]: hidden = torch.tanh(self.input(pixels)) gate_values = [] for transform, gate in zip(self.transforms, self.gates, strict=True): transformed = torch.tanh(transform(hidden)) carry = torch.sigmoid(gate(hidden)) hidden = carry * transformed + (1 - carry) * hidden gate_values.append(carry) logits = self.output(hidden) if return_gates: return logits, torch.stack(gate_values, dim=1) return logits class PlainDeepNetwork(nn.Module): def __init__(self, width: int = 32, layers: int = 16) -> None: super().__init__() self.input = nn.Linear(64, width) self.layers = nn.ModuleList([nn.Linear(width, width) for _ in range(layers)]) self.output = nn.Linear(width, 10) def forward(self, pixels: torch.Tensor) -> torch.Tensor: hidden = torch.tanh(self.input(pixels)) for layer in self.layers: hidden = torch.tanh(layer(hidden)) return self.output(hidden) def parameter_count(model: nn.Module) -> int: return sum(parameter.numel() for parameter in model.parameters())