Update modeling_tiny_mixtral.py
Browse files- modeling_tiny_mixtral.py +4 -0
modeling_tiny_mixtral.py
CHANGED
|
@@ -307,6 +307,10 @@ class SimpleMultiHeadAttention(nn.Module):
|
|
| 307 |
|
| 308 |
q = q_rotary.transpose(1, 2) # Back to (batch_size, num_heads, seq_len, head_dim)
|
| 309 |
k = k_rotary.transpose(1, 2) # Back to (batch_size, num_heads, seq_len, head_dim)
|
|
|
|
|
|
|
|
|
|
|
|
|
| 310 |
|
| 311 |
# Compute attention
|
| 312 |
if self.flash:
|
|
|
|
| 307 |
|
| 308 |
q = q_rotary.transpose(1, 2) # Back to (batch_size, num_heads, seq_len, head_dim)
|
| 309 |
k = k_rotary.transpose(1, 2) # Back to (batch_size, num_heads, seq_len, head_dim)
|
| 310 |
+
|
| 311 |
+
q = q.to(self.device)
|
| 312 |
+
k = k.to(self.device)
|
| 313 |
+
v = v.to(self.device)
|
| 314 |
|
| 315 |
# Compute attention
|
| 316 |
if self.flash:
|