Marmik commited on
Commit
c44a1f5
·
verified ·
1 Parent(s): b3677cf

Update modeling_tiny_mixtral.py

Browse files
Files changed (1) hide show
  1. modeling_tiny_mixtral.py +4 -0
modeling_tiny_mixtral.py CHANGED
@@ -307,6 +307,10 @@ class SimpleMultiHeadAttention(nn.Module):
307
 
308
  q = q_rotary.transpose(1, 2) # Back to (batch_size, num_heads, seq_len, head_dim)
309
  k = k_rotary.transpose(1, 2) # Back to (batch_size, num_heads, seq_len, head_dim)
 
 
 
 
310
 
311
  # Compute attention
312
  if self.flash:
 
307
 
308
  q = q_rotary.transpose(1, 2) # Back to (batch_size, num_heads, seq_len, head_dim)
309
  k = k_rotary.transpose(1, 2) # Back to (batch_size, num_heads, seq_len, head_dim)
310
+
311
+ q = q.to(self.device)
312
+ k = k.to(self.device)
313
+ v = v.to(self.device)
314
 
315
  # Compute attention
316
  if self.flash: