jp22082001 commited on
Commit
36232fd
·
1 Parent(s): 15016df

Auto-update via watch script

Browse files
Files changed (1) hide show
  1. app.py +5 -2
app.py CHANGED
@@ -168,7 +168,7 @@ def respond(message, history, system_prompt, max_tokens, temperature, disable_th
168
  # Set up generator parameters
169
  params = og.GeneratorParams(model)
170
  params.set_search_options(
171
- max_length=int(max_tokens),
172
  temperature=temperature
173
  )
174
 
@@ -183,12 +183,15 @@ def respond(message, history, system_prompt, max_tokens, temperature, disable_th
183
  generator.append_tokens(np.array(inputs, dtype=np.int32))
184
 
185
  partial = ""
186
- while not generator.is_done():
 
 
187
  generator.generate_next_token()
188
  new_token = generator.get_next_tokens()[0]
189
  decoded = tokenizer.decode([new_token])
190
  partial += decoded
191
  yield partial
 
192
  except Exception as e:
193
  print(f"[inference] Error during Phi-3 generation: {e}", flush=True)
194
  yield f"⚠️ **Error during model inference**: {str(e)}\n\n*This was caught gracefully to prevent the Space from crashing. Please try again or rephrase.*"
 
168
  # Set up generator parameters
169
  params = og.GeneratorParams(model)
170
  params.set_search_options(
171
+ max_length=8192,
172
  temperature=temperature
173
  )
174
 
 
183
  generator.append_tokens(np.array(inputs, dtype=np.int32))
184
 
185
  partial = ""
186
+ max_gen_tokens = int(max_tokens)
187
+ tokens_generated = 0
188
+ while not generator.is_done() and tokens_generated < max_gen_tokens:
189
  generator.generate_next_token()
190
  new_token = generator.get_next_tokens()[0]
191
  decoded = tokenizer.decode([new_token])
192
  partial += decoded
193
  yield partial
194
+ tokens_generated += 1
195
  except Exception as e:
196
  print(f"[inference] Error during Phi-3 generation: {e}", flush=True)
197
  yield f"⚠️ **Error during model inference**: {str(e)}\n\n*This was caught gracefully to prevent the Space from crashing. Please try again or rephrase.*"