Spaces:
Running on Zero
Running on Zero
electblake commited on
Commit ·
2057a1d
1
Parent(s): b780d9b
fix: return final model answer after reasoning
Browse files
app.py
CHANGED
|
@@ -98,23 +98,29 @@ def generate(
|
|
| 98 |
inputs = tokenizer.apply_chat_template(
|
| 99 |
messages,
|
| 100 |
add_generation_prompt=True,
|
|
|
|
|
|
|
| 101 |
return_tensors="pt",
|
| 102 |
).to(model.device)
|
| 103 |
|
| 104 |
with torch.inference_mode():
|
| 105 |
generated = model.generate(
|
| 106 |
-
inputs,
|
| 107 |
-
max_new_tokens=
|
| 108 |
do_sample=True,
|
| 109 |
temperature=0.6,
|
| 110 |
top_p=0.95,
|
| 111 |
top_k=20,
|
| 112 |
)
|
| 113 |
|
|
|
|
|
|
|
|
|
|
|
|
|
| 114 |
return tokenizer.decode(
|
| 115 |
-
|
| 116 |
skip_special_tokens=True,
|
| 117 |
-
)
|
| 118 |
|
| 119 |
|
| 120 |
CSS = """
|
|
|
|
| 98 |
inputs = tokenizer.apply_chat_template(
|
| 99 |
messages,
|
| 100 |
add_generation_prompt=True,
|
| 101 |
+
tokenize=True,
|
| 102 |
+
return_dict=True,
|
| 103 |
return_tensors="pt",
|
| 104 |
).to(model.device)
|
| 105 |
|
| 106 |
with torch.inference_mode():
|
| 107 |
generated = model.generate(
|
| 108 |
+
**inputs,
|
| 109 |
+
max_new_tokens=4096,
|
| 110 |
do_sample=True,
|
| 111 |
temperature=0.6,
|
| 112 |
top_p=0.95,
|
| 113 |
top_k=20,
|
| 114 |
)
|
| 115 |
|
| 116 |
+
output_ids = generated[0, inputs["input_ids"].shape[-1] :].tolist()
|
| 117 |
+
think_end_token = tokenizer.convert_tokens_to_ids("</think>")
|
| 118 |
+
answer_start = len(output_ids) - output_ids[::-1].index(think_end_token)
|
| 119 |
+
|
| 120 |
return tokenizer.decode(
|
| 121 |
+
output_ids[answer_start:],
|
| 122 |
skip_special_tokens=True,
|
| 123 |
+
).strip()
|
| 124 |
|
| 125 |
|
| 126 |
CSS = """
|