from transformers import AutoModelForCausalLM, TrainingArguments, Trainer, DataCollatorForLanguageModeling from tokenize_data import tokenizer, tokenized_dataset if __name__ == "__main__": # Load model and resize embeddings to match the Qwen tokenizer vocabulary model = AutoModelForCausalLM.from_pretrained("gpt2") model.resize_token_embeddings(len(tokenizer)) data_collator = DataCollatorForLanguageModeling(tokenizer=tokenizer, mlm=False) # Configure training parameters training_args = TrainingArguments( output_dir="./results", per_device_train_batch_size=2, num_train_epochs=3, logging_steps=10, save_strategy="no", ) # Initialize Trainer and start training trainer = Trainer( model=model, args=training_args, train_dataset=tokenized_dataset, data_collator=data_collator, ) trainer.train() model.save_pretrained("./trained_model")