[Person D] Implement evaluation module: metrics, decoding, evaluator, scripts

#9

Summary

Person D 的评估与推理模块实现。

实现内容

  • metrics.py: 实现 compute_bleu (SacreBLEU), compute_comet, compute_chrf, compute_ter, compute_all_metrics
  • decoding.py: 实现 greedy_decode, beam_search_decode (含 length penalty), sample_decode (temperature + top-k + top-p), _apply_no_repeat_ngram
  • evaluator.py: 实现 Evaluator 类 (统一评估接口、批量翻译)
  • scripts/evaluate.py: 评估入口脚本 (加载模型→评估→保存结果)
  • scripts/translate.py: 翻译推理脚本 (CLI交互 + 文件翻译 + Gradio Web UI)
sdfjliom changed pull request status to merged

Sign up or log in to comment