[Person D] Implement evaluation module: metrics, decoding, evaluator, scripts
#9
by jiaoruotong - opened
Summary
Person D 的评估与推理模块实现。
实现内容
metrics.py: 实现 compute_bleu (SacreBLEU), compute_comet, compute_chrf, compute_ter, compute_all_metricsdecoding.py: 实现 greedy_decode, beam_search_decode (含 length penalty), sample_decode (temperature + top-k + top-p), _apply_no_repeat_ngramevaluator.py: 实现 Evaluator 类 (统一评估接口、批量翻译)scripts/evaluate.py: 评估入口脚本 (加载模型→评估→保存结果)scripts/translate.py: 翻译推理脚本 (CLI交互 + 文件翻译 + Gradio Web UI)
sdfjliom changed pull request status to merged