| # Eval: original base model (no edits) | |
| # | |
| # Usage: | |
| # bash experiment/scripts/baselines/run_eval_original.sh | |
| # CUDA_VISIBLE_DEVICES=0 bash experiment/scripts/baselines/run_eval_original.sh | |
| SCRIPT_DIR="$(cd "$(dirname "$0")" && pwd)" | |
| source "${SCRIPT_DIR}/_common.sh" | |
| NUM_PER_CATEGORY=50 | |
| EVAL_OUTPUT_DIR="${EVAL_OUTPUT_DIR:-./step4_baseline_outputs/compare_eval/original}" | |
| ORIGINAL_CACHE_DIR="${ORIGINAL_CACHE_DIR:-./cached_original_outputs}" | |
| echo "Using base model: ${BASE_MODEL}" | |
| mkdir -p "${EVAL_OUTPUT_DIR}" | |
| python -m experiment.evaluation.validate \ | |
| --model_type merged \ | |
| --model_dir "${BASE_MODEL}" \ | |
| --base_model_name "${BASE_MODEL}" \ | |
| --dataset_id "${DATASET_ID}" \ | |
| --num_per_category "${NUM_PER_CATEGORY}" \ | |
| --mention_method "${MENTION_METHOD}" \ | |
| --max_new_tokens "${MAX_NEW_TOKENS}" \ | |
| --use_val_split \ | |
| --prompts "Describe this image." \ | |
| --train_prompts "Describe this image." \ | |
| --generality_prompts "Give a detailed description of this image." \ | |
| --original_cache_dir "${ORIGINAL_CACHE_DIR}" \ | |
| --output_dir "${EVAL_OUTPUT_DIR}" | |