#!/usr/bin/env bash # Eval: original base model (no edits) # # Usage: # bash experiment/scripts/baselines/run_eval_original.sh # CUDA_VISIBLE_DEVICES=0 bash experiment/scripts/baselines/run_eval_original.sh SCRIPT_DIR="$(cd "$(dirname "$0")" && pwd)" source "${SCRIPT_DIR}/_common.sh" NUM_PER_CATEGORY=50 EVAL_OUTPUT_DIR="${EVAL_OUTPUT_DIR:-./step4_baseline_outputs/compare_eval/original}" ORIGINAL_CACHE_DIR="${ORIGINAL_CACHE_DIR:-./cached_original_outputs}" echo "Using base model: ${BASE_MODEL}" mkdir -p "${EVAL_OUTPUT_DIR}" python -m experiment.evaluation.validate \ --model_type merged \ --model_dir "${BASE_MODEL}" \ --base_model_name "${BASE_MODEL}" \ --dataset_id "${DATASET_ID}" \ --num_per_category "${NUM_PER_CATEGORY}" \ --mention_method "${MENTION_METHOD}" \ --max_new_tokens "${MAX_NEW_TOKENS}" \ --use_val_split \ --prompts "Describe this image." \ --train_prompts "Describe this image." \ --generality_prompts "Give a detailed description of this image." \ --original_cache_dir "${ORIGINAL_CACHE_DIR}" \ --output_dir "${EVAL_OUTPUT_DIR}"