File size: 1,116 Bytes
a2ffd07
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
#!/usr/bin/env bash
# Eval: original base model (no edits)
#
# Usage:
#   bash experiment/scripts/baselines/run_eval_original.sh
#   CUDA_VISIBLE_DEVICES=0 bash experiment/scripts/baselines/run_eval_original.sh

SCRIPT_DIR="$(cd "$(dirname "$0")" && pwd)"
source "${SCRIPT_DIR}/_common.sh"

NUM_PER_CATEGORY=50

EVAL_OUTPUT_DIR="${EVAL_OUTPUT_DIR:-./step4_baseline_outputs/compare_eval/original}"
ORIGINAL_CACHE_DIR="${ORIGINAL_CACHE_DIR:-./cached_original_outputs}"

echo "Using base model: ${BASE_MODEL}"
mkdir -p "${EVAL_OUTPUT_DIR}"

python -m experiment.evaluation.validate \
    --model_type merged \
    --model_dir "${BASE_MODEL}" \
    --base_model_name "${BASE_MODEL}" \
    --dataset_id "${DATASET_ID}" \
    --num_per_category "${NUM_PER_CATEGORY}" \
    --mention_method "${MENTION_METHOD}" \
    --max_new_tokens "${MAX_NEW_TOKENS}" \
    --use_val_split \
    --prompts "Describe this image." \
    --train_prompts "Describe this image." \
    --generality_prompts "Give a detailed description of this image." \
    --original_cache_dir "${ORIGINAL_CACHE_DIR}" \
    --output_dir "${EVAL_OUTPUT_DIR}"