File size: 1,588 Bytes
2824f8c
 
 
 
 
 
 
 
a3b4e38
 
2824f8c
 
a3b4e38
 
 
 
2824f8c
 
a3b4e38
2824f8c
 
 
 
 
 
 
 
 
 
 
 
 
a3b4e38
 
2824f8c
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
# Phase 3 — Polish pass on the HARD tier (sim_hard_* + sim_advanced_*) with
# the strong Qwen-72B critic. Warm-starts from phase-2's adapter. Run on X2-0.
#
# Usage:
#   $env:HF_TOKEN_C = "hf_..."   # X2-0's token
#   ./scripts/launch_phase3.ps1

$ErrorActionPreference = "Stop"
# Account C token (X2-0)
if (-not $env:HF_TOKEN_C) { $env:HF_TOKEN_C = "<paste-X2-0-token-here>" }

$flavor   = "l4x1"
$updates  = "60"
$rollouts = "3"
$steps    = "12"
$run      = "phase3"
$repo     = "https://github.com/r1cksync/meta-rl-hack.git"

Write-Host "Phase 3: HARD 35 tasks, $updates x $rollouts x $steps, Qwen2.5-72B critic"
Write-Host "  Account     : X2-0"
Write-Host "  Warm-start  : Shubhang3011/incident-commander-actor (phase 2)"
Write-Host "  Push target : X2-0/incident-commander-actor"

$cmd = 'git clone --depth 1 $IC_REPO_URL /workspace/ic && cd /workspace/ic && bash scripts/hf_job_entrypoint.sh'

hf jobs run -d `
    --flavor $flavor `
    --secrets "HF_TOKEN=$env:HF_TOKEN_C" `
    --env   "IC_PUSH_USER=X2-0" `
    --env   "IC_REPO_URL=$repo" `
    --env   "IC_TOTAL_UPDATES=$updates" `
    --env   "IC_ROLLOUTS=$rollouts" `
    --env   "IC_MAX_STEPS=$steps" `
    --env   "IC_CKPT_EVERY=15" `
    --env   "IC_RUN_NAME=$run" `
    --env   "IC_TASK_MODE=hard" `
    --env   "IC_CRITIC_MODEL=Qwen/Qwen2.5-72B-Instruct" `
    --env   "IC_INIT_ADAPTER_REPO=Shubhang3011/incident-commander-actor" `
    --env   "IC_INIT_ADAPTER_SUBFOLDER=adapter" `
    --env   "HF_HUB_ENABLE_HF_TRANSFER=1" `
    --timeout 4h `
    "huggingface/transformers-pytorch-gpu:latest" `
    -- bash -c $cmd