File size: 7,132 Bytes
b60b49b
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
# PolyEdit 다중 목적 Hypervolume 및 MIP 분석

## 결론

Preference-conditioned SFT는 random보다 MIP을 높였지만, 사전에 주 기준선으로 정한 greedy verifier를 넘지 못했다. Hypervolume은 SFT 0.326±0.009, greedy verifier 0.337±0.004이고 MIP은 각각 0.554±0.012와 0.568±0.003이다. SFT의 상대 변화는 greedy verifier 대비 Hypervolume -3.30±3.08%, MIP -2.50±2.30%이다. 수행계획서의 20% 향상 목표는 현재 실험에서 달성되지 않았다.

## 평가 계약과 데이터 계보

- 데이터: `data/real/frozen.json`, SHA-256 `122dfd62dcf8d46ece390ed23335e69cac0d3db8e91479c162d5e4186acdbe0d`
- 물성: 실제 DFT 라벨 Egc와 Egb
- split: polymer SHA1 modulo 2 고정 분할, train 290개, eval 253개
- split hash: `2e38193a038079d66cfb5d17dc149af12a9f63a773a2e48ee21d04bb006250fc`
- graph: train source 41개와 edge 271개, eval source 22개와 edge 48개, node 교집합 0
- task: eval source 22개와 증감 방향 4개의 조합 88개
- preference: `(0,1)`부터 `(1,0)`까지 균등한 11개 가중치, 총 968 decision
- 후보 예산: task당 11개 출력, trajectory당 edit budget 3
- 반복: seeds 1004, 1005, 1006, 1007, 1008
- 기반 표현기: `HAYDERphd/polyBERT@7bf9ed32ac54dea5bc163cf90100728b49341750`
- 학습: 두 verifier를 seed별 8 epoch 미세조정하고 preference-conditioned SFT를 60 epoch 학습
- SFT supervision: train graph의 DFT oracle이 각 선호도에서 찾은 budget 내 최적 경로, 총 4,321 decision step
- 최종 평가: verifier 예측이 아닌 eval graph의 frozen DFT label

각 목적의 보상은 train 통계로 고정하였다.

`R_j = (clip(d_j × (y_j - μ_train,j) / σ_train,j, -3, 3) + 3) / 6`

여기서 `d_j`는 증가 또는 감소 방향이다. Eval graph에서 clipping된 값은 없었다. Hypervolume은 두 목적을 최대화하고 reference point `(0,0)`을 사용한다. MIP은 수행계획서 정의에 따라 사용자 선호 벡터와 보상 벡터의 내적 `w^T R`을 모든 task와 가중치에서 평균한다. Near-optimal은 exhaustive DFT oracle과의 MIP 차이가 0.05 이하인 decision 비율이다.

## 방법과 직접 비교 가능 범위

| 방법 | 선택 신호 | 최종 판정 | 비교 지위 |
|---|---|---|---|
| SFT | train DFT 경로로 학습, eval에서는 fine-tuned verifier와 polyBERT | eval DFT | 주 방법 |
| Random | 선호도를 보지 않는 무작위 3-step trajectory | eval DFT | 하한 기준선 |
| Greedy verifier | fine-tuned verifier의 가중 보상을 단계별 최대화 | eval DFT | 사전 지정 주 기준선 |
| Oracle grid | eval DFT로 budget 내 전체 reachable set 탐색 | eval DFT | 배포 불가능한 진단 상한 |

SFT, random과 greedy verifier는 같은 task, preference grid, edit budget, 출력 수와 evaluator를 사용하므로 직접 비교할 수 있다. Oracle grid는 test label을 선택에 사용하므로 성능 상한일 뿐 학습 방법과 직접 우열을 주장하지 않는다.

## 전체 결과

값은 5개 seed 평균과 95% t 신뢰구간이다.

| Method | Hypervolume↑ | MIP↑ | Preference regret↓ | Near-optimal↑ | Unique outputs↑ |
|---|---:|---:|---:|---:|---:|
| SFT | 0.326±0.009 | 0.554±0.012 | 0.034±0.012 | 0.782±0.091 | 2.091±0.176 |
| Random | 0.328±0.005 | 0.500±0.000 | 0.088±0.000 | 0.448±0.019 | 4.409±0.279 |
| Greedy verifier | 0.337±0.004 | 0.568±0.003 | 0.019±0.003 | 0.833±0.021 | 2.011±0.129 |
| Oracle grid | 0.355±0.000 | 0.588±0.000 | 0.000±0.000 | 1.000±0.000 | 1.977±0.000 |

SFT minus greedy verifier의 paired 차이는 Hypervolume -0.0112±0.0105, MIP -0.0142±0.0131이다. 두 95% interval의 상한도 0보다 작지만 차이는 작다. SFT minus random은 Hypervolume -0.0017±0.0129, MIP +0.0543±0.0119이다. Random MIP이 모든 seed에서 정확히 0.5인 것은 동일 후보를 네 개의 대칭 방향으로 평가하면 방향별 보상이 상쇄되도록 metric을 구성했기 때문이다. 이는 neutral preference-insensitive 기준값이며 불확실성이 없다는 의미가 아니다.

## 방향별 결과

| 방향 | SFT HV | Greedy HV | SFT MIP | Greedy MIP |
|---|---:|---:|---:|---:|
| Egc↑, Egb↑ | 0.555±0.006 | 0.542±0.010 | 0.717±0.009 | 0.710±0.005 |
| Egc↑, Egb↓ | 0.266±0.010 | 0.281±0.004 | 0.532±0.005 | 0.549±0.002 |
| Egc↓, Egb↑ | 0.268±0.017 | 0.283±0.009 | 0.534±0.017 | 0.549±0.004 |
| Egc↓, Egb↓ | 0.216±0.015 | 0.244±0.003 | 0.433±0.020 | 0.466±0.003 |

두 물성을 모두 높이는 방향에서는 SFT minus greedy가 Hypervolume +0.0132±0.0144, MIP +0.0073±0.0114였으나 두 interval 모두 0을 포함한다. Egc를 높이고 Egb를 낮추는 상충 방향에서는 차이가 각각 -0.0149±0.0071과 -0.0163±0.0054로 SFT가 낮았다. 전체 성능 저하는 상충 방향과 두 물성을 모두 낮추는 방향에서 주로 발생했다.

## 해석과 한계

SFT가 random의 MIP을 높인 점은 선호 신호를 일부 학습했음을 보여준다. 그러나 verifier 값을 직접 최대화하는 단순 greedy가 더 안정적이었다. SFT의 평균 unique output은 2.09개로 greedy 2.01개와 비슷하므로, greedy 대비 열세를 출력 다양성만으로 설명하기 어렵다. Eval RMSE는 Egc 약 0.68 eV, Egb 약 0.78 eV였고, 제한된 공동 라벨이 verifier 및 정책 일반화의 병목이다.

평가는 88개 source-direction task를 포함하지만 독립 polymer source는 22개이다. Seed interval은 학습 초기화와 verifier 변동을 반영하며 새로운 polymer 모집단의 불확실성을 모두 나타내지는 않는다. 네 방향과 11개 선호도는 수행계획서의 전체 선호도 공간을 이산화한 것이다. 더 조밀한 공동 DFT 라벨이나 외부 계산 없이 20% 향상을 주장해서는 안 된다.

## 판단

Hypervolume과 MIP의 정의, 고정 reference point, 동일 후보 예산, 5-seed 결과와 DFT 평가를 확보해 중간보고서의 지표 공백은 채웠다. 성과 목표는 미달이다. 다음 방법 실험에서는 일반 MLP SFT를 반복하기보다 preference와 property reward의 bilinear interaction을 직접 보존하고, 개별 trajectory imitation 대신 Pareto set coverage를 최적화하는 listwise objective가 필요하다. 8월 15일 제출 관점의 다음 우선순위는 자연어 선호를 검증된 weight와 direction schema로 변환하는 최소 통합 실험이다.

## 실행 자원과 W&B

요청된 B200은 제공된 30602 endpoint의 public-key 거부와 lab 33001 endpoint의 banner timeout으로 가용성을 확인할 수 없었다. 확인되지 않은 GPU에는 작업을 올리지 않았다. 세 차례 idle이 확인된 로컬 RTX A6000 두 장에 시드 3개와 2개를 병렬 배치하였다.

- seed 1004: https://wandb.ai/promotion-kim/polyedit/runs/fj1hfckj
- seed 1005: https://wandb.ai/promotion-kim/polyedit/runs/sd8f612x
- seed 1006: https://wandb.ai/promotion-kim/polyedit/runs/13qbpow4
- seed 1007: https://wandb.ai/promotion-kim/polyedit/runs/nbkdoeqr
- seed 1008: https://wandb.ai/promotion-kim/polyedit/runs/s7tjlr7n