Spaces:
Running
Running
File size: 6,090 Bytes
cec37e3 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 132 133 134 135 136 137 138 139 140 141 142 143 144 145 146 147 | #!/usr/bin/env python3
"""C2 validation: BASELINE_FEATURES vs BASELINE + PTT sentiment."""
import sys
from pathlib import Path
ROOT = Path(__file__).resolve().parent.parent
sys.path.insert(0, str(ROOT))
try:
from dotenv import load_dotenv; load_dotenv(ROOT / ".env")
except ImportError: pass
import warnings; warnings.filterwarnings("ignore")
import numpy as np
import pandas as pd
import json
from pathlib import Path
from sklearn.ensemble import RandomForestClassifier
sys.path.insert(0, str(ROOT / "scripts"))
from improvement_harness import (
BASELINE_FEATURES, fetch_df, build_triple_barrier_labels, compute_metrics, RF_PARAMS,
)
from models.predictor import _build_features
from data.ptt_sentiment import add_ptt_sentiment, scrape_ptt_sentiment
STOCKS = ["2330", "0050", "2317", "2454", "2881"]
PTT_FEATS = BASELINE_FEATURES + ["ptt_sentiment_1d", "ptt_sentiment_5d_ma"]
MIN_TRAIN = 60 # reduced: PTT window ~180 days
STEP = 10
LABEL_HORIZON = 5
def walk_forward_ptt(feat_df, label_arr, cols):
avail = [c for c in cols if c in feat_df.columns]
X_all = feat_df[avail].fillna(0).values
n = len(feat_df)
y_true_all, y_pred_all = [], []
cutoff = MIN_TRAIN
while cutoff + STEP + LABEL_HORIZON <= n:
y_tr = label_arr[:cutoff]
valid = ~np.isnan(y_tr)
y_v = y_tr[valid]
if len(y_v) < 10 or len(np.unique(y_v)) < 2:
cutoff += STEP; continue
clf = RandomForestClassifier(**RF_PARAMS)
clf.fit(X_all[:cutoff][valid], y_v.astype(int))
test_end = min(cutoff + STEP, n - LABEL_HORIZON)
y_te = label_arr[cutoff:test_end]
valid_te = ~np.isnan(y_te)
if valid_te.sum() == 0:
cutoff += STEP; continue
y_pred = clf.predict(X_all[cutoff:test_end][valid_te])
y_true_all.extend(y_te[valid_te].tolist()); y_pred_all.extend(y_pred.tolist())
cutoff += STEP
if not y_true_all: return {}
return compute_metrics(np.array(y_true_all), np.array(y_pred_all))
def main():
# Pre-warm PTT cache (scrape once, reuse)
print("Scraping PTT sentiment data (180 days)...", flush=True)
try:
scrape_ptt_sentiment(days_back=180)
except Exception as e:
print(f" PTT scrape failed: {e} — proceeding with zeros")
per_stock = {}
agg = {"baseline": [], "ptt": []}
hdr = f"{'Stock':>6} {'Set':>10} {'Acc%':>5} {'Dir%':>5} {'↑Prec%':>7} {'PTT rows':>8}"
print(f"\n{hdr}\n{'-'*len(hdr)}")
for stock_no in STOCKS:
print(f" computing {stock_no}...", end="\r", flush=True)
df = fetch_df(stock_no)
if df is None or df.empty:
print(f"{stock_no:>6} no data"); continue
# Add PTT sentiment
df = add_ptt_sentiment(df, stock_no)
# Use only last 180 days (PTT window)
if "date" in df.columns:
cutoff_date = pd.Timestamp.now() - pd.Timedelta(days=180)
df_recent = df[pd.to_datetime(df["date"]) >= cutoff_date].copy()
else:
df_recent = df.tail(130).copy()
if len(df_recent) < MIN_TRAIN + STEP + LABEL_HORIZON:
print(f"{stock_no:>6} insufficient recent data ({len(df_recent)} rows)")
continue
# Count non-zero PTT rows
ptt_rows = int((df_recent.get("ptt_sentiment_1d", pd.Series([0])) != 0).sum())
feat = _build_features(df_recent)
# Copy PTT cols into feat (not built by _build_features)
for col in ["ptt_sentiment_1d", "ptt_sentiment_5d_ma"]:
if col in df_recent.columns:
feat[col] = df_recent[col].values[:len(feat)]
close = (df_recent.set_index("date")["close"] if "date" in df_recent.columns
else df_recent["close"]).values
labels = build_triple_barrier_labels(close)
per_stock[stock_no] = {}
for name, cols in [("baseline", BASELINE_FEATURES), ("ptt", PTT_FEATS)]:
r = walk_forward_ptt(feat, labels, cols)
per_stock[stock_no][name] = r
if r:
agg[name].append(r)
prefix = f"{stock_no:>6}" if name == "baseline" else f"{'':>6}"
print(f"{prefix} {name:>10} {r['accuracy']:>5.1f} {r['dir_accuracy']:>5.1f} "
f"{r['up_precision']:>7.1f} {ptt_rows if name=='ptt' else '':>8}")
if per_stock[stock_no].get("baseline") and per_stock[stock_no].get("ptt"):
rb, rp = per_stock[stock_no]["baseline"], per_stock[stock_no]["ptt"]
print(f"{'':>6} {'Δ':>10} {'':>5} {rp['dir_accuracy']-rb['dir_accuracy']:>+5.1f} "
f"{rp['up_precision']-rb['up_precision']:>+7.1f}")
print()
def mf(rows, f):
vals = [r[f] for r in rows if isinstance(r.get(f),(int,float)) and not np.isnan(r.get(f,float("nan")))]
return round(sum(vals)/len(vals),1) if vals else float("nan")
print("=== AGGREGATE ===")
agg_summary = {}
for name in ("baseline","ptt"):
s = {k: mf(agg[name], k) for k in ("accuracy","dir_accuracy","up_precision","dn_precision")}
agg_summary[name] = s
print(f" {name:>10}: acc={s['accuracy']}% dir={s['dir_accuracy']}% ↑prec={s['up_precision']}%")
b, p = agg_summary.get("baseline",{}), agg_summary.get("ptt",{})
no_regress = (p.get("dir_accuracy",0) >= b.get("dir_accuracy",0) - 0.5 and
p.get("up_precision",0) >= b.get("up_precision",0) - 0.5)
improvement = (p.get("dir_accuracy",0) - b.get("dir_accuracy",0) >= 1.0 or
p.get("up_precision",0) - b.get("up_precision",0) >= 1.0)
passed = no_regress and improvement
print(f"\n Pass: {'YES' if passed else 'NO'} (no_regress={no_regress}, improvement={improvement})")
Path("docs").mkdir(exist_ok=True)
with open("docs/c2_ptt_result.json","w") as f:
json.dump({"results":per_stock,"aggregate":agg_summary,
"passed":passed,"pass_criterion":"no_regress AND ≥1.0pp on shorter 180d window"}, f, indent=2)
if __name__ == "__main__":
main()
|