Paper2Agent_decoupleRpy / scripts /extract_paca_ca.R
avoigt1121
Add TCGA-PAAD scoping doc, dataset assembly scripts, ignore .claude/
4bd9bbf
Raw
History Blame Contribute Delete
1.52 kB
library(methods)
rds <- readRDS("tmp/datasets/PACA_CA_seq.rds")
expr <- rds$ex # 65802 genes x 262 samples
featInfo <- rds$featInfo
sampInfo <- rds$sampInfo
cat("Expression dim:", paste(dim(expr), collapse="x"), "\n")
cat("Value range:", min(expr, na.rm=TRUE), "-", max(expr, na.rm=TRUE), "\n")
cat("Sample values:", paste(as.vector(expr[1:3,1:3]), collapse=", "), "\n")
cat("Is integer:", is.integer(expr[1,1]), "\n")
# Save using fast write
if (!requireNamespace("data.table", quietly=TRUE)) install.packages("data.table", repos="https://cran.rstudio.com/")
library(data.table)
# Transpose to samples x genes, add rownames as column
expr_t <- t(expr)
dt <- data.table(sample_id=rownames(expr_t), as.data.table(expr_t))
fwrite(dt, "tmp/datasets/paca_ca_expr.csv.gz")
cat("Expression written to paca_ca_expr.csv.gz\n")
# Save metadata
write.csv(sampInfo, "tmp/datasets/paca_ca_sampInfo.csv", row.names=TRUE)
write.csv(featInfo, "tmp/datasets/paca_ca_featInfo.csv", row.names=TRUE)
cat("Metadata written\n")
# Print key metadata columns
cat("\nSurvival cols:", paste(grep("surv|censor|vital|time", colnames(sampInfo), value=TRUE, ignore.case=TRUE), collapse=", "), "\n")
cat("Subtype cols:", paste(grep("subtype|class|moffitt|bailey", colnames(sampInfo), value=TRUE, ignore.case=TRUE), collapse=", "), "\n")
cat("\nProject codes:\n")
print(table(sampInfo$project_code))
cat("\nSpecimen types:\n")
print(table(sampInfo$specimen_type))
cat("\nVital status:\n")
print(table(sampInfo$donor_vital_status))