Buckets:

glennmatlin's picture
download
raw
5.98 kB
[project]
name = "data-attribution"
version = "0.1.0"
requires-python = ">=3.12,<3.13"
dependencies = [
"torch==2.9.0; sys_platform == 'darwin'",
"torch==2.9.0+cpu; sys_platform != 'darwin' and sys_platform != 'linux'",
"torch==2.9.0+cu129; sys_platform == 'linux'",
"numpy<2",
"requests",
"boto3>=1.34,<2.0",
"python-dotenv",
"bergson",
"transformers>=4.57.1,<5.0.0",
"datasets>=3.0.0",
"pyarrow",
"zstandard>=0.24.0",
"accelerate>=1.11.0",
"safetensors>=0.6.2",
"sentencepiece>=0.2.1",
"huggingface-hub>=0.25",
"torchvision==0.24.0",
"pyyaml>=6.0.0",
"empath==0.89",
"pytest>=9.0.2",
"pytest-cov",
"pandas>=2.0.0",
"ruff",
"jj>=2.14.0",
"plotly>=6.5.0",
"kaleido>=1.2.0",
"tqdm>=4.66.0",
"matplotlib>=3.8",
"pillow>=10",
"fasttext>=0.9.3",
"boto3",
"modal",
"ai2-olmes",
"vllm==0.12.0; sys_platform == 'linux'",
"polars>=1.0.0",
"peft>=0.15",
"lm-eval>=0.4",
"hydra-core==1.4.0.dev1",
"omegaconf==2.4.0.dev3",
"pytrec-eval-terrier>=0.5.6",
"torch-c-dlpack-ext>=0.1.5; sys_platform == 'linux'",
"ipykernel>=7.2.0",
"sentence-transformers>=5.2.3",
]
[project.scripts]
data-attribution = "data_attribution.cli.main:main"
socialiqa-export = "data_attribution.data.socialiqa_export:main"
data-attribution-score = "data_attribution.scoring.cli:main"
data-attribution-precache = "data_attribution.cache.precache:main"
data-attribution-dolma-train = "data_attribution.recipes.dolma_training_index:main"
data-attribution-dolma-metadata = "data_attribution.recipes.dolma_metadata_export:main"
data-attribution-socialiqa-queries = "data_attribution.recipes.socialiqa_queries:main"
data-attribution-run-olmes-evaluation = "data_attribution.recipes.olmes.evaluation:main"
data-attribution-export-olmes-predictions = "data_attribution.recipes.olmes.predictions_export:main"
data-attribution-olmes-query-index = "data_attribution.recipes.olmes.query_index:main"
data-attribution-olmes-instruct-manifest = "data_attribution.recipes.olmes_instruct_manifest:main"
data-attribution-olmes-instruct-cot-manifest = "data_attribution.recipes.olmes_instruct_cot_manifest:main"
data-attribution-hardware-notes = "data_attribution.recipes.hardware_notes:main"
data-attribution-enrich = "data_attribution.analysis.enrich:main"
data-attribution-corpus-manifest = "data_attribution.recipes.corpus_manifest:main"
data-attribution-draw-working-sample = "data_attribution.recipes.draw_working_sample:main"
data-attribution-materialize-sample = "data_attribution.recipes.materialize_sample:main"
data-attribution-sidecar-schema-inventory = "data_attribution.recipes.sidecar_schema_inventory.core:main"
dolma-enrich-format = "dolma.cli:main"
dolma-eda = "dolma.eda.core:main"
data-attribution-pool-sample = "dolma.pool_sample.cli:main"
data-attribution-manifest-sample = "dolma.pool_sample.manifest_cli:main"
data-attribution-manifest-analysis = "dolma.manifest_analysis.cli:main"
data-attribution-manifest-analysis-modal = "dolma.manifest_analysis.modal:main"
dolma-corpus-stats = "dolma.corpus_stats.cli:main"
data-attribution-bin-analysis = "dolma.bin_analysis.cli:main"
data-attribution-weborganizer-report = "dolma.distribution_report.cli:main"
data-attribution-paper-figures = "dolma.distribution_report.cli:main"
data-attribution-quality-sidecars = "dolma.quality.cli:main"
data-attribution-quality-validation = "dolma.quality.validation.cli:main"
data-attribution-trackstar-query = "data_attribution.attribution.trackstar.queries:main"
data-attribution-trackstar-prepare = "data_attribution.attribution.trackstar.prepare:main"
data-attribution-trackstar-aggregate = "data_attribution.attribution.trackstar.aggregate:main"
data-attribution-trackstar-extract = "data_attribution.attribution.trackstar.extract:main"
data-attribution-trackstar-dot-score = "data_attribution.attribution.trackstar.dot_score:main"
data-attribution-trackstar-bin-aggregate = "data_attribution.attribution.trackstar.bin_aggregate:main"
data-attribution-trackstar-bin-aggregate-split = "data_attribution.attribution.trackstar.bin_aggregate_split:main"
data-attribution-trackstar-bin-aggregate-perquery = "data_attribution.attribution.trackstar.bin_aggregate_perquery:main"
data-attribution-trackstar-proponent-examples = "data_attribution.attribution.trackstar.proponent_examples:main"
data-attribution-socialtda-trackstar-analysis = "data_attribution.analysis.socialtda_trackstar.cli:main"
[build-system]
requires = ["setuptools>=68", "wheel"]
build-backend = "setuptools.build_meta"
[tool.setuptools]
package-dir = { "" = "src" }
[tool.setuptools.packages.find]
where = ["src"]
[tool.uv]
package = true
required-environments = [
"sys_platform == 'darwin' and platform_machine == 'arm64'",
"sys_platform == 'linux' and platform_machine == 'x86_64'",
"sys_platform == 'linux' and platform_machine == 'aarch64'",
]
override-dependencies = [
"transformers>=4.57.1,<5.0.0",
]
[[tool.uv.index]]
name = "pytorch-cu129"
url = "https://download.pytorch.org/whl/cu129"
explicit = true
[[tool.uv.index]]
name = "pytorch-cpu"
url = "https://download.pytorch.org/whl/cpu"
explicit = true
[tool.uv.extra-build-dependencies]
fasttext = ["pybind11"]
[tool.uv.sources]
bergson = { path = "./bergson" }
ai2-olmes = { path = "./olmes" }
torch = [
{ index = "pytorch-cu129", marker = "sys_platform == 'linux'" },
{ index = "pytorch-cpu", marker = "sys_platform != 'linux'" },
]
torchvision = [
{ index = "pytorch-cu129", marker = "sys_platform == 'linux'" },
{ index = "pytorch-cpu", marker = "sys_platform != 'linux'" },
]
[project.optional-dependencies]
dev = []
gpu = [
"xformers>=0.0.33.post1; sys_platform == 'linux'",
]
modal = [
"modal>=1.1,<2.0",
]
[tool.pytest.ini_options]
testpaths = ["tests"]
addopts = ""
[dependency-groups]
dev = [
"jupyterlab>=4.5.4",
"matplotlib>=3.10.8",
"seaborn>=0.13.2",
]

Xet Storage Details

Size:
5.98 kB
·
Xet hash:
399d16974226f35f59274bc6ba8b96f0889fb450c659d0d7effa8b9ab5f46a11

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.