kamaz01 PeiqingYang commited on
Commit
1ba14a3
·
0 Parent(s):

Duplicate from PeiqingYang/MatAnyone2

Browse files

Co-authored-by: pq-yang <PeiqingYang@users.noreply.huggingface.co>

Files changed (5) hide show
  1. .gitattributes +35 -0
  2. LICENSE +0 -0
  3. README.md +74 -0
  4. config.json +137 -0
  5. model.safetensors +3 -0
.gitattributes ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ *.7z filter=lfs diff=lfs merge=lfs -text
2
+ *.arrow filter=lfs diff=lfs merge=lfs -text
3
+ *.bin filter=lfs diff=lfs merge=lfs -text
4
+ *.bz2 filter=lfs diff=lfs merge=lfs -text
5
+ *.ckpt filter=lfs diff=lfs merge=lfs -text
6
+ *.ftz filter=lfs diff=lfs merge=lfs -text
7
+ *.gz filter=lfs diff=lfs merge=lfs -text
8
+ *.h5 filter=lfs diff=lfs merge=lfs -text
9
+ *.joblib filter=lfs diff=lfs merge=lfs -text
10
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
+ *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
+ *.model filter=lfs diff=lfs merge=lfs -text
13
+ *.msgpack filter=lfs diff=lfs merge=lfs -text
14
+ *.npy filter=lfs diff=lfs merge=lfs -text
15
+ *.npz filter=lfs diff=lfs merge=lfs -text
16
+ *.onnx filter=lfs diff=lfs merge=lfs -text
17
+ *.ot filter=lfs diff=lfs merge=lfs -text
18
+ *.parquet filter=lfs diff=lfs merge=lfs -text
19
+ *.pb filter=lfs diff=lfs merge=lfs -text
20
+ *.pickle filter=lfs diff=lfs merge=lfs -text
21
+ *.pkl filter=lfs diff=lfs merge=lfs -text
22
+ *.pt filter=lfs diff=lfs merge=lfs -text
23
+ *.pth filter=lfs diff=lfs merge=lfs -text
24
+ *.rar filter=lfs diff=lfs merge=lfs -text
25
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
26
+ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
+ *.tar.* filter=lfs diff=lfs merge=lfs -text
28
+ *.tar filter=lfs diff=lfs merge=lfs -text
29
+ *.tflite filter=lfs diff=lfs merge=lfs -text
30
+ *.tgz filter=lfs diff=lfs merge=lfs -text
31
+ *.wasm filter=lfs diff=lfs merge=lfs -text
32
+ *.xz filter=lfs diff=lfs merge=lfs -text
33
+ *.zip filter=lfs diff=lfs merge=lfs -text
34
+ *.zst filter=lfs diff=lfs merge=lfs -text
35
+ *tfevents* filter=lfs diff=lfs merge=lfs -text
LICENSE ADDED
File without changes
README.md ADDED
@@ -0,0 +1,74 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: matanyone2
3
+ tags:
4
+ - model_hub_mixin
5
+ - pytorch_model_hub_mixin
6
+ ---
7
+
8
+ <div align="center">
9
+ <img src="https://github.com/pq-yang/MatAnyone2/blob/main/assets/matanyone2_logo.png?raw=true" alt="MatAnyone Logo" style="height: 52px;">
10
+ <div style="text-align: center">
11
+ <h2>Scaling Video Matting via a Learned Quality Evaluator</h2>
12
+ </div>
13
+
14
+ <div>
15
+ <a href='https://pq-yang.github.io/' target='_blank'>Peiqing Yang</a><sup>1</sup>&emsp;
16
+ <a href='https://shangchenzhou.com/' target='_blank'>Shangchen Zhou</a><sup>1†</sup>&emsp;
17
+ <a href="https://www.linkedin.com/in/kai-hao-794321382/" target='_blank'>Kai Hao</a><sup>1</sup>&emsp;
18
+ <a href="https://scholar.google.com.sg/citations?user=fMXnSGMAAAAJ&hl=en/" target='_blank'>Qingyi Tao</a><sup>2</sup>&emsp;
19
+ </div>
20
+ <div>
21
+ <sup>1</sup>S-Lab, Nanyang Technological University&emsp;
22
+ <sup>2</sup>SenseTime Research, Singapore&emsp;
23
+ <br>
24
+ <sup>†</sup>Project lead
25
+ </div>
26
+
27
+
28
+ <div>
29
+ <h4 align="center">
30
+ <a href="https://pq-yang.github.io/projects/MatAnyone2/" target='_blank'>
31
+ <img src="https://img.shields.io/badge/😈-Project%20Page-blue">
32
+ </a>
33
+ <a href="https://arxiv.org/abs/2512.11782" target='_blank'>
34
+ <img src="https://img.shields.io/badge/arXiv-2501.14677-b31b1b.svg">
35
+ </a>
36
+ <a href="https://www.youtube.com/watch?v=tyi8CNyjOhc&lc=Ugw1OS7z5QbW29RZCFZ4AaABAg" target='_blank'>
37
+ <img src="https://img.shields.io/badge/Demo%20Video-%23FF0000.svg?logo=YouTube&logoColor=white">
38
+ </a>
39
+ <a href="https://huggingface.co/spaces/PeiqingYang/MatAnyone" target='_blank'>
40
+ <img src="https://img.shields.io/badge/Demo-%F0%9F%A4%97%20Hugging%20Face-blue">
41
+ </a>
42
+ <a href="https://colab.research.google.com/drive/1NYW_CUDf7jnzxir7tOOlY7wRRalVOifD?usp=sharing" target='_blank'>
43
+ <img src="https://colab.research.google.com/assets/colab-badge.svg">
44
+ </a>
45
+ </h4>
46
+ </div>
47
+
48
+ <strong>MatAnyone 2 is a practical human video matting framework that preserves fine details by avoiding segmentation-like boundaries, while also shows enhanced robustness under challenging real-world conditions.</strong>
49
+
50
+ <div style="width: 100%; text-align: center; margin:auto;">
51
+ <img style="width:100%" src="https://github.com/pq-yang/MatAnyone2/blob/main/assets/teaser.jpg?raw=true">
52
+ </div>
53
+
54
+ 🎥 For more visual results, go checkout our <a href="https://pq-yang.github.io/projects/MatAnyone2/" target="_blank">project page</a>
55
+
56
+ </div>
57
+
58
+ ---
59
+
60
+ ## How to use
61
+ you can run the following commands to get started and start working with the model
62
+ ```
63
+ pip install -qqU git+https://github.com/pq-yang/MatAnyone2.git
64
+ ```
65
+
66
+ ```python
67
+ from matanyone2 import MatAnyone2, InferenceCore
68
+ model = MatAnyone2.from_pretrained("PeiqingYang/MatAnyone2")
69
+ processor = InferenceCore(model,device="cuda:0")
70
+ # inference
71
+ processor.process_video(input_path="inputs/video/test-sample2.mp4",
72
+ mask_path="inputs/mask/test-sample2.png",
73
+ output_path="results")
74
+ ```
config.json ADDED
@@ -0,0 +1,137 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "cfg": {
3
+ "amp": false,
4
+ "chunk_size": -1,
5
+ "flip_aug": false,
6
+ "long_term": {
7
+ "buffer_tokens": 2000,
8
+ "count_usage": true,
9
+ "max_mem_frames": 10,
10
+ "max_num_tokens": 10000,
11
+ "min_mem_frames": 5,
12
+ "num_prototypes": 128
13
+ },
14
+ "max_internal_size": -1,
15
+ "max_mem_frames": 5,
16
+ "mem_every": 5,
17
+ "model": {
18
+ "aux_loss": {
19
+ "query": {
20
+ "enabled": true,
21
+ "weight": 0.01
22
+ },
23
+ "sensory": {
24
+ "enabled": true,
25
+ "weight": 0.01
26
+ }
27
+ },
28
+ "embed_dim": 256,
29
+ "key_dim": 64,
30
+ "mask_decoder": {
31
+ "up_dims": [
32
+ 256,
33
+ 128,
34
+ 128,
35
+ 64,
36
+ 16
37
+ ]
38
+ },
39
+ "mask_encoder": {
40
+ "final_dim": 256,
41
+ "type": "resnet18"
42
+ },
43
+ "object_summarizer": {
44
+ "add_pe": true,
45
+ "embed_dim": "${model.object_transformer.embed_dim}",
46
+ "num_summaries": "${model.object_transformer.num_queries}"
47
+ },
48
+ "object_transformer": {
49
+ "embed_dim": "${model.embed_dim}",
50
+ "ff_dim": 2048,
51
+ "num_blocks": 3,
52
+ "num_heads": 8,
53
+ "num_queries": 16,
54
+ "pixel_self_attention": {
55
+ "add_pe_to_qkv": [
56
+ true,
57
+ true,
58
+ false
59
+ ]
60
+ },
61
+ "query_self_attention": {
62
+ "add_pe_to_qkv": [
63
+ true,
64
+ true,
65
+ false
66
+ ]
67
+ },
68
+ "read_from_memory": {
69
+ "add_pe_to_qkv": [
70
+ true,
71
+ true,
72
+ false
73
+ ]
74
+ },
75
+ "read_from_past": {
76
+ "add_pe_to_qkv": [
77
+ true,
78
+ true,
79
+ false
80
+ ]
81
+ },
82
+ "read_from_pixel": {
83
+ "add_pe_to_qkv": [
84
+ true,
85
+ true,
86
+ false
87
+ ],
88
+ "input_add_pe": false,
89
+ "input_norm": false
90
+ },
91
+ "read_from_query": {
92
+ "add_pe_to_qkv": [
93
+ true,
94
+ true,
95
+ false
96
+ ],
97
+ "output_norm": false
98
+ }
99
+ },
100
+ "pixel_dim": 256,
101
+ "pixel_encoder": {
102
+ "ms_dims": [
103
+ 1024,
104
+ 512,
105
+ 256,
106
+ 64,
107
+ 3
108
+ ],
109
+ "type": "resnet50"
110
+ },
111
+ "pixel_mean": [
112
+ 0.485,
113
+ 0.456,
114
+ 0.406
115
+ ],
116
+ "pixel_pe_scale": 32,
117
+ "pixel_pe_temperature": 128,
118
+ "pixel_std": [
119
+ 0.229,
120
+ 0.224,
121
+ 0.225
122
+ ],
123
+ "sensory_dim": 256,
124
+ "value_dim": 256
125
+ },
126
+ "output_dir": null,
127
+ "save_all": true,
128
+ "save_aux": false,
129
+ "save_scores": false,
130
+ "stagger_updates": 5,
131
+ "top_k": 30,
132
+ "use_all_masks": false,
133
+ "use_long_term": false,
134
+ "visualize": false
135
+ },
136
+ "single_object": true
137
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:70d3bf1d85d0aaf2020f9ef3577239f4f83b77c2ba47fca1eebaaf872f9ad40f
3
+ size 141199924