Buckets:
| import{s as Qs,o as Ys,n as j}from"../chunks/scheduler.31fdf58d.js";import{S as Ss,i as As,e as p,s as a,c as f,h as Ds,a as m,d as s,b as i,f as $,j as M,g as h,k as B,w as Os,l,m as c,n as u,t as _,o as b,p as T}from"../chunks/index.2f76fdf0.js";import{T as fo}from"../chunks/Tip.8d349121.js";import{C as Ks}from"../chunks/CopyLLMTxtMenu.9922688f.js";import{D as x}from"../chunks/Docstring.470b693c.js";import{C as S}from"../chunks/CodeBlock.ab12f8e1.js";import{E as ce}from"../chunks/ExampleCodeBlock.80dfa610.js";import{H as U,E as er}from"../chunks/MermaidChart.svelte_svelte_type_style_lang.4975a63c.js";import{H as tr,a as Xs}from"../chunks/HfOption.fb051768.js";function or(w){let t,y;return t=new S({props:{code:"aW1wb3J0JTIwdG9yY2glMEFmcm9tJTIwdHJhbnNmb3JtZXJzJTIwaW1wb3J0JTIwcGlwZWxpbmUlMEElMEFwaXBlbGluZSUyMCUzRCUyMHBpcGVsaW5lKCUwQSUyMCUyMCUyMCUyMHRhc2slM0QlMjJ2aXN1YWwtcXVlc3Rpb24tYW5zd2VyaW5nJTIyJTJDJTBBJTIwJTIwJTIwJTIwbW9kZWwlM0QlMjJTYWxlc2ZvcmNlJTJGYmxpcC12cWEtYmFzZSUyMiUyQyUwQSUyMCUyMCUyMCUyMGR0eXBlJTNEdG9yY2guZmxvYXQxNiUyQyUwQSUyMCUyMCUyMCUyMGRldmljZSUzRDAlMEEpJTBBdXJsJTIwJTNEJTIwJTIyaHR0cHMlM0ElMkYlMkZodWdnaW5nZmFjZS5jbyUyRmRhdGFzZXRzJTJGaHVnZ2luZ2ZhY2UlMkZkb2N1bWVudGF0aW9uLWltYWdlcyUyRnJlc29sdmUlMkZtYWluJTJGcGlwZWxpbmUtY2F0LWNob25rLmpwZWclMjIlMEFwaXBlbGluZShxdWVzdGlvbiUzRCUyMldoYXQlMjBpcyUyMHRoZSUyMHdlYXRoZXIlMjBpbiUyMHRoaXMlMjBpbWFnZSUzRiUyMiUyQyUyMGltYWdlJTNEdXJsKQ==",highlighted:`<span class="hljs-keyword">import</span> torch | |
| <span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> pipeline | |
| pipeline = pipeline( | |
| task=<span class="hljs-string">"visual-question-answering"</span>, | |
| model=<span class="hljs-string">"Salesforce/blip-vqa-base"</span>, | |
| dtype=torch.float16, | |
| device=<span class="hljs-number">0</span> | |
| ) | |
| url = <span class="hljs-string">"https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/pipeline-cat-chonk.jpeg"</span> | |
| pipeline(question=<span class="hljs-string">"What is the weather in this image?"</span>, image=url)`,wrap:!1}}),{c(){f(t.$$.fragment)},l(r){h(t.$$.fragment,r)},m(r,d){u(t,r,d),y=!0},p:j,i(r){y||(_(t.$$.fragment,r),y=!0)},o(r){b(t.$$.fragment,r),y=!1},d(r){T(t,r)}}}function nr(w){let t,y;return t=new S({props:{code:"aW1wb3J0JTIwcmVxdWVzdHMlMEFpbXBvcnQlMjB0b3JjaCUwQWZyb20lMjBQSUwlMjBpbXBvcnQlMjBJbWFnZSUwQWZyb20lMjB0cmFuc2Zvcm1lcnMlMjBpbXBvcnQlMjBBdXRvUHJvY2Vzc29yJTJDJTIwQXV0b01vZGVsRm9yVmlzdWFsUXVlc3Rpb25BbnN3ZXJpbmclMEElMEFwcm9jZXNzb3IlMjAlM0QlMjBBdXRvUHJvY2Vzc29yLmZyb21fcHJldHJhaW5lZCglMjJTYWxlc2ZvcmNlJTJGYmxpcC12cWEtYmFzZSUyMiklMEFtb2RlbCUyMCUzRCUyMEF1dG9Nb2RlbEZvclZpc3VhbFF1ZXN0aW9uQW5zd2VyaW5nLmZyb21fcHJldHJhaW5lZCglMEElMjAlMjAlMjAlMjAlMjJTYWxlc2ZvcmNlJTJGYmxpcC12cWEtYmFzZSUyMiUyQyUwQSUyMCUyMCUyMCUyMGR0eXBlJTNEdG9yY2guZmxvYXQxNiUyQyUwQSUyMCUyMCUyMCUyMGRldmljZV9tYXAlM0QlMjJhdXRvJTIyJTBBKSUwQSUwQXVybCUyMCUzRCUyMCUyMmh0dHBzJTNBJTJGJTJGaHVnZ2luZ2ZhY2UuY28lMkZkYXRhc2V0cyUyRmh1Z2dpbmdmYWNlJTJGZG9jdW1lbnRhdGlvbi1pbWFnZXMlMkZyZXNvbHZlJTJGbWFpbiUyRnBpcGVsaW5lLWNhdC1jaG9uay5qcGVnJTIyJTBBaW1hZ2UlMjAlM0QlMjBJbWFnZS5vcGVuKHJlcXVlc3RzLmdldCh1cmwlMkMlMjBzdHJlYW0lM0RUcnVlKS5yYXcpJTBBJTBBcXVlc3Rpb24lMjAlM0QlMjAlMjJXaGF0JTIwaXMlMjB0aGUlMjB3ZWF0aGVyJTIwaW4lMjB0aGlzJTIwaW1hZ2UlM0YlMjIlMEFpbnB1dHMlMjAlM0QlMjBwcm9jZXNzb3IoaW1hZ2VzJTNEaW1hZ2UlMkMlMjB0ZXh0JTNEcXVlc3Rpb24lMkMlMjByZXR1cm5fdGVuc29ycyUzRCUyMnB0JTIyKS50byhtb2RlbC5kZXZpY2UlMkMlMjB0b3JjaC5mbG9hdDE2KSUwQSUwQW91dHB1dCUyMCUzRCUyMG1vZGVsLmdlbmVyYXRlKCoqaW5wdXRzKSUwQXByb2Nlc3Nvci5iYXRjaF9kZWNvZGUob3V0cHV0JTJDJTIwc2tpcF9zcGVjaWFsX3Rva2VucyUzRFRydWUpJTVCMCU1RA==",highlighted:`<span class="hljs-keyword">import</span> requests | |
| <span class="hljs-keyword">import</span> torch | |
| <span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image | |
| <span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> AutoProcessor, AutoModelForVisualQuestionAnswering | |
| processor = AutoProcessor.from_pretrained(<span class="hljs-string">"Salesforce/blip-vqa-base"</span>) | |
| model = AutoModelForVisualQuestionAnswering.from_pretrained( | |
| <span class="hljs-string">"Salesforce/blip-vqa-base"</span>, | |
| dtype=torch.float16, | |
| device_map=<span class="hljs-string">"auto"</span> | |
| ) | |
| url = <span class="hljs-string">"https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/pipeline-cat-chonk.jpeg"</span> | |
| image = Image.<span class="hljs-built_in">open</span>(requests.get(url, stream=<span class="hljs-literal">True</span>).raw) | |
| question = <span class="hljs-string">"What is the weather in this image?"</span> | |
| inputs = processor(images=image, text=question, return_tensors=<span class="hljs-string">"pt"</span>).to(model.device, torch.float16) | |
| output = model.generate(**inputs) | |
| processor.batch_decode(output, skip_special_tokens=<span class="hljs-literal">True</span>)[<span class="hljs-number">0</span>]`,wrap:!1}}),{c(){f(t.$$.fragment)},l(r){h(t.$$.fragment,r)},m(r,d){u(t,r,d),y=!0},p:j,i(r){y||(_(t.$$.fragment,r),y=!0)},o(r){b(t.$$.fragment,r),y=!1},d(r){T(t,r)}}}function sr(w){let t,y,r,d;return t=new Xs({props:{id:"usage",option:"Pipeline",$$slots:{default:[or]},$$scope:{ctx:w}}}),r=new Xs({props:{id:"usage",option:"AutoModel",$$slots:{default:[nr]},$$scope:{ctx:w}}}),{c(){f(t.$$.fragment),y=a(),f(r.$$.fragment)},l(g){h(t.$$.fragment,g),y=i(g),h(r.$$.fragment,g)},m(g,o){u(t,g,o),c(g,y,o),u(r,g,o),d=!0},p(g,o){const v={};o&2&&(v.$$scope={dirty:o,ctx:g}),t.$set(v);const A={};o&2&&(A.$$scope={dirty:o,ctx:g}),r.$set(A)},i(g){d||(_(t.$$.fragment,g),_(r.$$.fragment,g),d=!0)},o(g){b(t.$$.fragment,g),b(r.$$.fragment,g),d=!1},d(g){g&&s(y),T(t,g),T(r,g)}}}function rr(w){let t,y="Example:",r,d,g;return d=new S({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJsaXBDb25maWclMkMlMjBCbGlwTW9kZWwlMEElMEElMjMlMjBJbml0aWFsaXppbmclMjBhJTIwQmxpcENvbmZpZyUyMHdpdGglMjBTYWxlc2ZvcmNlJTJGYmxpcC12cWEtYmFzZSUyMHN0eWxlJTIwY29uZmlndXJhdGlvbiUwQWNvbmZpZ3VyYXRpb24lMjAlM0QlMjBCbGlwQ29uZmlnKCklMEElMEElMjMlMjBJbml0aWFsaXppbmclMjBhJTIwQmxpcFBNb2RlbCUyMCh3aXRoJTIwcmFuZG9tJTIwd2VpZ2h0cyklMjBmcm9tJTIwdGhlJTIwU2FsZXNmb3JjZSUyRmJsaXAtdnFhLWJhc2UlMjBzdHlsZSUyMGNvbmZpZ3VyYXRpb24lMEFtb2RlbCUyMCUzRCUyMEJsaXBNb2RlbChjb25maWd1cmF0aW9uKSUwQSUwQSUyMyUyMEFjY2Vzc2luZyUyMHRoZSUyMG1vZGVsJTIwY29uZmlndXJhdGlvbiUwQWNvbmZpZ3VyYXRpb24lMjAlM0QlMjBtb2RlbC5jb25maWclMEElMEElMjMlMjBXZSUyMGNhbiUyMGFsc28lMjBpbml0aWFsaXplJTIwYSUyMEJsaXBDb25maWclMjBmcm9tJTIwYSUyMEJsaXBUZXh0Q29uZmlnJTIwYW5kJTIwYSUyMEJsaXBWaXNpb25Db25maWclMEElMEElMjMlMjBJbml0aWFsaXppbmclMjBhJTIwQkxJUFRleHQlMjBhbmQlMjBCTElQVmlzaW9uJTIwY29uZmlndXJhdGlvbiUwQWNvbmZpZ190ZXh0JTIwJTNEJTIwQmxpcFRleHRDb25maWcoKSUwQWNvbmZpZ192aXNpb24lMjAlM0QlMjBCbGlwVmlzaW9uQ29uZmlnKCklMEElMEFjb25maWclMjAlM0QlMjBCbGlwQ29uZmlnKHRleHRfY29uZmlnJTNEY29uZmlnX3RleHQlMkMlMjB2aXNpb25fY29uZmlnJTNEY29uZmlnX3Zpc2lvbik=",highlighted:`<span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BlipConfig, BlipModel | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># Initializing a BlipConfig with Salesforce/blip-vqa-base style configuration</span> | |
| <span class="hljs-meta">>>> </span>configuration = BlipConfig() | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># Initializing a BlipPModel (with random weights) from the Salesforce/blip-vqa-base style configuration</span> | |
| <span class="hljs-meta">>>> </span>model = BlipModel(configuration) | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># Accessing the model configuration</span> | |
| <span class="hljs-meta">>>> </span>configuration = model.config | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># We can also initialize a BlipConfig from a BlipTextConfig and a BlipVisionConfig</span> | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># Initializing a BLIPText and BLIPVision configuration</span> | |
| <span class="hljs-meta">>>> </span>config_text = BlipTextConfig() | |
| <span class="hljs-meta">>>> </span>config_vision = BlipVisionConfig() | |
| <span class="hljs-meta">>>> </span>config = BlipConfig(text_config=config_text, vision_config=config_vision)`,wrap:!1}}),{c(){t=p("p"),t.textContent=y,r=a(),f(d.$$.fragment)},l(o){t=m(o,"P",{"data-svelte-h":!0}),M(t)!=="svelte-11lpom8"&&(t.textContent=y),r=i(o),h(d.$$.fragment,o)},m(o,v){c(o,t,v),c(o,r,v),u(d,o,v),g=!0},p:j,i(o){g||(_(d.$$.fragment,o),g=!0)},o(o){b(d.$$.fragment,o),g=!1},d(o){o&&(s(t),s(r)),T(d,o)}}}function ar(w){let t,y="Example:",r,d,g;return d=new S({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJsaXBUZXh0Q29uZmlnJTJDJTIwQmxpcFRleHRNb2RlbCUwQSUwQSUyMyUyMEluaXRpYWxpemluZyUyMGElMjBCbGlwVGV4dENvbmZpZyUyMHdpdGglMjBTYWxlc2ZvcmNlJTJGYmxpcC12cWEtYmFzZSUyMHN0eWxlJTIwY29uZmlndXJhdGlvbiUwQWNvbmZpZ3VyYXRpb24lMjAlM0QlMjBCbGlwVGV4dENvbmZpZygpJTBBJTBBJTIzJTIwSW5pdGlhbGl6aW5nJTIwYSUyMEJsaXBUZXh0TW9kZWwlMjAod2l0aCUyMHJhbmRvbSUyMHdlaWdodHMpJTIwZnJvbSUyMHRoZSUyMFNhbGVzZm9yY2UlMkZibGlwLXZxYS1iYXNlJTIwc3R5bGUlMjBjb25maWd1cmF0aW9uJTBBbW9kZWwlMjAlM0QlMjBCbGlwVGV4dE1vZGVsKGNvbmZpZ3VyYXRpb24pJTBBJTBBJTIzJTIwQWNjZXNzaW5nJTIwdGhlJTIwbW9kZWwlMjBjb25maWd1cmF0aW9uJTBBY29uZmlndXJhdGlvbiUyMCUzRCUyMG1vZGVsLmNvbmZpZw==",highlighted:`<span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BlipTextConfig, BlipTextModel | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># Initializing a BlipTextConfig with Salesforce/blip-vqa-base style configuration</span> | |
| <span class="hljs-meta">>>> </span>configuration = BlipTextConfig() | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># Initializing a BlipTextModel (with random weights) from the Salesforce/blip-vqa-base style configuration</span> | |
| <span class="hljs-meta">>>> </span>model = BlipTextModel(configuration) | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># Accessing the model configuration</span> | |
| <span class="hljs-meta">>>> </span>configuration = model.config`,wrap:!1}}),{c(){t=p("p"),t.textContent=y,r=a(),f(d.$$.fragment)},l(o){t=m(o,"P",{"data-svelte-h":!0}),M(t)!=="svelte-11lpom8"&&(t.textContent=y),r=i(o),h(d.$$.fragment,o)},m(o,v){c(o,t,v),c(o,r,v),u(d,o,v),g=!0},p:j,i(o){g||(_(d.$$.fragment,o),g=!0)},o(o){b(d.$$.fragment,o),g=!1},d(o){o&&(s(t),s(r)),T(d,o)}}}function ir(w){let t,y="Example:",r,d,g;return d=new S({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJsaXBWaXNpb25Db25maWclMkMlMjBCbGlwVmlzaW9uTW9kZWwlMEElMEElMjMlMjBJbml0aWFsaXppbmclMjBhJTIwQmxpcFZpc2lvbkNvbmZpZyUyMHdpdGglMjBTYWxlc2ZvcmNlJTJGYmxpcC12cWEtYmFzZSUyMHN0eWxlJTIwY29uZmlndXJhdGlvbiUwQWNvbmZpZ3VyYXRpb24lMjAlM0QlMjBCbGlwVmlzaW9uQ29uZmlnKCklMEElMEElMjMlMjBJbml0aWFsaXppbmclMjBhJTIwQmxpcFZpc2lvbk1vZGVsJTIwKHdpdGglMjByYW5kb20lMjB3ZWlnaHRzKSUyMGZyb20lMjB0aGUlMjBTYWxlc2ZvcmNlJTJGYmxpcC12cWEtYmFzZSUyMHN0eWxlJTIwY29uZmlndXJhdGlvbiUwQW1vZGVsJTIwJTNEJTIwQmxpcFZpc2lvbk1vZGVsKGNvbmZpZ3VyYXRpb24pJTBBJTBBJTIzJTIwQWNjZXNzaW5nJTIwdGhlJTIwbW9kZWwlMjBjb25maWd1cmF0aW9uJTBBY29uZmlndXJhdGlvbiUyMCUzRCUyMG1vZGVsLmNvbmZpZw==",highlighted:`<span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BlipVisionConfig, BlipVisionModel | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># Initializing a BlipVisionConfig with Salesforce/blip-vqa-base style configuration</span> | |
| <span class="hljs-meta">>>> </span>configuration = BlipVisionConfig() | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># Initializing a BlipVisionModel (with random weights) from the Salesforce/blip-vqa-base style configuration</span> | |
| <span class="hljs-meta">>>> </span>model = BlipVisionModel(configuration) | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># Accessing the model configuration</span> | |
| <span class="hljs-meta">>>> </span>configuration = model.config`,wrap:!1}}),{c(){t=p("p"),t.textContent=y,r=a(),f(d.$$.fragment)},l(o){t=m(o,"P",{"data-svelte-h":!0}),M(t)!=="svelte-11lpom8"&&(t.textContent=y),r=i(o),h(d.$$.fragment,o)},m(o,v){c(o,t,v),c(o,r,v),u(d,o,v),g=!0},p:j,i(o){g||(_(d.$$.fragment,o),g=!0)},o(o){b(d.$$.fragment,o),g=!1},d(o){o&&(s(t),s(r)),T(d,o)}}}function lr(w){let t,y=`Although the recipe for forward pass needs to be defined within this function, one should call the <code>Module</code> | |
| instance afterwards instead of this since the former takes care of running the pre and post processing steps while | |
| the latter silently ignores them.`;return{c(){t=p("p"),t.innerHTML=y},l(r){t=m(r,"P",{"data-svelte-h":!0}),M(t)!=="svelte-fincs2"&&(t.innerHTML=y)},m(r,d){c(r,t,d)},p:j,d(r){r&&s(t)}}}function dr(w){let t,y="Examples:",r,d,g;return d=new S({props:{code:"ZnJvbSUyMFBJTCUyMGltcG9ydCUyMEltYWdlJTBBaW1wb3J0JTIwcmVxdWVzdHMlMEFmcm9tJTIwdHJhbnNmb3JtZXJzJTIwaW1wb3J0JTIwQXV0b1Byb2Nlc3NvciUyQyUyMEJsaXBNb2RlbCUwQSUwQW1vZGVsJTIwJTNEJTIwQmxpcE1vZGVsLmZyb21fcHJldHJhaW5lZCglMjJTYWxlc2ZvcmNlJTJGYmxpcC1pbWFnZS1jYXB0aW9uaW5nLWJhc2UlMjIpJTBBcHJvY2Vzc29yJTIwJTNEJTIwQXV0b1Byb2Nlc3Nvci5mcm9tX3ByZXRyYWluZWQoJTIyU2FsZXNmb3JjZSUyRmJsaXAtaW1hZ2UtY2FwdGlvbmluZy1iYXNlJTIyKSUwQSUwQXVybCUyMCUzRCUyMCUyMmh0dHAlM0ElMkYlMkZpbWFnZXMuY29jb2RhdGFzZXQub3JnJTJGdmFsMjAxNyUyRjAwMDAwMDAzOTc2OS5qcGclMjIlMEFpbWFnZSUyMCUzRCUyMEltYWdlLm9wZW4ocmVxdWVzdHMuZ2V0KHVybCUyQyUyMHN0cmVhbSUzRFRydWUpLnJhdyklMEElMEFpbnB1dHMlMjAlM0QlMjBwcm9jZXNzb3IoJTBBJTIwJTIwJTIwJTIwdGV4dCUzRCU1QiUyMmElMjBwaG90byUyMG9mJTIwYSUyMGNhdCUyMiUyQyUyMCUyMmElMjBwaG90byUyMG9mJTIwYSUyMGRvZyUyMiU1RCUyQyUyMGltYWdlcyUzRGltYWdlJTJDJTIwcmV0dXJuX3RlbnNvcnMlM0QlMjJwdCUyMiUyQyUyMHBhZGRpbmclM0RUcnVlJTBBKSUwQSUwQW91dHB1dHMlMjAlM0QlMjBtb2RlbCgqKmlucHV0cyklMEFsb2dpdHNfcGVyX2ltYWdlJTIwJTNEJTIwb3V0cHV0cy5sb2dpdHNfcGVyX2ltYWdlJTIwJTIwJTIzJTIwdGhpcyUyMGlzJTIwdGhlJTIwaW1hZ2UtdGV4dCUyMHNpbWlsYXJpdHklMjBzY29yZSUwQXByb2JzJTIwJTNEJTIwbG9naXRzX3Blcl9pbWFnZS5zb2Z0bWF4KGRpbSUzRDEpJTIwJTIwJTIzJTIwd2UlMjBjYW4lMjB0YWtlJTIwdGhlJTIwc29mdG1heCUyMHRvJTIwZ2V0JTIwdGhlJTIwbGFiZWwlMjBwcm9iYWJpbGl0aWVz",highlighted:`<span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image | |
| <span class="hljs-meta">>>> </span><span class="hljs-keyword">import</span> requests | |
| <span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> AutoProcessor, BlipModel | |
| <span class="hljs-meta">>>> </span>model = BlipModel.from_pretrained(<span class="hljs-string">"Salesforce/blip-image-captioning-base"</span>) | |
| <span class="hljs-meta">>>> </span>processor = AutoProcessor.from_pretrained(<span class="hljs-string">"Salesforce/blip-image-captioning-base"</span>) | |
| <span class="hljs-meta">>>> </span>url = <span class="hljs-string">"http://images.cocodataset.org/val2017/000000039769.jpg"</span> | |
| <span class="hljs-meta">>>> </span>image = Image.<span class="hljs-built_in">open</span>(requests.get(url, stream=<span class="hljs-literal">True</span>).raw) | |
| <span class="hljs-meta">>>> </span>inputs = processor( | |
| <span class="hljs-meta">... </span> text=[<span class="hljs-string">"a photo of a cat"</span>, <span class="hljs-string">"a photo of a dog"</span>], images=image, return_tensors=<span class="hljs-string">"pt"</span>, padding=<span class="hljs-literal">True</span> | |
| <span class="hljs-meta">... </span>) | |
| <span class="hljs-meta">>>> </span>outputs = model(**inputs) | |
| <span class="hljs-meta">>>> </span>logits_per_image = outputs.logits_per_image <span class="hljs-comment"># this is the image-text similarity score</span> | |
| <span class="hljs-meta">>>> </span>probs = logits_per_image.softmax(dim=<span class="hljs-number">1</span>) <span class="hljs-comment"># we can take the softmax to get the label probabilities</span>`,wrap:!1}}),{c(){t=p("p"),t.textContent=y,r=a(),f(d.$$.fragment)},l(o){t=m(o,"P",{"data-svelte-h":!0}),M(t)!=="svelte-kvfsh7"&&(t.textContent=y),r=i(o),h(d.$$.fragment,o)},m(o,v){c(o,t,v),c(o,r,v),u(d,o,v),g=!0},p:j,i(o){g||(_(d.$$.fragment,o),g=!0)},o(o){b(d.$$.fragment,o),g=!1},d(o){o&&(s(t),s(r)),T(d,o)}}}function cr(w){let t,y="Examples:",r,d,g;return d=new S({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEF1dG9Qcm9jZXNzb3IlMkMlMjBCbGlwTW9kZWwlMEElMEFtb2RlbCUyMCUzRCUyMEJsaXBNb2RlbC5mcm9tX3ByZXRyYWluZWQoJTIyU2FsZXNmb3JjZSUyRmJsaXAtaW1hZ2UtY2FwdGlvbmluZy1iYXNlJTIyKSUwQXByb2Nlc3NvciUyMCUzRCUyMEF1dG9Qcm9jZXNzb3IuZnJvbV9wcmV0cmFpbmVkKCUyMlNhbGVzZm9yY2UlMkZibGlwLWltYWdlLWNhcHRpb25pbmctYmFzZSUyMiklMEElMEFpbnB1dHMlMjAlM0QlMjBwcm9jZXNzb3IodGV4dCUzRCU1QiUyMmElMjBwaG90byUyMG9mJTIwYSUyMGNhdCUyMiUyQyUyMCUyMmElMjBwaG90byUyMG9mJTIwYSUyMGRvZyUyMiU1RCUyQyUyMHBhZGRpbmclM0RUcnVlJTJDJTIwcmV0dXJuX3RlbnNvcnMlM0QlMjJwdCUyMiklMEF0ZXh0X2ZlYXR1cmVzJTIwJTNEJTIwbW9kZWwuZ2V0X3RleHRfZmVhdHVyZXMoKippbnB1dHMp",highlighted:`<span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> AutoProcessor, BlipModel | |
| <span class="hljs-meta">>>> </span>model = BlipModel.from_pretrained(<span class="hljs-string">"Salesforce/blip-image-captioning-base"</span>) | |
| <span class="hljs-meta">>>> </span>processor = AutoProcessor.from_pretrained(<span class="hljs-string">"Salesforce/blip-image-captioning-base"</span>) | |
| <span class="hljs-meta">>>> </span>inputs = processor(text=[<span class="hljs-string">"a photo of a cat"</span>, <span class="hljs-string">"a photo of a dog"</span>], padding=<span class="hljs-literal">True</span>, return_tensors=<span class="hljs-string">"pt"</span>) | |
| <span class="hljs-meta">>>> </span>text_features = model.get_text_features(**inputs)`,wrap:!1}}),{c(){t=p("p"),t.textContent=y,r=a(),f(d.$$.fragment)},l(o){t=m(o,"P",{"data-svelte-h":!0}),M(t)!=="svelte-kvfsh7"&&(t.textContent=y),r=i(o),h(d.$$.fragment,o)},m(o,v){c(o,t,v),c(o,r,v),u(d,o,v),g=!0},p:j,i(o){g||(_(d.$$.fragment,o),g=!0)},o(o){b(d.$$.fragment,o),g=!1},d(o){o&&(s(t),s(r)),T(d,o)}}}function pr(w){let t,y="Examples:",r,d,g;return d=new S({props:{code:"ZnJvbSUyMFBJTCUyMGltcG9ydCUyMEltYWdlJTBBaW1wb3J0JTIwcmVxdWVzdHMlMEFmcm9tJTIwdHJhbnNmb3JtZXJzJTIwaW1wb3J0JTIwQXV0b1Byb2Nlc3NvciUyQyUyMEJsaXBNb2RlbCUwQSUwQW1vZGVsJTIwJTNEJTIwQmxpcE1vZGVsLmZyb21fcHJldHJhaW5lZCglMjJTYWxlc2ZvcmNlJTJGYmxpcC1pbWFnZS1jYXB0aW9uaW5nLWJhc2UlMjIpJTBBcHJvY2Vzc29yJTIwJTNEJTIwQXV0b1Byb2Nlc3Nvci5mcm9tX3ByZXRyYWluZWQoJTIyU2FsZXNmb3JjZSUyRmJsaXAtaW1hZ2UtY2FwdGlvbmluZy1iYXNlJTIyKSUwQSUwQXVybCUyMCUzRCUyMCUyMmh0dHAlM0ElMkYlMkZpbWFnZXMuY29jb2RhdGFzZXQub3JnJTJGdmFsMjAxNyUyRjAwMDAwMDAzOTc2OS5qcGclMjIlMEFpbWFnZSUyMCUzRCUyMEltYWdlLm9wZW4ocmVxdWVzdHMuZ2V0KHVybCUyQyUyMHN0cmVhbSUzRFRydWUpLnJhdyklMEElMEFpbnB1dHMlMjAlM0QlMjBwcm9jZXNzb3IoaW1hZ2VzJTNEaW1hZ2UlMkMlMjByZXR1cm5fdGVuc29ycyUzRCUyMnB0JTIyKSUwQSUwQWltYWdlX2ZlYXR1cmVzJTIwJTNEJTIwbW9kZWwuZ2V0X2ltYWdlX2ZlYXR1cmVzKCoqaW5wdXRzKQ==",highlighted:`<span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image | |
| <span class="hljs-meta">>>> </span><span class="hljs-keyword">import</span> requests | |
| <span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> AutoProcessor, BlipModel | |
| <span class="hljs-meta">>>> </span>model = BlipModel.from_pretrained(<span class="hljs-string">"Salesforce/blip-image-captioning-base"</span>) | |
| <span class="hljs-meta">>>> </span>processor = AutoProcessor.from_pretrained(<span class="hljs-string">"Salesforce/blip-image-captioning-base"</span>) | |
| <span class="hljs-meta">>>> </span>url = <span class="hljs-string">"http://images.cocodataset.org/val2017/000000039769.jpg"</span> | |
| <span class="hljs-meta">>>> </span>image = Image.<span class="hljs-built_in">open</span>(requests.get(url, stream=<span class="hljs-literal">True</span>).raw) | |
| <span class="hljs-meta">>>> </span>inputs = processor(images=image, return_tensors=<span class="hljs-string">"pt"</span>) | |
| <span class="hljs-meta">>>> </span>image_features = model.get_image_features(**inputs)`,wrap:!1}}),{c(){t=p("p"),t.textContent=y,r=a(),f(d.$$.fragment)},l(o){t=m(o,"P",{"data-svelte-h":!0}),M(t)!=="svelte-kvfsh7"&&(t.textContent=y),r=i(o),h(d.$$.fragment,o)},m(o,v){c(o,t,v),c(o,r,v),u(d,o,v),g=!0},p:j,i(o){g||(_(d.$$.fragment,o),g=!0)},o(o){b(d.$$.fragment,o),g=!1},d(o){o&&(s(t),s(r)),T(d,o)}}}function mr(w){let t,y=`Although the recipe for forward pass needs to be defined within this function, one should call the <code>Module</code> | |
| instance afterwards instead of this since the former takes care of running the pre and post processing steps while | |
| the latter silently ignores them.`;return{c(){t=p("p"),t.innerHTML=y},l(r){t=m(r,"P",{"data-svelte-h":!0}),M(t)!=="svelte-fincs2"&&(t.innerHTML=y)},m(r,d){c(r,t,d)},p:j,d(r){r&&s(t)}}}function gr(w){let t,y=`Although the recipe for forward pass needs to be defined within this function, one should call the <code>Module</code> | |
| instance afterwards instead of this since the former takes care of running the pre and post processing steps while | |
| the latter silently ignores them.`;return{c(){t=p("p"),t.innerHTML=y},l(r){t=m(r,"P",{"data-svelte-h":!0}),M(t)!=="svelte-fincs2"&&(t.innerHTML=y)},m(r,d){c(r,t,d)},p:j,d(r){r&&s(t)}}}function fr(w){let t,y="Examples:",r,d,g;return d=new S({props:{code:"ZnJvbSUyMFBJTCUyMGltcG9ydCUyMEltYWdlJTBBaW1wb3J0JTIwcmVxdWVzdHMlMEFmcm9tJTIwdHJhbnNmb3JtZXJzJTIwaW1wb3J0JTIwQXV0b1Byb2Nlc3NvciUyQyUyMEJsaXBGb3JDb25kaXRpb25hbEdlbmVyYXRpb24lMEElMEFwcm9jZXNzb3IlMjAlM0QlMjBBdXRvUHJvY2Vzc29yLmZyb21fcHJldHJhaW5lZCglMjJTYWxlc2ZvcmNlJTJGYmxpcC1pbWFnZS1jYXB0aW9uaW5nLWJhc2UlMjIpJTBBbW9kZWwlMjAlM0QlMjBCbGlwRm9yQ29uZGl0aW9uYWxHZW5lcmF0aW9uLmZyb21fcHJldHJhaW5lZCglMjJTYWxlc2ZvcmNlJTJGYmxpcC1pbWFnZS1jYXB0aW9uaW5nLWJhc2UlMjIpJTBBJTBBdXJsJTIwJTNEJTIwJTIyaHR0cCUzQSUyRiUyRmltYWdlcy5jb2NvZGF0YXNldC5vcmclMkZ2YWwyMDE3JTJGMDAwMDAwMDM5NzY5LmpwZyUyMiUwQWltYWdlJTIwJTNEJTIwSW1hZ2Uub3BlbihyZXF1ZXN0cy5nZXQodXJsJTJDJTIwc3RyZWFtJTNEVHJ1ZSkucmF3KSUwQXRleHQlMjAlM0QlMjAlMjJBJTIwcGljdHVyZSUyMG9mJTIyJTBBJTBBaW5wdXRzJTIwJTNEJTIwcHJvY2Vzc29yKGltYWdlcyUzRGltYWdlJTJDJTIwdGV4dCUzRHRleHQlMkMlMjByZXR1cm5fdGVuc29ycyUzRCUyMnB0JTIyKSUwQSUwQW91dHB1dHMlMjAlM0QlMjBtb2RlbCgqKmlucHV0cyk=",highlighted:`<span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image | |
| <span class="hljs-meta">>>> </span><span class="hljs-keyword">import</span> requests | |
| <span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> AutoProcessor, BlipForConditionalGeneration | |
| <span class="hljs-meta">>>> </span>processor = AutoProcessor.from_pretrained(<span class="hljs-string">"Salesforce/blip-image-captioning-base"</span>) | |
| <span class="hljs-meta">>>> </span>model = BlipForConditionalGeneration.from_pretrained(<span class="hljs-string">"Salesforce/blip-image-captioning-base"</span>) | |
| <span class="hljs-meta">>>> </span>url = <span class="hljs-string">"http://images.cocodataset.org/val2017/000000039769.jpg"</span> | |
| <span class="hljs-meta">>>> </span>image = Image.<span class="hljs-built_in">open</span>(requests.get(url, stream=<span class="hljs-literal">True</span>).raw) | |
| <span class="hljs-meta">>>> </span>text = <span class="hljs-string">"A picture of"</span> | |
| <span class="hljs-meta">>>> </span>inputs = processor(images=image, text=text, return_tensors=<span class="hljs-string">"pt"</span>) | |
| <span class="hljs-meta">>>> </span>outputs = model(**inputs)`,wrap:!1}}),{c(){t=p("p"),t.textContent=y,r=a(),f(d.$$.fragment)},l(o){t=m(o,"P",{"data-svelte-h":!0}),M(t)!=="svelte-kvfsh7"&&(t.textContent=y),r=i(o),h(d.$$.fragment,o)},m(o,v){c(o,t,v),c(o,r,v),u(d,o,v),g=!0},p:j,i(o){g||(_(d.$$.fragment,o),g=!0)},o(o){b(d.$$.fragment,o),g=!1},d(o){o&&(s(t),s(r)),T(d,o)}}}function hr(w){let t,y=`Although the recipe for forward pass needs to be defined within this function, one should call the <code>Module</code> | |
| instance afterwards instead of this since the former takes care of running the pre and post processing steps while | |
| the latter silently ignores them.`;return{c(){t=p("p"),t.innerHTML=y},l(r){t=m(r,"P",{"data-svelte-h":!0}),M(t)!=="svelte-fincs2"&&(t.innerHTML=y)},m(r,d){c(r,t,d)},p:j,d(r){r&&s(t)}}}function ur(w){let t,y="Examples:",r,d,g;return d=new S({props:{code:"ZnJvbSUyMFBJTCUyMGltcG9ydCUyMEltYWdlJTBBaW1wb3J0JTIwcmVxdWVzdHMlMEFmcm9tJTIwdHJhbnNmb3JtZXJzJTIwaW1wb3J0JTIwQXV0b1Byb2Nlc3NvciUyQyUyMEJsaXBGb3JJbWFnZVRleHRSZXRyaWV2YWwlMEElMEFtb2RlbCUyMCUzRCUyMEJsaXBGb3JJbWFnZVRleHRSZXRyaWV2YWwuZnJvbV9wcmV0cmFpbmVkKCUyMlNhbGVzZm9yY2UlMkZibGlwLWl0bS1iYXNlLWNvY28lMjIpJTBBcHJvY2Vzc29yJTIwJTNEJTIwQXV0b1Byb2Nlc3Nvci5mcm9tX3ByZXRyYWluZWQoJTIyU2FsZXNmb3JjZSUyRmJsaXAtaXRtLWJhc2UtY29jbyUyMiklMEElMEF1cmwlMjAlM0QlMjAlMjJodHRwJTNBJTJGJTJGaW1hZ2VzLmNvY29kYXRhc2V0Lm9yZyUyRnZhbDIwMTclMkYwMDAwMDAwMzk3NjkuanBnJTIyJTBBaW1hZ2UlMjAlM0QlMjBJbWFnZS5vcGVuKHJlcXVlc3RzLmdldCh1cmwlMkMlMjBzdHJlYW0lM0RUcnVlKS5yYXcpJTBBdGV4dCUyMCUzRCUyMCUyMmFuJTIwaW1hZ2UlMjBvZiUyMGElMjBjYXQlMjIlMEElMEFpbnB1dHMlMjAlM0QlMjBwcm9jZXNzb3IoaW1hZ2VzJTNEaW1hZ2UlMkMlMjB0ZXh0JTNEdGV4dCUyQyUyMHJldHVybl90ZW5zb3JzJTNEJTIycHQlMjIpJTBBb3V0cHV0cyUyMCUzRCUyMG1vZGVsKCoqaW5wdXRzKQ==",highlighted:`<span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image | |
| <span class="hljs-meta">>>> </span><span class="hljs-keyword">import</span> requests | |
| <span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> AutoProcessor, BlipForImageTextRetrieval | |
| <span class="hljs-meta">>>> </span>model = BlipForImageTextRetrieval.from_pretrained(<span class="hljs-string">"Salesforce/blip-itm-base-coco"</span>) | |
| <span class="hljs-meta">>>> </span>processor = AutoProcessor.from_pretrained(<span class="hljs-string">"Salesforce/blip-itm-base-coco"</span>) | |
| <span class="hljs-meta">>>> </span>url = <span class="hljs-string">"http://images.cocodataset.org/val2017/000000039769.jpg"</span> | |
| <span class="hljs-meta">>>> </span>image = Image.<span class="hljs-built_in">open</span>(requests.get(url, stream=<span class="hljs-literal">True</span>).raw) | |
| <span class="hljs-meta">>>> </span>text = <span class="hljs-string">"an image of a cat"</span> | |
| <span class="hljs-meta">>>> </span>inputs = processor(images=image, text=text, return_tensors=<span class="hljs-string">"pt"</span>) | |
| <span class="hljs-meta">>>> </span>outputs = model(**inputs)`,wrap:!1}}),{c(){t=p("p"),t.textContent=y,r=a(),f(d.$$.fragment)},l(o){t=m(o,"P",{"data-svelte-h":!0}),M(t)!=="svelte-kvfsh7"&&(t.textContent=y),r=i(o),h(d.$$.fragment,o)},m(o,v){c(o,t,v),c(o,r,v),u(d,o,v),g=!0},p:j,i(o){g||(_(d.$$.fragment,o),g=!0)},o(o){b(d.$$.fragment,o),g=!1},d(o){o&&(s(t),s(r)),T(d,o)}}}function _r(w){let t,y=`Although the recipe for forward pass needs to be defined within this function, one should call the <code>Module</code> | |
| instance afterwards instead of this since the former takes care of running the pre and post processing steps while | |
| the latter silently ignores them.`;return{c(){t=p("p"),t.innerHTML=y},l(r){t=m(r,"P",{"data-svelte-h":!0}),M(t)!=="svelte-fincs2"&&(t.innerHTML=y)},m(r,d){c(r,t,d)},p:j,d(r){r&&s(t)}}}function br(w){let t,y="Examples:",r,d,g;return d=new S({props:{code:"ZnJvbSUyMFBJTCUyMGltcG9ydCUyMEltYWdlJTBBaW1wb3J0JTIwcmVxdWVzdHMlMEFmcm9tJTIwdHJhbnNmb3JtZXJzJTIwaW1wb3J0JTIwQXV0b1Byb2Nlc3NvciUyQyUyMEJsaXBGb3JRdWVzdGlvbkFuc3dlcmluZyUwQSUwQW1vZGVsJTIwJTNEJTIwQmxpcEZvclF1ZXN0aW9uQW5zd2VyaW5nLmZyb21fcHJldHJhaW5lZCglMjJTYWxlc2ZvcmNlJTJGYmxpcC12cWEtYmFzZSUyMiklMEFwcm9jZXNzb3IlMjAlM0QlMjBBdXRvUHJvY2Vzc29yLmZyb21fcHJldHJhaW5lZCglMjJTYWxlc2ZvcmNlJTJGYmxpcC12cWEtYmFzZSUyMiklMEElMEF1cmwlMjAlM0QlMjAlMjJodHRwJTNBJTJGJTJGaW1hZ2VzLmNvY29kYXRhc2V0Lm9yZyUyRnZhbDIwMTclMkYwMDAwMDAwMzk3NjkuanBnJTIyJTBBaW1hZ2UlMjAlM0QlMjBJbWFnZS5vcGVuKHJlcXVlc3RzLmdldCh1cmwlMkMlMjBzdHJlYW0lM0RUcnVlKS5yYXcpJTBBJTBBJTIzJTIwdHJhaW5pbmclMEF0ZXh0JTIwJTNEJTIwJTIySG93JTIwbWFueSUyMGNhdHMlMjBhcmUlMjBpbiUyMHRoZSUyMHBpY3R1cmUlM0YlMjIlMEFsYWJlbCUyMCUzRCUyMCUyMjIlMjIlMEFpbnB1dHMlMjAlM0QlMjBwcm9jZXNzb3IoaW1hZ2VzJTNEaW1hZ2UlMkMlMjB0ZXh0JTNEdGV4dCUyQyUyMHJldHVybl90ZW5zb3JzJTNEJTIycHQlMjIpJTBBbGFiZWxzJTIwJTNEJTIwcHJvY2Vzc29yKHRleHQlM0RsYWJlbCUyQyUyMHJldHVybl90ZW5zb3JzJTNEJTIycHQlMjIpLmlucHV0X2lkcyUwQSUwQWlucHV0cyU1QiUyMmxhYmVscyUyMiU1RCUyMCUzRCUyMGxhYmVscyUwQW91dHB1dHMlMjAlM0QlMjBtb2RlbCgqKmlucHV0cyklMEFsb3NzJTIwJTNEJTIwb3V0cHV0cy5sb3NzJTBBbG9zcy5iYWNrd2FyZCgpJTBBJTBBJTIzJTIwaW5mZXJlbmNlJTBBdGV4dCUyMCUzRCUyMCUyMkhvdyUyMG1hbnklMjBjYXRzJTIwYXJlJTIwaW4lMjB0aGUlMjBwaWN0dXJlJTNGJTIyJTBBaW5wdXRzJTIwJTNEJTIwcHJvY2Vzc29yKGltYWdlcyUzRGltYWdlJTJDJTIwdGV4dCUzRHRleHQlMkMlMjByZXR1cm5fdGVuc29ycyUzRCUyMnB0JTIyKSUwQW91dHB1dHMlMjAlM0QlMjBtb2RlbC5nZW5lcmF0ZSgqKmlucHV0cyklMEFwcmludChwcm9jZXNzb3IuZGVjb2RlKG91dHB1dHMlNUIwJTVEJTJDJTIwc2tpcF9zcGVjaWFsX3Rva2VucyUzRFRydWUpKQ==",highlighted:`<span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image | |
| <span class="hljs-meta">>>> </span><span class="hljs-keyword">import</span> requests | |
| <span class="hljs-meta">>>> </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> AutoProcessor, BlipForQuestionAnswering | |
| <span class="hljs-meta">>>> </span>model = BlipForQuestionAnswering.from_pretrained(<span class="hljs-string">"Salesforce/blip-vqa-base"</span>) | |
| <span class="hljs-meta">>>> </span>processor = AutoProcessor.from_pretrained(<span class="hljs-string">"Salesforce/blip-vqa-base"</span>) | |
| <span class="hljs-meta">>>> </span>url = <span class="hljs-string">"http://images.cocodataset.org/val2017/000000039769.jpg"</span> | |
| <span class="hljs-meta">>>> </span>image = Image.<span class="hljs-built_in">open</span>(requests.get(url, stream=<span class="hljs-literal">True</span>).raw) | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># training</span> | |
| <span class="hljs-meta">>>> </span>text = <span class="hljs-string">"How many cats are in the picture?"</span> | |
| <span class="hljs-meta">>>> </span>label = <span class="hljs-string">"2"</span> | |
| <span class="hljs-meta">>>> </span>inputs = processor(images=image, text=text, return_tensors=<span class="hljs-string">"pt"</span>) | |
| <span class="hljs-meta">>>> </span>labels = processor(text=label, return_tensors=<span class="hljs-string">"pt"</span>).input_ids | |
| <span class="hljs-meta">>>> </span>inputs[<span class="hljs-string">"labels"</span>] = labels | |
| <span class="hljs-meta">>>> </span>outputs = model(**inputs) | |
| <span class="hljs-meta">>>> </span>loss = outputs.loss | |
| <span class="hljs-meta">>>> </span>loss.backward() | |
| <span class="hljs-meta">>>> </span><span class="hljs-comment"># inference</span> | |
| <span class="hljs-meta">>>> </span>text = <span class="hljs-string">"How many cats are in the picture?"</span> | |
| <span class="hljs-meta">>>> </span>inputs = processor(images=image, text=text, return_tensors=<span class="hljs-string">"pt"</span>) | |
| <span class="hljs-meta">>>> </span>outputs = model.generate(**inputs) | |
| <span class="hljs-meta">>>> </span><span class="hljs-built_in">print</span>(processor.decode(outputs[<span class="hljs-number">0</span>], skip_special_tokens=<span class="hljs-literal">True</span>)) | |
| <span class="hljs-number">2</span>`,wrap:!1}}),{c(){t=p("p"),t.textContent=y,r=a(),f(d.$$.fragment)},l(o){t=m(o,"P",{"data-svelte-h":!0}),M(t)!=="svelte-kvfsh7"&&(t.textContent=y),r=i(o),h(d.$$.fragment,o)},m(o,v){c(o,t,v),c(o,r,v),u(d,o,v),g=!0},p:j,i(o){g||(_(d.$$.fragment,o),g=!0)},o(o){b(d.$$.fragment,o),g=!1},d(o){o&&(s(t),s(r)),T(d,o)}}}function Tr(w){let t,y,r,d,g,o="<em>This model was released on 2022-01-28 and added to Hugging Face Transformers on 2022-12-21.</em>",v,A,ho,pe,as='<div class="flex flex-wrap space-x-1"><img alt="PyTorch" src="https://img.shields.io/badge/PyTorch-DE3412?style=flat&logo=pytorch&logoColor=white"/></div>',uo,We,_o,Fe,is='<a href="https://huggingface.co/papers/2201.12086" rel="nofollow">BLIP</a> (Bootstrapped Language-Image Pretraining) is a vision-language pretraining (VLP) framework designed for <em>both</em> understanding and generation tasks. Most existing pretrained models are only good at one or the other. It uses a captioner to generate captions and a filter to remove the noisy captions. This increases training data quality and more effectively uses the messy web data.',bo,Ze,ls='You can find all the original BLIP checkpoints under the <a href="https://huggingface.co/collections/Salesforce/blip-models-65242f40f1491fbf6a9e9472" rel="nofollow">BLIP</a> collection.',To,me,ds='<p>This model was contributed by <a href="https://huggingface.co/ybelkada" rel="nofollow">ybelkada</a>.</p> <p>Click on the BLIP models in the right sidebar for more examples of how to apply BLIP to different vision language tasks.</p>',yo,Pe,cs='The example below demonstrates how to visual question answering with <a href="/docs/transformers/pr_33962/en/main_classes/pipelines#transformers.Pipeline">Pipeline</a> or the <a href="/docs/transformers/pr_33962/en/model_doc/auto#transformers.AutoModel">AutoModel</a> class.',Mo,ge,vo,Ne,wo,Ve,ps='Refer to this <a href="https://github.com/huggingface/notebooks/blob/main/examples/image_captioning_blip.ipynb" rel="nofollow">notebook</a> to learn how to fine-tune BLIP for image captioning on a custom dataset.',Bo,qe,$o,W,Re,tn,jt,ms=`<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipConfig">BlipConfig</a> is the configuration class to store the configuration of a <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipModel">BlipModel</a>. It is used to instantiate | |
| a BLIP model according to the specified arguments, defining the text model and vision model configs. Instantiating | |
| a configuration with the defaults will yield a similar configuration to that of the BLIP-base | |
| <a href="https://huggingface.co/Salesforce/blip-vqa-base" rel="nofollow">Salesforce/blip-vqa-base</a> architecture.`,on,Ct,gs=`Configuration objects inherit from <a href="/docs/transformers/pr_33962/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> and can be used to control the model outputs. Read the | |
| documentation from <a href="/docs/transformers/pr_33962/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> for more information.`,nn,fe,xo,He,Jo,F,Ge,sn,zt,fs=`This is the configuration class to store the configuration of a <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipTextModel">BlipTextModel</a>. It is used to instantiate a BLIP | |
| text model according to the specified arguments, defining the model architecture. Instantiating a configuration | |
| with the defaults will yield a similar configuration to that of the <code>BlipText</code> used by the <a href="https://huggingface.co/Salesforce/blip-vqa-base" rel="nofollow">base | |
| architectures</a>.`,rn,kt,hs=`Configuration objects inherit from <a href="/docs/transformers/pr_33962/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> and can be used to control the model outputs. Read the | |
| documentation from <a href="/docs/transformers/pr_33962/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> for more information.`,an,he,Io,Ee,jo,Z,Le,ln,Ut,us=`This is the configuration class to store the configuration of a <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipVisionModel">BlipVisionModel</a>. It is used to instantiate a | |
| BLIP vision model according to the specified arguments, defining the model architecture. Instantiating a | |
| configuration defaults will yield a similar configuration to that of the Blip-base | |
| <a href="https://huggingface.co/Salesforce/blip-vqa-base" rel="nofollow">Salesforce/blip-vqa-base</a> architecture.`,dn,Wt,_s=`Configuration objects inherit from <a href="/docs/transformers/pr_33962/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> and can be used to control the model outputs. Read the | |
| documentation from <a href="/docs/transformers/pr_33962/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> for more information.`,cn,ue,Co,Xe,zo,R,Qe,pn,Ft,bs="Constructs a BLIP processor which wraps a BERT tokenizer and BLIP image processor into a single processor.",mn,Zt,Ts=`<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipProcessor">BlipProcessor</a> offers all the functionalities of <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a> and <a href="/docs/transformers/pr_33962/en/model_doc/bert#transformers.BertTokenizerFast">BertTokenizerFast</a>. See the | |
| docstring of <code>__call__()</code> and <a href="/docs/transformers/pr_33962/en/main_classes/processors#transformers.ProcessorMixin.decode">decode()</a> for more information.`,ko,Ye,Uo,H,Se,gn,Pt,ys="Constructs a BLIP image processor.",fn,_e,Ae,hn,Nt,Ms="Preprocess an image or batch of images.",Wo,De,Fo,G,Oe,un,Vt,vs="Constructs a fast Blip image processor.",_n,qt,Ke,Zo,et,Po,tt,ws="<code>BlipModel</code> is going to be deprecated in future versions, please use <code>BlipForConditionalGeneration</code>, <code>BlipForImageTextRetrieval</code> or <code>BlipForQuestionAnswering</code> depending on your usecase.",No,J,ot,bn,Rt,Bs="This model is going to be deprecated in future versions. Please use <code>BlipForConditionalGeneration</code>, <code>BlipForQuestionAnswering</code> or <code>BlipForImageTextRetrieval</code> depending on your usecase.",Tn,Ht,$s=`This model inherits from <a href="/docs/transformers/pr_33962/en/main_classes/model#transformers.PreTrainedModel">PreTrainedModel</a>. Check the superclass documentation for the generic methods the | |
| library implements for all its model (such as downloading or saving, resizing the input embeddings, pruning heads | |
| etc.)`,yn,Gt,xs=`This model is also a PyTorch <a href="https://pytorch.org/docs/stable/nn.html#torch.nn.Module" rel="nofollow">torch.nn.Module</a> subclass. | |
| Use it as a regular PyTorch Module and refer to the PyTorch documentation for all matter related to general usage | |
| and behavior.`,Mn,P,nt,vn,Et,Js='The <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipModel">BlipModel</a> forward method, overrides the <code>__call__</code> special method.',wn,be,Bn,Te,$n,ye,st,xn,Me,Jn,ve,rt,In,we,Vo,at,qo,E,it,jn,Lt,Is=`The model can behave as an encoder (with only self-attention) as well as a decoder, in which case a layer of | |
| cross-attention is added between the self-attention layers, following the architecture described in <a href="https://huggingface.co/papers/1706.03762" rel="nofollow">Attention is | |
| all you need</a> by Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, | |
| Llion Jones, Aidan N. Gomez, Lukasz Kaiser and Illia Polosukhin. argument and <code>is_decoder</code> set to <code>True</code>; an | |
| <code>encoder_hidden_states</code> is then expected as an input to the forward pass.`,Cn,D,lt,zn,Xt,js=`encoder_hidden_states (<code>torch.FloatTensor</code>, <em>optional</em>): | |
| Sequence of hidden-states at the output of the last layer of the encoder. Used in the cross-attention if | |
| the model is configured as a decoder. | |
| encoder_attention_mask (<code>torch.FloatTensor</code>, <em>optional</em>): | |
| Mask to avoid performing attention on the padding token indices of the encoder input. This mask is used in | |
| the cross-attention if the model is configured as a decoder. Mask values selected in <code>[0, 1]</code>:`,kn,Qt,Cs=`<li>1 for tokens that are <strong>not masked</strong>,</li> <li>0 for tokens that are <strong>masked</strong>. | |
| past_key_values (<code>Cache</code>, <em>optional</em>): | |
| Contains precomputed key and value hidden states of the attention blocks. Can be used to speed up decoding. | |
| If <code>past_key_values</code> are used, the user can optionally input only the last <code>decoder_input_ids</code> (those that | |
| don’t have their past key value states given to this model) of shape <code>(batch_size, 1)</code> instead of all | |
| <code>decoder_input_ids</code> of shape <code>(batch_size, sequence_length)</code>. | |
| use_cache (<code>bool</code>, <em>optional</em>): | |
| If set to <code>True</code>, <code>past_key_values</code> key value states are returned and can be used to speed up decoding (see | |
| <code>past_key_values</code>).</li>`,Ro,dt,Ho,ne,ct,Un,O,pt,Wn,Yt,zs=`encoder_hidden_states (<code>torch.FloatTensor</code>, <em>optional</em>): Sequence of | |
| hidden-states at the output of the last layer of the encoder. Used in the cross-attention if the model is | |
| configured as a decoder. | |
| encoder_attention_mask (<code>torch.FloatTensor</code>, <em>optional</em>): | |
| Mask to avoid performing attention on the padding token indices of the encoder input. This mask is used in | |
| the cross-attention if the model is configured as a decoder. Mask values selected in <code>[0, 1]</code>:`,Fn,St,ks=`<li>1 for tokens that are <strong>not masked</strong>,</li> <li>0 for tokens that are <strong>masked</strong>. | |
| labels (<code>torch.LongTensor</code>, <em>optional</em>): | |
| Labels for computing the left-to-right language modeling loss (next word prediction). Indices should be in | |
| <code>[-100, 0, ..., config.vocab_size]</code> (see <code>input_ids</code> docstring) Tokens with indices set to <code>-100</code> are | |
| ignored (masked), the loss is only computed for the tokens with labels n <code>[0, ..., config.vocab_size]</code> | |
| past_key_values (<code>Cache</code>, <em>optional</em>): | |
| Contains precomputed key and value hidden states of the attention blocks. Can be used to speed up decoding. | |
| If <code>past_key_values</code> are used, the user can optionally input only the last <code>decoder_input_ids</code> (those that | |
| don’t have their past key value states given to this model) of shape <code>(batch_size, 1)</code> instead of all | |
| <code>decoder_input_ids</code> of shape <code>(batch_size, sequence_length)</code>. | |
| use_cache (<code>bool</code>, <em>optional</em>): | |
| If set to <code>True</code>, <code>past_key_values</code> key value states are returned and can be used to speed up decoding (see | |
| <code>past_key_values</code>).</li>`,Go,mt,Eo,se,gt,Zn,K,ft,Pn,At,Us='The <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipVisionModel">BlipVisionModel</a> forward method, overrides the <code>__call__</code> special method.',Nn,Be,Lo,ht,Xo,C,ut,Vn,Dt,Ws=`BLIP Model for image captioning. The model consists of a vision encoder and a text decoder. One can optionally pass | |
| <code>input_ids</code> to the model, which serve as a text prompt, to make the text decoder continue the prompt. Otherwise, | |
| the decoder starts generating text from the [BOS] (beginning-of-sequence) token. will start generating the caption | |
| from the text input. If no text input is provided, the decoder will start with the [BOS] token only.`,qn,Ot,Fs=`This model inherits from <a href="/docs/transformers/pr_33962/en/main_classes/model#transformers.PreTrainedModel">PreTrainedModel</a>. Check the superclass documentation for the generic methods the | |
| library implements for all its model (such as downloading or saving, resizing the input embeddings, pruning heads | |
| etc.)`,Rn,Kt,Zs=`This model is also a PyTorch <a href="https://pytorch.org/docs/stable/nn.html#torch.nn.Module" rel="nofollow">torch.nn.Module</a> subclass. | |
| Use it as a regular PyTorch Module and refer to the PyTorch documentation for all matter related to general usage | |
| and behavior.`,Hn,N,_t,Gn,eo,Ps='The <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipForConditionalGeneration">BlipForConditionalGeneration</a> forward method, overrides the <code>__call__</code> special method.',En,$e,Ln,xe,Qo,bt,Yo,z,Tt,Xn,to,Ns=`BLIP Model with a vision and text projector, and a classification head on top. The model is used in the context of | |
| image-text retrieval. Given an image and a text, the model returns the probability of the text being relevant to | |
| the image.`,Qn,oo,Vs=`This model inherits from <a href="/docs/transformers/pr_33962/en/main_classes/model#transformers.PreTrainedModel">PreTrainedModel</a>. Check the superclass documentation for the generic methods the | |
| library implements for all its model (such as downloading or saving, resizing the input embeddings, pruning heads | |
| etc.)`,Yn,no,qs=`This model is also a PyTorch <a href="https://pytorch.org/docs/stable/nn.html#torch.nn.Module" rel="nofollow">torch.nn.Module</a> subclass. | |
| Use it as a regular PyTorch Module and refer to the PyTorch documentation for all matter related to general usage | |
| and behavior.`,Sn,V,yt,An,so,Rs='The <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipForImageTextRetrieval">BlipForImageTextRetrieval</a> forward method, overrides the <code>__call__</code> special method.',Dn,Je,On,Ie,So,Mt,Ao,k,vt,Kn,ro,Hs=`BLIP Model for visual question answering. The model consists of a vision encoder, a text encoder as well as a text | |
| decoder. The vision encoder will encode the input image, the text encoder will encode the input question together | |
| with the encoding of the image, and the text decoder will output the answer to the question.`,es,ao,Gs=`This model inherits from <a href="/docs/transformers/pr_33962/en/main_classes/model#transformers.PreTrainedModel">PreTrainedModel</a>. Check the superclass documentation for the generic methods the | |
| library implements for all its model (such as downloading or saving, resizing the input embeddings, pruning heads | |
| etc.)`,ts,io,Es=`This model is also a PyTorch <a href="https://pytorch.org/docs/stable/nn.html#torch.nn.Module" rel="nofollow">torch.nn.Module</a> subclass. | |
| Use it as a regular PyTorch Module and refer to the PyTorch documentation for all matter related to general usage | |
| and behavior.`,os,q,wt,ns,lo,Ls='The <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipForQuestionAnswering">BlipForQuestionAnswering</a> forward method, overrides the <code>__call__</code> special method.',ss,je,rs,Ce,Do,Bt,Oo,mo,Ko;return A=new Ks({props:{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"}}),We=new U({props:{title:"BLIP",local:"blip",headingTag:"h1"}}),ge=new tr({props:{id:"usage",options:["Pipeline","AutoModel"],$$slots:{default:[sr]},$$scope:{ctx:w}}}),Ne=new U({props:{title:"Resources",local:"resources",headingTag:"h2"}}),qe=new U({props:{title:"BlipConfig",local:"transformers.BlipConfig",headingTag:"h2"}}),Re=new x({props:{name:"class transformers.BlipConfig",anchor:"transformers.BlipConfig",parameters:[{name:"text_config",val:" = None"},{name:"vision_config",val:" = None"},{name:"projection_dim",val:" = 512"},{name:"logit_scale_init_value",val:" = 2.6592"},{name:"image_text_hidden_size",val:" = 256"},{name:"label_smoothing",val:" = 0.0"},{name:"**kwargs",val:""}],parametersDescription:[{anchor:"transformers.BlipConfig.text_config",description:`<strong>text_config</strong> (<code>dict</code>, <em>optional</em>) — | |
| Dictionary of configuration options used to initialize <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipTextConfig">BlipTextConfig</a>.`,name:"text_config"},{anchor:"transformers.BlipConfig.vision_config",description:`<strong>vision_config</strong> (<code>dict</code>, <em>optional</em>) — | |
| Dictionary of configuration options used to initialize <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipVisionConfig">BlipVisionConfig</a>.`,name:"vision_config"},{anchor:"transformers.BlipConfig.projection_dim",description:`<strong>projection_dim</strong> (<code>int</code>, <em>optional</em>, defaults to 512) — | |
| Dimensionality of text and vision projection layers.`,name:"projection_dim"},{anchor:"transformers.BlipConfig.logit_scale_init_value",description:`<strong>logit_scale_init_value</strong> (<code>float</code>, <em>optional</em>, defaults to 2.6592) — | |
| The initial value of the <em>logit_scale</em> parameter. Default is used as per the original BLIP implementation.`,name:"logit_scale_init_value"},{anchor:"transformers.BlipConfig.image_text_hidden_size",description:`<strong>image_text_hidden_size</strong> (<code>int</code>, <em>optional</em>, defaults to 256) — | |
| Dimensionality of the hidden state of the image-text fusion layer.`,name:"image_text_hidden_size"},{anchor:"transformers.BlipConfig.label_smoothing",description:`<strong>label_smoothing</strong> (float, optional, <em>optional</em>, defaults to 0.0) — | |
| A float in [0.0, 1.0]. Specifies the amount of smoothing when computing the loss, where 0.0 means no smoothing. The targets | |
| become a mixture of the original ground truth and a uniform distribution as described in | |
| <code>Rethinking the Inception Architecture for Computer Vision <https://huggingface.co/papers/1512.00567></code>__. Default: :math:<code>0.0</code>.`,name:"label_smoothing"},{anchor:"transformers.BlipConfig.kwargs",description:`<strong>kwargs</strong> (<em>optional</em>) — | |
| Dictionary of keyword arguments.`,name:"kwargs"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/configuration_blip.py#L230"}}),fe=new ce({props:{anchor:"transformers.BlipConfig.example",$$slots:{default:[rr]},$$scope:{ctx:w}}}),He=new U({props:{title:"BlipTextConfig",local:"transformers.BlipTextConfig",headingTag:"h2"}}),Ge=new x({props:{name:"class transformers.BlipTextConfig",anchor:"transformers.BlipTextConfig",parameters:[{name:"vocab_size",val:" = 30524"},{name:"hidden_size",val:" = 768"},{name:"encoder_hidden_size",val:" = 768"},{name:"intermediate_size",val:" = 3072"},{name:"projection_dim",val:" = 768"},{name:"num_hidden_layers",val:" = 12"},{name:"num_attention_heads",val:" = 8"},{name:"max_position_embeddings",val:" = 512"},{name:"hidden_act",val:" = 'gelu'"},{name:"layer_norm_eps",val:" = 1e-12"},{name:"hidden_dropout_prob",val:" = 0.0"},{name:"attention_probs_dropout_prob",val:" = 0.0"},{name:"initializer_range",val:" = 0.02"},{name:"bos_token_id",val:" = 30522"},{name:"eos_token_id",val:" = 2"},{name:"pad_token_id",val:" = 0"},{name:"sep_token_id",val:" = 102"},{name:"is_decoder",val:" = True"},{name:"use_cache",val:" = True"},{name:"label_smoothing",val:" = 0.0"},{name:"**kwargs",val:""}],parametersDescription:[{anchor:"transformers.BlipTextConfig.vocab_size",description:`<strong>vocab_size</strong> (<code>int</code>, <em>optional</em>, defaults to 30524) — | |
| Vocabulary size of the <code>Blip</code> text model. Defines the number of different tokens that can be represented by | |
| the <code>inputs_ids</code> passed when calling <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipModel">BlipModel</a>.`,name:"vocab_size"},{anchor:"transformers.BlipTextConfig.hidden_size",description:`<strong>hidden_size</strong> (<code>int</code>, <em>optional</em>, defaults to 768) — | |
| Dimensionality of the encoder layers and the pooler layer.`,name:"hidden_size"},{anchor:"transformers.BlipTextConfig.encoder_hidden_size",description:`<strong>encoder_hidden_size</strong> (<code>int</code>, <em>optional</em>, defaults to 768) — | |
| Dimensionality of the encoder layers from the vision model.`,name:"encoder_hidden_size"},{anchor:"transformers.BlipTextConfig.intermediate_size",description:`<strong>intermediate_size</strong> (<code>int</code>, <em>optional</em>, defaults to 3072) — | |
| Dimensionality of the “intermediate” (i.e., feed-forward) layer in the Transformer encoder.`,name:"intermediate_size"},{anchor:"transformers.BlipTextConfig.num_hidden_layers",description:`<strong>num_hidden_layers</strong> (<code>int</code>, <em>optional</em>, defaults to 12) — | |
| Number of hidden layers in the Transformer encoder.`,name:"num_hidden_layers"},{anchor:"transformers.BlipTextConfig.num_attention_heads",description:`<strong>num_attention_heads</strong> (<code>int</code>, <em>optional</em>, defaults to 8) — | |
| Number of attention heads for each attention layer in the Transformer encoder.`,name:"num_attention_heads"},{anchor:"transformers.BlipTextConfig.max_position_embeddings",description:`<strong>max_position_embeddings</strong> (<code>int</code>, <em>optional</em>, defaults to 512) — | |
| The maximum sequence length that this model might ever be used with. Typically set this to something large | |
| just in case (e.g., 512 or 1024 or 2048).`,name:"max_position_embeddings"},{anchor:"transformers.BlipTextConfig.hidden_act",description:`<strong>hidden_act</strong> (<code>str</code> or <code>function</code>, <em>optional</em>, defaults to <code>"gelu"</code>) — | |
| The non-linear activation function (function or string) in the encoder and pooler. If string, <code>"gelu"</code>, | |
| <code>"relu"</code>, <code>"selu"</code> and <code>"gelu_new"</code> <code>"gelu"</code> are supported.`,name:"hidden_act"},{anchor:"transformers.BlipTextConfig.layer_norm_eps",description:`<strong>layer_norm_eps</strong> (<code>float</code>, <em>optional</em>, defaults to 1e-12) — | |
| The epsilon used by the layer normalization layers.`,name:"layer_norm_eps"},{anchor:"transformers.BlipTextConfig.hidden_dropout_prob",description:`<strong>hidden_dropout_prob</strong> (<code>float</code>, <em>optional</em>, defaults to 0.0) — | |
| The dropout probability for all fully connected layers in the embeddings, encoder, and pooler.`,name:"hidden_dropout_prob"},{anchor:"transformers.BlipTextConfig.attention_dropout",description:`<strong>attention_dropout</strong> (<code>float</code>, <em>optional</em>, defaults to 0.0) — | |
| The dropout ratio for the attention probabilities.`,name:"attention_dropout"},{anchor:"transformers.BlipTextConfig.initializer_range",description:`<strong>initializer_range</strong> (<code>float</code>, <em>optional</em>, defaults to 0.02) — | |
| The standard deviation of the truncated_normal_initializer for initializing all weight matrices.`,name:"initializer_range"},{anchor:"transformers.BlipTextConfig.bos_token_id",description:`<strong>bos_token_id</strong> (<code>int</code>, <em>optional</em>, defaults to 30522) — | |
| The id of the <code>beginning-of-sequence</code> token.`,name:"bos_token_id"},{anchor:"transformers.BlipTextConfig.eos_token_id",description:`<strong>eos_token_id</strong> (<code>int</code>, <em>optional</em>, defaults to 2) — | |
| The id of the <code>end-of-sequence</code> token.`,name:"eos_token_id"},{anchor:"transformers.BlipTextConfig.pad_token_id",description:`<strong>pad_token_id</strong> (<code>int</code>, <em>optional</em>, defaults to 0) — | |
| The id of the <code>padding</code> token.`,name:"pad_token_id"},{anchor:"transformers.BlipTextConfig.sep_token_id",description:`<strong>sep_token_id</strong> (<code>int</code>, <em>optional</em>, defaults to 102) — | |
| The id of the <code>separator</code> token.`,name:"sep_token_id"},{anchor:"transformers.BlipTextConfig.is_decoder",description:`<strong>is_decoder</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) — | |
| Whether the model is used as a decoder.`,name:"is_decoder"},{anchor:"transformers.BlipTextConfig.use_cache",description:`<strong>use_cache</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) — | |
| Whether or not the model should return the last key/values attentions (not used by all models).`,name:"use_cache"},{anchor:"transformers.BlipTextConfig.label_smoothing",description:`<strong>label_smoothing</strong> (float, <em>optional</em>) — | |
| A float in [0.0, 1.0]. Specifies the amount of smoothing when computing the loss, where 0.0 means no smoothing. The targets | |
| become a mixture of the original ground truth and a uniform distribution as described in | |
| <code>Rethinking the Inception Architecture for Computer Vision <https://huggingface.co/papers/1512.00567></code>__. Default: :math:<code>0.0</code>.`,name:"label_smoothing"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/configuration_blip.py#L24"}}),he=new ce({props:{anchor:"transformers.BlipTextConfig.example",$$slots:{default:[ar]},$$scope:{ctx:w}}}),Ee=new U({props:{title:"BlipVisionConfig",local:"transformers.BlipVisionConfig",headingTag:"h2"}}),Le=new x({props:{name:"class transformers.BlipVisionConfig",anchor:"transformers.BlipVisionConfig",parameters:[{name:"hidden_size",val:" = 768"},{name:"intermediate_size",val:" = 3072"},{name:"projection_dim",val:" = 512"},{name:"num_hidden_layers",val:" = 12"},{name:"num_attention_heads",val:" = 12"},{name:"image_size",val:" = 384"},{name:"patch_size",val:" = 16"},{name:"hidden_act",val:" = 'gelu'"},{name:"layer_norm_eps",val:" = 1e-05"},{name:"attention_dropout",val:" = 0.0"},{name:"initializer_range",val:" = 1e-10"},{name:"**kwargs",val:""}],parametersDescription:[{anchor:"transformers.BlipVisionConfig.hidden_size",description:`<strong>hidden_size</strong> (<code>int</code>, <em>optional</em>, defaults to 768) — | |
| Dimensionality of the encoder layers and the pooler layer.`,name:"hidden_size"},{anchor:"transformers.BlipVisionConfig.intermediate_size",description:`<strong>intermediate_size</strong> (<code>int</code>, <em>optional</em>, defaults to 3072) — | |
| Dimensionality of the “intermediate” (i.e., feed-forward) layer in the Transformer encoder.`,name:"intermediate_size"},{anchor:"transformers.BlipVisionConfig.num_hidden_layers",description:`<strong>num_hidden_layers</strong> (<code>int</code>, <em>optional</em>, defaults to 12) — | |
| Number of hidden layers in the Transformer encoder.`,name:"num_hidden_layers"},{anchor:"transformers.BlipVisionConfig.num_attention_heads",description:`<strong>num_attention_heads</strong> (<code>int</code>, <em>optional</em>, defaults to 12) — | |
| Number of attention heads for each attention layer in the Transformer encoder.`,name:"num_attention_heads"},{anchor:"transformers.BlipVisionConfig.image_size",description:`<strong>image_size</strong> (<code>int</code>, <em>optional</em>, defaults to 384) — | |
| The size (resolution) of each image.`,name:"image_size"},{anchor:"transformers.BlipVisionConfig.patch_size",description:`<strong>patch_size</strong> (<code>int</code>, <em>optional</em>, defaults to 16) — | |
| The size (resolution) of each patch.`,name:"patch_size"},{anchor:"transformers.BlipVisionConfig.hidden_act",description:`<strong>hidden_act</strong> (<code>str</code> or <code>function</code>, <em>optional</em>, defaults to <code>"gelu"</code>) — | |
| The non-linear activation function (function or string) in the encoder and pooler. If string, <code>"gelu"</code>, | |
| <code>"relu"</code>, <code>"selu"</code> and <code>"gelu_new"</code> <code>"gelu"</code> are supported.`,name:"hidden_act"},{anchor:"transformers.BlipVisionConfig.layer_norm_eps",description:`<strong>layer_norm_eps</strong> (<code>float</code>, <em>optional</em>, defaults to 1e-5) — | |
| The epsilon used by the layer normalization layers.`,name:"layer_norm_eps"},{anchor:"transformers.BlipVisionConfig.attention_dropout",description:`<strong>attention_dropout</strong> (<code>float</code>, <em>optional</em>, defaults to 0.0) — | |
| The dropout ratio for the attention probabilities.`,name:"attention_dropout"},{anchor:"transformers.BlipVisionConfig.initializer_range",description:`<strong>initializer_range</strong> (<code>float</code>, <em>optional</em>, defaults to 1e-10) — | |
| The standard deviation of the truncated_normal_initializer for initializing all weight matrices.`,name:"initializer_range"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/configuration_blip.py#L148"}}),ue=new ce({props:{anchor:"transformers.BlipVisionConfig.example",$$slots:{default:[ir]},$$scope:{ctx:w}}}),Xe=new U({props:{title:"BlipProcessor",local:"transformers.BlipProcessor",headingTag:"h2"}}),Qe=new x({props:{name:"class transformers.BlipProcessor",anchor:"transformers.BlipProcessor",parameters:[{name:"image_processor",val:""},{name:"tokenizer",val:""},{name:"**kwargs",val:""}],parametersDescription:[{anchor:"transformers.BlipProcessor.image_processor",description:`<strong>image_processor</strong> (<code>BlipImageProcessor</code>) — | |
| An instance of <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a>. The image processor is a required input.`,name:"image_processor"},{anchor:"transformers.BlipProcessor.tokenizer",description:"<strong>tokenizer</strong> (<code>BertTokenizerFast</code>) —\nAn instance of [‘BertTokenizerFast`]. The tokenizer is a required input.",name:"tokenizer"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/processing_blip.py#L42"}}),Ye=new U({props:{title:"BlipImageProcessor",local:"transformers.BlipImageProcessor",headingTag:"h2"}}),Se=new x({props:{name:"class transformers.BlipImageProcessor",anchor:"transformers.BlipImageProcessor",parameters:[{name:"do_resize",val:": bool = True"},{name:"size",val:": typing.Optional[dict[str, int]] = None"},{name:"resample",val:": Resampling = <Resampling.BICUBIC: 3>"},{name:"do_rescale",val:": bool = True"},{name:"rescale_factor",val:": typing.Union[int, float] = 0.00392156862745098"},{name:"do_normalize",val:": bool = True"},{name:"image_mean",val:": typing.Union[float, list[float], NoneType] = None"},{name:"image_std",val:": typing.Union[float, list[float], NoneType] = None"},{name:"do_convert_rgb",val:": bool = True"},{name:"**kwargs",val:""}],parametersDescription:[{anchor:"transformers.BlipImageProcessor.do_resize",description:`<strong>do_resize</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) — | |
| Whether to resize the image’s (height, width) dimensions to the specified <code>size</code>. Can be overridden by the | |
| <code>do_resize</code> parameter in the <code>preprocess</code> method.`,name:"do_resize"},{anchor:"transformers.BlipImageProcessor.size",description:`<strong>size</strong> (<code>dict</code>, <em>optional</em>, defaults to <code>{"height" -- 384, "width": 384}</code>): | |
| Size of the output image after resizing. Can be overridden by the <code>size</code> parameter in the <code>preprocess</code> | |
| method.`,name:"size"},{anchor:"transformers.BlipImageProcessor.resample",description:`<strong>resample</strong> (<code>PILImageResampling</code>, <em>optional</em>, defaults to <code>Resampling.BICUBIC</code>) — | |
| Resampling filter to use if resizing the image. Only has an effect if <code>do_resize</code> is set to <code>True</code>. Can be | |
| overridden by the <code>resample</code> parameter in the <code>preprocess</code> method.`,name:"resample"},{anchor:"transformers.BlipImageProcessor.do_rescale",description:`<strong>do_rescale</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) — | |
| Whether to rescale the image by the specified scale <code>rescale_factor</code>. Can be overridden by the | |
| <code>do_rescale</code> parameter in the <code>preprocess</code> method.`,name:"do_rescale"},{anchor:"transformers.BlipImageProcessor.rescale_factor",description:`<strong>rescale_factor</strong> (<code>int</code> or <code>float</code>, <em>optional</em>, defaults to <code>1/255</code>) — | |
| Scale factor to use if rescaling the image. Only has an effect if <code>do_rescale</code> is set to <code>True</code>. Can be | |
| overridden by the <code>rescale_factor</code> parameter in the <code>preprocess</code> method.`,name:"rescale_factor"},{anchor:"transformers.BlipImageProcessor.do_normalize",description:`<strong>do_normalize</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) — | |
| Whether to normalize the image. Can be overridden by the <code>do_normalize</code> parameter in the <code>preprocess</code> | |
| method. Can be overridden by the <code>do_normalize</code> parameter in the <code>preprocess</code> method.`,name:"do_normalize"},{anchor:"transformers.BlipImageProcessor.image_mean",description:`<strong>image_mean</strong> (<code>float</code> or <code>list[float]</code>, <em>optional</em>, defaults to <code>IMAGENET_STANDARD_MEAN</code>) — | |
| Mean to use if normalizing the image. This is a float or list of floats the length of the number of | |
| channels in the image. Can be overridden by the <code>image_mean</code> parameter in the <code>preprocess</code> method. Can be | |
| overridden by the <code>image_mean</code> parameter in the <code>preprocess</code> method.`,name:"image_mean"},{anchor:"transformers.BlipImageProcessor.image_std",description:`<strong>image_std</strong> (<code>float</code> or <code>list[float]</code>, <em>optional</em>, defaults to <code>IMAGENET_STANDARD_STD</code>) — | |
| Standard deviation to use if normalizing the image. This is a float or list of floats the length of the | |
| number of channels in the image. Can be overridden by the <code>image_std</code> parameter in the <code>preprocess</code> method. | |
| Can be overridden by the <code>image_std</code> parameter in the <code>preprocess</code> method.`,name:"image_std"},{anchor:"transformers.BlipImageProcessor.do_convert_rgb",description:`<strong>do_convert_rgb</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) — | |
| Whether to convert the image to RGB.`,name:"do_convert_rgb"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/image_processing_blip.py#L46"}}),Ae=new x({props:{name:"preprocess",anchor:"transformers.BlipImageProcessor.preprocess",parameters:[{name:"images",val:": typing.Union[ForwardRef('PIL.Image.Image'), numpy.ndarray, ForwardRef('torch.Tensor'), list['PIL.Image.Image'], list[numpy.ndarray], list['torch.Tensor']]"},{name:"do_resize",val:": typing.Optional[bool] = None"},{name:"size",val:": typing.Optional[dict[str, int]] = None"},{name:"resample",val:": typing.Optional[PIL.Image.Resampling] = None"},{name:"do_rescale",val:": typing.Optional[bool] = None"},{name:"rescale_factor",val:": typing.Optional[float] = None"},{name:"do_normalize",val:": typing.Optional[bool] = None"},{name:"image_mean",val:": typing.Union[float, list[float], NoneType] = None"},{name:"image_std",val:": typing.Union[float, list[float], NoneType] = None"},{name:"return_tensors",val:": typing.Union[str, transformers.utils.generic.TensorType, NoneType] = None"},{name:"do_convert_rgb",val:": typing.Optional[bool] = None"},{name:"data_format",val:": ChannelDimension = <ChannelDimension.FIRST: 'channels_first'>"},{name:"input_data_format",val:": typing.Union[str, transformers.image_utils.ChannelDimension, NoneType] = None"}],parametersDescription:[{anchor:"transformers.BlipImageProcessor.preprocess.images",description:`<strong>images</strong> (<code>ImageInput</code>) — | |
| Image to preprocess. Expects a single or batch of images with pixel values ranging from 0 to 255. If | |
| passing in images with pixel values between 0 and 1, set <code>do_rescale=False</code>.`,name:"images"},{anchor:"transformers.BlipImageProcessor.preprocess.do_resize",description:`<strong>do_resize</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>self.do_resize</code>) — | |
| Whether to resize the image.`,name:"do_resize"},{anchor:"transformers.BlipImageProcessor.preprocess.size",description:`<strong>size</strong> (<code>dict[str, int]</code>, <em>optional</em>, defaults to <code>self.size</code>) — | |
| Controls the size of the image after <code>resize</code>. The shortest edge of the image is resized to | |
| <code>size["shortest_edge"]</code> whilst preserving the aspect ratio. If the longest edge of this resized image | |
| is > <code>int(size["shortest_edge"] * (1333 / 800))</code>, then the image is resized again to make the longest | |
| edge equal to <code>int(size["shortest_edge"] * (1333 / 800))</code>.`,name:"size"},{anchor:"transformers.BlipImageProcessor.preprocess.resample",description:`<strong>resample</strong> (<code>PILImageResampling</code>, <em>optional</em>, defaults to <code>self.resample</code>) — | |
| Resampling filter to use if resizing the image. Only has an effect if <code>do_resize</code> is set to <code>True</code>.`,name:"resample"},{anchor:"transformers.BlipImageProcessor.preprocess.do_rescale",description:`<strong>do_rescale</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>self.do_rescale</code>) — | |
| Whether to rescale the image values between [0 - 1].`,name:"do_rescale"},{anchor:"transformers.BlipImageProcessor.preprocess.rescale_factor",description:`<strong>rescale_factor</strong> (<code>float</code>, <em>optional</em>, defaults to <code>self.rescale_factor</code>) — | |
| Rescale factor to rescale the image by if <code>do_rescale</code> is set to <code>True</code>.`,name:"rescale_factor"},{anchor:"transformers.BlipImageProcessor.preprocess.do_normalize",description:`<strong>do_normalize</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>self.do_normalize</code>) — | |
| Whether to normalize the image.`,name:"do_normalize"},{anchor:"transformers.BlipImageProcessor.preprocess.image_mean",description:`<strong>image_mean</strong> (<code>float</code> or <code>list[float]</code>, <em>optional</em>, defaults to <code>self.image_mean</code>) — | |
| Image mean to normalize the image by if <code>do_normalize</code> is set to <code>True</code>.`,name:"image_mean"},{anchor:"transformers.BlipImageProcessor.preprocess.image_std",description:`<strong>image_std</strong> (<code>float</code> or <code>list[float]</code>, <em>optional</em>, defaults to <code>self.image_std</code>) — | |
| Image standard deviation to normalize the image by if <code>do_normalize</code> is set to <code>True</code>.`,name:"image_std"},{anchor:"transformers.BlipImageProcessor.preprocess.do_convert_rgb",description:`<strong>do_convert_rgb</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>self.do_convert_rgb</code>) — | |
| Whether to convert the image to RGB.`,name:"do_convert_rgb"},{anchor:"transformers.BlipImageProcessor.preprocess.return_tensors",description:`<strong>return_tensors</strong> (<code>str</code> or <code>TensorType</code>, <em>optional</em>) — | |
| The type of tensors to return. Can be one of: | |
| <ul> | |
| <li>Unset: Return a list of <code>np.ndarray</code>.</li> | |
| <li><code>TensorType.PYTORCH</code> or <code>'pt'</code>: Return a batch of type <code>torch.Tensor</code>.</li> | |
| <li><code>TensorType.NUMPY</code> or <code>'np'</code>: Return a batch of type <code>np.ndarray</code>.</li> | |
| </ul>`,name:"return_tensors"},{anchor:"transformers.BlipImageProcessor.preprocess.data_format",description:`<strong>data_format</strong> (<code>ChannelDimension</code> or <code>str</code>, <em>optional</em>, defaults to <code>ChannelDimension.FIRST</code>) — | |
| The channel dimension format for the output image. Can be one of: | |
| <ul> | |
| <li><code>"channels_first"</code> or <code>ChannelDimension.FIRST</code>: image in (num_channels, height, width) format.</li> | |
| <li><code>"channels_last"</code> or <code>ChannelDimension.LAST</code>: image in (height, width, num_channels) format.</li> | |
| <li>Unset: Use the channel dimension format of the input image.</li> | |
| </ul>`,name:"data_format"},{anchor:"transformers.BlipImageProcessor.preprocess.input_data_format",description:`<strong>input_data_format</strong> (<code>ChannelDimension</code> or <code>str</code>, <em>optional</em>) — | |
| The channel dimension format for the input image. If unset, the channel dimension format is inferred | |
| from the input image. Can be one of: | |
| <ul> | |
| <li><code>"channels_first"</code> or <code>ChannelDimension.FIRST</code>: image in (num_channels, height, width) format.</li> | |
| <li><code>"channels_last"</code> or <code>ChannelDimension.LAST</code>: image in (height, width, num_channels) format.</li> | |
| <li><code>"none"</code> or <code>ChannelDimension.NONE</code>: image in (height, width) format.</li> | |
| </ul>`,name:"input_data_format"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/image_processing_blip.py#L159"}}),De=new U({props:{title:"BlipImageProcessorFast",local:"transformers.BlipImageProcessorFast",headingTag:"h2"}}),Oe=new x({props:{name:"class transformers.BlipImageProcessorFast",anchor:"transformers.BlipImageProcessorFast",parameters:[{name:"**kwargs",val:": typing_extensions.Unpack[transformers.processing_utils.ImagesKwargs]"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/image_processing_blip_fast.py#L23"}}),Ke=new x({props:{name:"preprocess",anchor:"transformers.BlipImageProcessorFast.preprocess",parameters:[{name:"images",val:": typing.Union[ForwardRef('PIL.Image.Image'), numpy.ndarray, ForwardRef('torch.Tensor'), list['PIL.Image.Image'], list[numpy.ndarray], list['torch.Tensor']]"},{name:"*args",val:""},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.processing_utils.ImagesKwargs]"}],parametersDescription:[{anchor:"transformers.BlipImageProcessorFast.preprocess.images",description:`<strong>images</strong> (<code>Union[PIL.Image.Image, numpy.ndarray, torch.Tensor, list['PIL.Image.Image'], list[numpy.ndarray], list['torch.Tensor']]</code>) — | |
| Image to preprocess. Expects a single or batch of images with pixel values ranging from 0 to 255. If | |
| passing in images with pixel values between 0 and 1, set <code>do_rescale=False</code>.`,name:"images"},{anchor:"transformers.BlipImageProcessorFast.preprocess.do_convert_rgb",description:`<strong>do_convert_rgb</strong> (<code>bool</code>, <em>optional</em>) — | |
| Whether to convert the image to RGB.`,name:"do_convert_rgb"},{anchor:"transformers.BlipImageProcessorFast.preprocess.do_resize",description:`<strong>do_resize</strong> (<code>bool</code>, <em>optional</em>) — | |
| Whether to resize the image.`,name:"do_resize"},{anchor:"transformers.BlipImageProcessorFast.preprocess.size",description:`<strong>size</strong> (<code>Annotated[Union[int, list[int], tuple[int, ...], dict[str, int], NoneType], None]</code>) — | |
| Describes the maximum input dimensions to the model.`,name:"size"},{anchor:"transformers.BlipImageProcessorFast.preprocess.crop_size",description:`<strong>crop_size</strong> (<code>Annotated[Union[int, list[int], tuple[int, ...], dict[str, int], NoneType], None]</code>) — | |
| Size of the output image after applying <code>center_crop</code>.`,name:"crop_size"},{anchor:"transformers.BlipImageProcessorFast.preprocess.resample",description:`<strong>resample</strong> (<code>Annotated[Union[PILImageResampling, int, NoneType], None]</code>) — | |
| Resampling filter to use if resizing the image. This can be one of the enum <code>PILImageResampling</code>. Only | |
| has an effect if <code>do_resize</code> is set to <code>True</code>.`,name:"resample"},{anchor:"transformers.BlipImageProcessorFast.preprocess.do_rescale",description:`<strong>do_rescale</strong> (<code>bool</code>, <em>optional</em>) — | |
| Whether to rescale the image.`,name:"do_rescale"},{anchor:"transformers.BlipImageProcessorFast.preprocess.rescale_factor",description:`<strong>rescale_factor</strong> (<code>float</code>, <em>optional</em>) — | |
| Rescale factor to rescale the image by if <code>do_rescale</code> is set to <code>True</code>.`,name:"rescale_factor"},{anchor:"transformers.BlipImageProcessorFast.preprocess.do_normalize",description:`<strong>do_normalize</strong> (<code>bool</code>, <em>optional</em>) — | |
| Whether to normalize the image.`,name:"do_normalize"},{anchor:"transformers.BlipImageProcessorFast.preprocess.image_mean",description:`<strong>image_mean</strong> (<code>Union[float, list[float], tuple[float, ...], NoneType]</code>) — | |
| Image mean to use for normalization. Only has an effect if <code>do_normalize</code> is set to <code>True</code>.`,name:"image_mean"},{anchor:"transformers.BlipImageProcessorFast.preprocess.image_std",description:`<strong>image_std</strong> (<code>Union[float, list[float], tuple[float, ...], NoneType]</code>) — | |
| Image standard deviation to use for normalization. Only has an effect if <code>do_normalize</code> is set to | |
| <code>True</code>.`,name:"image_std"},{anchor:"transformers.BlipImageProcessorFast.preprocess.do_pad",description:`<strong>do_pad</strong> (<code>bool</code>, <em>optional</em>) — | |
| Whether to pad the image. Padding is done either to the largest size in the batch | |
| or to a fixed square size per image. The exact padding strategy depends on the model.`,name:"do_pad"},{anchor:"transformers.BlipImageProcessorFast.preprocess.pad_size",description:`<strong>pad_size</strong> (<code>Annotated[Union[int, list[int], tuple[int, ...], dict[str, int], NoneType], None]</code>) — | |
| The size in <code>{"height": int, "width" int}</code> to pad the images to. Must be larger than any image size | |
| provided for preprocessing. If <code>pad_size</code> is not provided, images will be padded to the largest | |
| height and width in the batch. Applied only when <code>do_pad=True.</code>`,name:"pad_size"},{anchor:"transformers.BlipImageProcessorFast.preprocess.do_center_crop",description:`<strong>do_center_crop</strong> (<code>bool</code>, <em>optional</em>) — | |
| Whether to center crop the image.`,name:"do_center_crop"},{anchor:"transformers.BlipImageProcessorFast.preprocess.data_format",description:`<strong>data_format</strong> (<code>Union[str, ~image_utils.ChannelDimension, NoneType]</code>) — | |
| Only <code>ChannelDimension.FIRST</code> is supported. Added for compatibility with slow processors.`,name:"data_format"},{anchor:"transformers.BlipImageProcessorFast.preprocess.input_data_format",description:`<strong>input_data_format</strong> (<code>Union[str, ~image_utils.ChannelDimension, NoneType]</code>) — | |
| The channel dimension format for the input image. If unset, the channel dimension format is inferred | |
| from the input image. Can be one of: | |
| <ul> | |
| <li><code>"channels_first"</code> or <code>ChannelDimension.FIRST</code>: image in (num_channels, height, width) format.</li> | |
| <li><code>"channels_last"</code> or <code>ChannelDimension.LAST</code>: image in (height, width, num_channels) format.</li> | |
| <li><code>"none"</code> or <code>ChannelDimension.NONE</code>: image in (height, width) format.</li> | |
| </ul>`,name:"input_data_format"},{anchor:"transformers.BlipImageProcessorFast.preprocess.device",description:`<strong>device</strong> (<code>Annotated[str, None]</code>, <em>optional</em>) — | |
| The device to process the images on. If unset, the device is inferred from the input images.`,name:"device"},{anchor:"transformers.BlipImageProcessorFast.preprocess.return_tensors",description:"<strong>return_tensors</strong> (<code>Annotated[Union[str, ~utils.generic.TensorType, NoneType], None]</code>) —\nReturns stacked tensors if set to `pt, otherwise returns a list of tensors.",name:"return_tensors"},{anchor:"transformers.BlipImageProcessorFast.preprocess.disable_grouping",description:`<strong>disable_grouping</strong> (<code>bool</code>, <em>optional</em>) — | |
| Whether to disable grouping of images by size to process them individually and not in batches. | |
| If None, will be set to True if the images are on CPU, and False otherwise. This choice is based on | |
| empirical observations, as detailed here: <a href="https://github.com/huggingface/transformers/pull/38157" rel="nofollow">https://github.com/huggingface/transformers/pull/38157</a>`,name:"disable_grouping"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/image_processing_utils_fast.py#L710",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <ul> | |
| <li><strong>data</strong> (<code>dict</code>) — Dictionary of lists/arrays/tensors returned by the <strong>call</strong> method (‘pixel_values’, etc.).</li> | |
| <li><strong>tensor_type</strong> (<code>Union[None, str, TensorType]</code>, <em>optional</em>) — You can give a tensor_type here to convert the lists of integers in PyTorch/Numpy Tensors at | |
| initialization.</li> | |
| </ul> | |
| `,returnType:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p><code><class 'transformers.image_processing_base.BatchFeature'></code></p> | |
| `}}),et=new U({props:{title:"BlipModel",local:"transformers.BlipModel",headingTag:"h2"}}),ot=new x({props:{name:"class transformers.BlipModel",anchor:"transformers.BlipModel",parameters:[{name:"config",val:": BlipConfig"}],parametersDescription:[{anchor:"transformers.BlipModel.config",description:`<strong>config</strong> (<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipConfig">BlipConfig</a>) — | |
| Model configuration class with all the parameters of the model. Initializing with a config file does not | |
| load the weights associated with the model, only the configuration. Check out the | |
| <a href="/docs/transformers/pr_33962/en/main_classes/model#transformers.PreTrainedModel.from_pretrained">from_pretrained()</a> method to load the model weights.`,name:"config"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L540"}}),nt=new x({props:{name:"forward",anchor:"transformers.BlipModel.forward",parameters:[{name:"input_ids",val:": typing.Optional[torch.LongTensor] = None"},{name:"pixel_values",val:": typing.Optional[torch.FloatTensor] = None"},{name:"attention_mask",val:": typing.Optional[torch.Tensor] = None"},{name:"position_ids",val:": typing.Optional[torch.LongTensor] = None"},{name:"return_loss",val:": typing.Optional[bool] = None"},{name:"interpolate_pos_encoding",val:": bool = False"},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs]"}],parametersDescription:[{anchor:"transformers.BlipModel.forward.input_ids",description:`<strong>input_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Indices of input sequence tokens in the vocabulary. Padding will be ignored by default.</p> | |
| <p>Indices can be obtained using <a href="/docs/transformers/pr_33962/en/model_doc/auto#transformers.AutoTokenizer">AutoTokenizer</a>. See <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.encode">PreTrainedTokenizer.encode()</a> and | |
| <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.__call__">PreTrainedTokenizer.<strong>call</strong>()</a> for details.</p> | |
| <p><a href="../glossary#input-ids">What are input IDs?</a>`,name:"input_ids"},{anchor:"transformers.BlipModel.forward.pixel_values",description:`<strong>pixel_values</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_channels, image_size, image_size)</code>, <em>optional</em>) — | |
| The tensors corresponding to the input images. Pixel values can be obtained using | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a>. See <a href="/docs/transformers/pr_33962/en/model_doc/fuyu#transformers.FuyuImageProcessor.__call__">BlipImageProcessor.<strong>call</strong>()</a> for details (<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipProcessor">BlipProcessor</a> uses | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a> for processing images).`,name:"pixel_values"},{anchor:"transformers.BlipModel.forward.attention_mask",description:`<strong>attention_mask</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Mask to avoid performing attention on padding token indices. Mask values selected in <code>[0, 1]</code>:</p> | |
| <ul> | |
| <li>1 for tokens that are <strong>not masked</strong>,</li> | |
| <li>0 for tokens that are <strong>masked</strong>.</li> | |
| </ul> | |
| <p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"attention_mask"},{anchor:"transformers.BlipModel.forward.position_ids",description:`<strong>position_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Indices of positions of each input sequence tokens in the position embeddings. Selected in the range <code>[0, config.n_positions - 1]</code>.</p> | |
| <p><a href="../glossary#position-ids">What are position IDs?</a>`,name:"position_ids"},{anchor:"transformers.BlipModel.forward.return_loss",description:`<strong>return_loss</strong> (<code>bool</code>, <em>optional</em>) — | |
| Whether or not to return the contrastive loss.`,name:"return_loss"},{anchor:"transformers.BlipModel.forward.interpolate_pos_encoding",description:`<strong>interpolate_pos_encoding</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to interpolate the pre-trained position encodings.`,name:"interpolate_pos_encoding"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L707",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>A <code>transformers.models.blip.modeling_blip.BlipOutput</code> or a tuple of | |
| <code>torch.FloatTensor</code> (if <code>return_dict=False</code> is passed or when <code>config.return_dict=False</code>) comprising various | |
| elements depending on the configuration (<a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipConfig" | |
| >BlipConfig</a>) and inputs.</p> | |
| <ul> | |
| <li><strong>loss</strong> (<code>torch.FloatTensor</code> of shape <code>(1,)</code>, <em>optional</em>, returned when <code>return_loss</code> is <code>True</code>) — Contrastive loss for image-text similarity.</li> | |
| <li><strong>logits_per_image</strong> (<code>torch.FloatTensor</code> of shape <code>(image_batch_size, text_batch_size)</code>) — The scaled dot product scores between <code>image_embeds</code> and <code>text_embeds</code>. This represents the image-text | |
| similarity scores.</li> | |
| <li><strong>logits_per_text</strong> (<code>torch.FloatTensor</code> of shape <code>(text_batch_size, image_batch_size)</code>) — The scaled dot product scores between <code>text_embeds</code> and <code>image_embeds</code>. This represents the text-image | |
| similarity scores.</li> | |
| <li><strong>text_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, output_dim</code>) — The text embeddings obtained by applying the projection layer to the pooled output of <a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipTextModel" | |
| >BlipTextModel</a>.</li> | |
| <li><strong>image_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, output_dim</code>) — The image embeddings obtained by applying the projection layer to the pooled output of <a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipVisionModel" | |
| >BlipVisionModel</a>.</li> | |
| <li><strong>text_model_output</strong> (<code><class '~modeling_outputs.BaseModelOutputWithPooling'>.text_model_output</code>, defaults to <code>None</code>) — The output of the <a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipTextModel" | |
| >BlipTextModel</a>.</li> | |
| <li><strong>vision_model_output</strong> (<code><class '~modeling_outputs.BaseModelOutputWithPooling'>.vision_model_output</code>, defaults to <code>None</code>) — The output of the <a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipVisionModel" | |
| >BlipVisionModel</a>.</li> | |
| </ul> | |
| `,returnType:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p><code>transformers.models.blip.modeling_blip.BlipOutput</code> or <code>tuple(torch.FloatTensor)</code></p> | |
| `}}),be=new fo({props:{$$slots:{default:[lr]},$$scope:{ctx:w}}}),Te=new ce({props:{anchor:"transformers.BlipModel.forward.example",$$slots:{default:[dr]},$$scope:{ctx:w}}}),st=new x({props:{name:"get_text_features",anchor:"transformers.BlipModel.get_text_features",parameters:[{name:"input_ids",val:": typing.Optional[torch.Tensor] = None"},{name:"attention_mask",val:": typing.Optional[torch.Tensor] = None"},{name:"position_ids",val:": typing.Optional[torch.Tensor] = None"}],parametersDescription:[{anchor:"transformers.BlipModel.get_text_features.input_ids",description:`<strong>input_ids</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Indices of input sequence tokens in the vocabulary. Padding will be ignored by default.</p> | |
| <p>Indices can be obtained using <a href="/docs/transformers/pr_33962/en/model_doc/auto#transformers.AutoTokenizer">AutoTokenizer</a>. See <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.encode">PreTrainedTokenizer.encode()</a> and | |
| <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.__call__">PreTrainedTokenizer.<strong>call</strong>()</a> for details.</p> | |
| <p><a href="../glossary#input-ids">What are input IDs?</a>`,name:"input_ids"},{anchor:"transformers.BlipModel.get_text_features.attention_mask",description:`<strong>attention_mask</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Mask to avoid performing attention on padding token indices. Mask values selected in <code>[0, 1]</code>:</p> | |
| <ul> | |
| <li>1 for tokens that are <strong>not masked</strong>,</li> | |
| <li>0 for tokens that are <strong>masked</strong>.</li> | |
| </ul> | |
| <p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"attention_mask"},{anchor:"transformers.BlipModel.get_text_features.position_ids",description:`<strong>position_ids</strong> (<code>torch.Tensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Indices of positions of each input sequence tokens in the position embeddings. Selected in the range <code>[0, config.n_positions - 1]</code>.</p> | |
| <p><a href="../glossary#position-ids">What are position IDs?</a>`,name:"position_ids"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L585",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>The text embeddings obtained by | |
| applying the projection layer to the pooled output of <a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipTextModel" | |
| >BlipTextModel</a>.</p> | |
| `,returnType:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>text_features (<code>torch.FloatTensor</code> of shape <code>(batch_size, output_dim</code>)</p> | |
| `}}),Me=new ce({props:{anchor:"transformers.BlipModel.get_text_features.example",$$slots:{default:[cr]},$$scope:{ctx:w}}}),rt=new x({props:{name:"get_image_features",anchor:"transformers.BlipModel.get_image_features",parameters:[{name:"pixel_values",val:": typing.Optional[torch.FloatTensor] = None"},{name:"interpolate_pos_encoding",val:": bool = False"}],parametersDescription:[{anchor:"transformers.BlipModel.get_image_features.pixel_values",description:`<strong>pixel_values</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_channels, image_size, image_size)</code>, <em>optional</em>) — | |
| The tensors corresponding to the input images. Pixel values can be obtained using | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a>. See <a href="/docs/transformers/pr_33962/en/model_doc/fuyu#transformers.FuyuImageProcessor.__call__">BlipImageProcessor.<strong>call</strong>()</a> for details (<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipProcessor">BlipProcessor</a> uses | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a> for processing images).`,name:"pixel_values"},{anchor:"transformers.BlipModel.get_image_features.interpolate_pos_encoding",description:`<strong>interpolate_pos_encoding</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to interpolate the pre-trained position encodings.`,name:"interpolate_pos_encoding"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L619",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>The image embeddings obtained by | |
| applying the projection layer to the pooled output of <a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipVisionModel" | |
| >BlipVisionModel</a>.</p> | |
| `,returnType:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>image_features (<code>torch.FloatTensor</code> of shape <code>(batch_size, output_dim</code>)</p> | |
| `}}),we=new ce({props:{anchor:"transformers.BlipModel.get_image_features.example",$$slots:{default:[pr]},$$scope:{ctx:w}}}),at=new U({props:{title:"BlipTextModel",local:"transformers.BlipTextModel",headingTag:"h2"}}),it=new x({props:{name:"class transformers.BlipTextModel",anchor:"transformers.BlipTextModel",parameters:[{name:"config",val:""},{name:"add_pooling_layer",val:" = True"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip_text.py#L526"}}),lt=new x({props:{name:"forward",anchor:"transformers.BlipTextModel.forward",parameters:[{name:"input_ids",val:": typing.Optional[torch.Tensor] = None"},{name:"attention_mask",val:": typing.Optional[torch.Tensor] = None"},{name:"position_ids",val:": typing.Optional[torch.Tensor] = None"},{name:"inputs_embeds",val:": typing.Optional[torch.Tensor] = None"},{name:"encoder_embeds",val:": typing.Optional[torch.Tensor] = None"},{name:"encoder_hidden_states",val:": typing.Optional[torch.Tensor] = None"},{name:"encoder_attention_mask",val:": typing.Optional[torch.Tensor] = None"},{name:"past_key_values",val:": typing.Optional[transformers.cache_utils.Cache] = None"},{name:"use_cache",val:": typing.Optional[bool] = None"},{name:"output_attentions",val:": typing.Optional[bool] = None"},{name:"output_hidden_states",val:": typing.Optional[bool] = None"},{name:"return_dict",val:": typing.Optional[bool] = None"},{name:"is_decoder",val:": typing.Optional[bool] = False"},{name:"cache_position",val:": typing.Optional[torch.Tensor] = None"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip_text.py#L613"}}),dt=new U({props:{title:"BlipTextLMHeadModel",local:"transformers.BlipTextLMHeadModel",headingTag:"h2"}}),ct=new x({props:{name:"class transformers.BlipTextLMHeadModel",anchor:"transformers.BlipTextLMHeadModel",parameters:[{name:"config",val:""}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip_text.py#L746"}}),pt=new x({props:{name:"forward",anchor:"transformers.BlipTextLMHeadModel.forward",parameters:[{name:"input_ids",val:": typing.Optional[torch.Tensor] = None"},{name:"attention_mask",val:": typing.Optional[torch.Tensor] = None"},{name:"position_ids",val:": typing.Optional[torch.Tensor] = None"},{name:"inputs_embeds",val:": typing.Optional[torch.Tensor] = None"},{name:"encoder_hidden_states",val:": typing.Optional[torch.Tensor] = None"},{name:"encoder_attention_mask",val:": typing.Optional[torch.Tensor] = None"},{name:"labels",val:": typing.Optional[torch.Tensor] = None"},{name:"past_key_values",val:": typing.Optional[transformers.cache_utils.Cache] = None"},{name:"use_cache",val:": typing.Optional[bool] = None"},{name:"output_attentions",val:": typing.Optional[bool] = None"},{name:"output_hidden_states",val:": typing.Optional[bool] = None"},{name:"return_dict",val:": typing.Optional[bool] = None"},{name:"return_logits",val:": typing.Optional[bool] = False"},{name:"is_decoder",val:": typing.Optional[bool] = True"},{name:"reduction",val:": typing.Optional[str] = 'mean'"},{name:"cache_position",val:": typing.Optional[torch.Tensor] = None"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip_text.py#L769"}}),mt=new U({props:{title:"BlipVisionModel",local:"transformers.BlipVisionModel",headingTag:"h2"}}),gt=new x({props:{name:"class transformers.BlipVisionModel",anchor:"transformers.BlipVisionModel",parameters:[{name:"config",val:": BlipVisionConfig"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L483"}}),ft=new x({props:{name:"forward",anchor:"transformers.BlipVisionModel.forward",parameters:[{name:"pixel_values",val:": typing.Optional[torch.FloatTensor] = None"},{name:"interpolate_pos_encoding",val:": bool = False"},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs]"}],parametersDescription:[{anchor:"transformers.BlipVisionModel.forward.pixel_values",description:`<strong>pixel_values</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_channels, image_size, image_size)</code>, <em>optional</em>) — | |
| The tensors corresponding to the input images. Pixel values can be obtained using | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a>. See <a href="/docs/transformers/pr_33962/en/model_doc/fuyu#transformers.FuyuImageProcessor.__call__">BlipImageProcessor.<strong>call</strong>()</a> for details (<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipProcessor">BlipProcessor</a> uses | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a> for processing images).`,name:"pixel_values"},{anchor:"transformers.BlipVisionModel.forward.interpolate_pos_encoding",description:`<strong>interpolate_pos_encoding</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to interpolate the pre-trained position encodings.`,name:"interpolate_pos_encoding"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L502",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>A <a | |
| href="/docs/transformers/pr_33962/en/main_classes/output#transformers.modeling_outputs.BaseModelOutputWithPooling" | |
| >transformers.modeling_outputs.BaseModelOutputWithPooling</a> or a tuple of | |
| <code>torch.FloatTensor</code> (if <code>return_dict=False</code> is passed or when <code>config.return_dict=False</code>) comprising various | |
| elements depending on the configuration (<a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipConfig" | |
| >BlipConfig</a>) and inputs.</p> | |
| <ul> | |
| <li> | |
| <p><strong>last_hidden_state</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, hidden_size)</code>) — Sequence of hidden-states at the output of the last layer of the model.</p> | |
| </li> | |
| <li> | |
| <p><strong>pooler_output</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, hidden_size)</code>) — Last layer hidden-state of the first token of the sequence (classification token) after further processing | |
| through the layers used for the auxiliary pretraining task. E.g. for BERT-family of models, this returns | |
| the classification token after processing through a linear layer and a tanh activation function. The linear | |
| layer weights are trained from the next sentence prediction (classification) objective during pretraining.</p> | |
| </li> | |
| <li> | |
| <p><strong>hidden_states</strong> (<code>tuple(torch.FloatTensor)</code>, <em>optional</em>, returned when <code>output_hidden_states=True</code> is passed or when <code>config.output_hidden_states=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for the output of the embeddings, if the model has an embedding layer, + | |
| one for the output of each layer) of shape <code>(batch_size, sequence_length, hidden_size)</code>.</p> | |
| <p>Hidden-states of the model at the output of each layer plus the optional initial embedding outputs.</p> | |
| </li> | |
| <li> | |
| <p><strong>attentions</strong> (<code>tuple(torch.FloatTensor)</code>, <em>optional</em>, returned when <code>output_attentions=True</code> is passed or when <code>config.output_attentions=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for each layer) of shape <code>(batch_size, num_heads, sequence_length, sequence_length)</code>.</p> | |
| <p>Attentions weights after the attention softmax, used to compute the weighted average in the self-attention | |
| heads.</p> | |
| </li> | |
| </ul> | |
| `,returnType:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p><a | |
| href="/docs/transformers/pr_33962/en/main_classes/output#transformers.modeling_outputs.BaseModelOutputWithPooling" | |
| >transformers.modeling_outputs.BaseModelOutputWithPooling</a> or <code>tuple(torch.FloatTensor)</code></p> | |
| `}}),Be=new fo({props:{$$slots:{default:[mr]},$$scope:{ctx:w}}}),ht=new U({props:{title:"BlipForConditionalGeneration",local:"transformers.BlipForConditionalGeneration",headingTag:"h2"}}),ut=new x({props:{name:"class transformers.BlipForConditionalGeneration",anchor:"transformers.BlipForConditionalGeneration",parameters:[{name:"config",val:": BlipConfig"}],parametersDescription:[{anchor:"transformers.BlipForConditionalGeneration.config",description:`<strong>config</strong> (<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipConfig">BlipConfig</a>) — | |
| Model configuration class with all the parameters of the model. Initializing with a config file does not | |
| load the weights associated with the model, only the configuration. Check out the | |
| <a href="/docs/transformers/pr_33962/en/main_classes/model#transformers.PreTrainedModel.from_pretrained">from_pretrained()</a> method to load the model weights.`,name:"config"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L796"}}),_t=new x({props:{name:"forward",anchor:"transformers.BlipForConditionalGeneration.forward",parameters:[{name:"pixel_values",val:": FloatTensor"},{name:"input_ids",val:": typing.Optional[torch.LongTensor] = None"},{name:"attention_mask",val:": typing.Optional[torch.LongTensor] = None"},{name:"labels",val:": typing.Optional[torch.LongTensor] = None"},{name:"interpolate_pos_encoding",val:": bool = False"},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs]"}],parametersDescription:[{anchor:"transformers.BlipForConditionalGeneration.forward.pixel_values",description:`<strong>pixel_values</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_channels, image_size, image_size)</code>) — | |
| The tensors corresponding to the input images. Pixel values can be obtained using | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a>. See <a href="/docs/transformers/pr_33962/en/model_doc/fuyu#transformers.FuyuImageProcessor.__call__">BlipImageProcessor.<strong>call</strong>()</a> for details (<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipProcessor">BlipProcessor</a> uses | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a> for processing images).`,name:"pixel_values"},{anchor:"transformers.BlipForConditionalGeneration.forward.input_ids",description:`<strong>input_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Indices of input sequence tokens in the vocabulary. Padding will be ignored by default.</p> | |
| <p>Indices can be obtained using <a href="/docs/transformers/pr_33962/en/model_doc/auto#transformers.AutoTokenizer">AutoTokenizer</a>. See <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.encode">PreTrainedTokenizer.encode()</a> and | |
| <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.__call__">PreTrainedTokenizer.<strong>call</strong>()</a> for details.</p> | |
| <p><a href="../glossary#input-ids">What are input IDs?</a>`,name:"input_ids"},{anchor:"transformers.BlipForConditionalGeneration.forward.attention_mask",description:`<strong>attention_mask</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Mask to avoid performing attention on padding token indices. Mask values selected in <code>[0, 1]</code>:</p> | |
| <ul> | |
| <li>1 for tokens that are <strong>not masked</strong>,</li> | |
| <li>0 for tokens that are <strong>masked</strong>.</li> | |
| </ul> | |
| <p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"attention_mask"},{anchor:"transformers.BlipForConditionalGeneration.forward.labels",description:`<strong>labels</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Labels for computing the masked language modeling loss. Indices should either be in <code>[0, ..., config.vocab_size]</code> or -100 (see <code>input_ids</code> docstring). Tokens with indices set to <code>-100</code> are ignored | |
| (masked), the loss is only computed for the tokens with labels in <code>[0, ..., config.vocab_size]</code>.`,name:"labels"},{anchor:"transformers.BlipForConditionalGeneration.forward.interpolate_pos_encoding",description:`<strong>interpolate_pos_encoding</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to interpolate the pre-trained position encodings.`,name:"interpolate_pos_encoding"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L820",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>A <code>transformers.models.blip.modeling_blip.BlipForConditionalGenerationModelOutput</code> or a tuple of | |
| <code>torch.FloatTensor</code> (if <code>return_dict=False</code> is passed or when <code>config.return_dict=False</code>) comprising various | |
| elements depending on the configuration (<a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipConfig" | |
| >BlipConfig</a>) and inputs.</p> | |
| <ul> | |
| <li> | |
| <p><strong>loss</strong> (<code>torch.FloatTensor</code>, <em>optional</em>, returned when <code>labels</code> is provided, <code>torch.FloatTensor</code> of shape <code>(1,)</code>) — Language modeling loss from the text decoder.</p> | |
| </li> | |
| <li> | |
| <p><strong>logits</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, config.vocab_size)</code>, <em>optional</em>) — Prediction scores of the language modeling head of the text decoder model.</p> | |
| </li> | |
| <li> | |
| <p><strong>image_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, output_dim)</code>, <em>optional</em>) — The image embeddings obtained after applying the Vision Transformer model to the input image.</p> | |
| </li> | |
| <li> | |
| <p><strong>last_hidden_state</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, hidden_size)</code>, <em>optional</em>, defaults to <code>None</code>) — Sequence of hidden-states at the output of the last layer of the model.</p> | |
| </li> | |
| <li> | |
| <p><strong>hidden_states</strong> (<code>tuple(torch.FloatTensor)</code>, <em>optional</em>, returned when <code>output_hidden_states=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for the output of the embeddings, if the model has an embedding layer, + | |
| one for the output of each layer) of shape <code>(batch_size, sequence_length, hidden_size)</code>.</p> | |
| <p>Hidden-states of the model at the output of each layer plus the optional initial embedding outputs.</p> | |
| </li> | |
| <li> | |
| <p><strong>attentions</strong> (<code>tuple(torch.FloatTensor)</code>, <em>optional</em>, returned when <code>output_attentions=True</code> is passed) — Tuple of <code>torch.FloatTensor</code> (one for each layer) of shape <code>(batch_size, num_heads, sequence_length, sequence_length)</code>.</p> | |
| <p>Attentions weights after the attention softmax, used to compute the weighted average in the self-attention | |
| heads.</p> | |
| </li> | |
| </ul> | |
| `,returnType:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p><code>transformers.models.blip.modeling_blip.BlipForConditionalGenerationModelOutput</code> or <code>tuple(torch.FloatTensor)</code></p> | |
| `}}),$e=new fo({props:{$$slots:{default:[gr]},$$scope:{ctx:w}}}),xe=new ce({props:{anchor:"transformers.BlipForConditionalGeneration.forward.example",$$slots:{default:[fr]},$$scope:{ctx:w}}}),bt=new U({props:{title:"BlipForImageTextRetrieval",local:"transformers.BlipForImageTextRetrieval",headingTag:"h2"}}),Tt=new x({props:{name:"class transformers.BlipForImageTextRetrieval",anchor:"transformers.BlipForImageTextRetrieval",parameters:[{name:"config",val:": BlipConfig"}],parametersDescription:[{anchor:"transformers.BlipForImageTextRetrieval.config",description:`<strong>config</strong> (<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipConfig">BlipConfig</a>) — | |
| Model configuration class with all the parameters of the model. Initializing with a config file does not | |
| load the weights associated with the model, only the configuration. Check out the | |
| <a href="/docs/transformers/pr_33962/en/main_classes/model#transformers.PreTrainedModel.from_pretrained">from_pretrained()</a> method to load the model weights.`,name:"config"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L1177"}}),yt=new x({props:{name:"forward",anchor:"transformers.BlipForImageTextRetrieval.forward",parameters:[{name:"input_ids",val:": LongTensor"},{name:"pixel_values",val:": FloatTensor"},{name:"use_itm_head",val:": typing.Optional[bool] = True"},{name:"attention_mask",val:": typing.Optional[torch.LongTensor] = None"},{name:"interpolate_pos_encoding",val:": bool = False"},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs]"}],parametersDescription:[{anchor:"transformers.BlipForImageTextRetrieval.forward.input_ids",description:`<strong>input_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>) — | |
| Indices of input sequence tokens in the vocabulary. Padding will be ignored by default.</p> | |
| <p>Indices can be obtained using <a href="/docs/transformers/pr_33962/en/model_doc/auto#transformers.AutoTokenizer">AutoTokenizer</a>. See <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.encode">PreTrainedTokenizer.encode()</a> and | |
| <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.__call__">PreTrainedTokenizer.<strong>call</strong>()</a> for details.</p> | |
| <p><a href="../glossary#input-ids">What are input IDs?</a>`,name:"input_ids"},{anchor:"transformers.BlipForImageTextRetrieval.forward.pixel_values",description:`<strong>pixel_values</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_channels, image_size, image_size)</code>) — | |
| The tensors corresponding to the input images. Pixel values can be obtained using | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a>. See <a href="/docs/transformers/pr_33962/en/model_doc/fuyu#transformers.FuyuImageProcessor.__call__">BlipImageProcessor.<strong>call</strong>()</a> for details (<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipProcessor">BlipProcessor</a> uses | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a> for processing images).`,name:"pixel_values"},{anchor:"transformers.BlipForImageTextRetrieval.forward.use_itm_head",description:`<strong>use_itm_head</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) — | |
| Whether or not to use the image-text matching head.`,name:"use_itm_head"},{anchor:"transformers.BlipForImageTextRetrieval.forward.attention_mask",description:`<strong>attention_mask</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Mask to avoid performing attention on padding token indices. Mask values selected in <code>[0, 1]</code>:</p> | |
| <ul> | |
| <li>1 for tokens that are <strong>not masked</strong>,</li> | |
| <li>0 for tokens that are <strong>masked</strong>.</li> | |
| </ul> | |
| <p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"attention_mask"},{anchor:"transformers.BlipForImageTextRetrieval.forward.interpolate_pos_encoding",description:`<strong>interpolate_pos_encoding</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to interpolate the pre-trained position encodings.`,name:"interpolate_pos_encoding"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L1216",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>A <code>transformers.models.blip.modeling_blip.BlipTextVisionModelOutput</code> or a tuple of | |
| <code>torch.FloatTensor</code> (if <code>return_dict=False</code> is passed or when <code>config.return_dict=False</code>) comprising various | |
| elements depending on the configuration (<a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipConfig" | |
| >BlipConfig</a>) and inputs.</p> | |
| <ul> | |
| <li> | |
| <p><strong>loss</strong> (<code>torch.FloatTensor</code> of shape <code>(1,)</code>, <em>optional</em>, returned when <code>labels</code> is provided) — Language modeling loss from the text decoder.</p> | |
| </li> | |
| <li> | |
| <p><strong>image_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, output_dim)</code> <em>optional</em> returned when model is initialized with <code>with_projection=True</code>) — The image embeddings obtained by applying the projection layer to the pooler_output.</p> | |
| </li> | |
| <li> | |
| <p><strong>last_hidden_state</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, hidden_size)</code>, <em>optional</em>, defaults to <code>None</code>) — Sequence of hidden-states at the output of the last layer of the model.</p> | |
| </li> | |
| <li> | |
| <p><strong>hidden_states</strong> (<code>tuple[torch.FloatTensor, ...]</code>, <em>optional</em>, returned when <code>output_hidden_states=True</code> is passed or when <code>config.output_hidden_states=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for the output of the embeddings, if the model has an embedding layer, + | |
| one for the output of each layer) of shape <code>(batch_size, sequence_length, hidden_size)</code>.</p> | |
| <p>Hidden-states of the model at the output of each layer plus the optional initial embedding outputs.</p> | |
| </li> | |
| <li> | |
| <p><strong>attentions</strong> (<code>tuple[torch.FloatTensor, ...]</code>, <em>optional</em>, returned when <code>output_attentions=True</code> is passed or when <code>config.output_attentions=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for each layer) of shape <code>(batch_size, num_heads, sequence_length, sequence_length)</code>.</p> | |
| <p>Attentions weights after the attention softmax, used to compute the weighted average in the self-attention | |
| heads.</p> | |
| </li> | |
| </ul> | |
| `,returnType:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p><code>transformers.models.blip.modeling_blip.BlipTextVisionModelOutput</code> or <code>tuple(torch.FloatTensor)</code></p> | |
| `}}),Je=new fo({props:{$$slots:{default:[hr]},$$scope:{ctx:w}}}),Ie=new ce({props:{anchor:"transformers.BlipForImageTextRetrieval.forward.example",$$slots:{default:[ur]},$$scope:{ctx:w}}}),Mt=new U({props:{title:"BlipForQuestionAnswering",local:"transformers.BlipForQuestionAnswering",headingTag:"h2"}}),vt=new x({props:{name:"class transformers.BlipForQuestionAnswering",anchor:"transformers.BlipForQuestionAnswering",parameters:[{name:"config",val:": BlipConfig"}],parametersDescription:[{anchor:"transformers.BlipForQuestionAnswering.config",description:`<strong>config</strong> (<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipConfig">BlipConfig</a>) — | |
| Model configuration class with all the parameters of the model. Initializing with a config file does not | |
| load the weights associated with the model, only the configuration. Check out the | |
| <a href="/docs/transformers/pr_33962/en/main_classes/model#transformers.PreTrainedModel.from_pretrained">from_pretrained()</a> method to load the model weights.`,name:"config"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L960"}}),wt=new x({props:{name:"forward",anchor:"transformers.BlipForQuestionAnswering.forward",parameters:[{name:"input_ids",val:": LongTensor"},{name:"pixel_values",val:": FloatTensor"},{name:"decoder_input_ids",val:": typing.Optional[torch.LongTensor] = None"},{name:"decoder_attention_mask",val:": typing.Optional[torch.LongTensor] = None"},{name:"attention_mask",val:": typing.Optional[torch.LongTensor] = None"},{name:"labels",val:": typing.Optional[torch.LongTensor] = None"},{name:"interpolate_pos_encoding",val:": bool = False"},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs]"}],parametersDescription:[{anchor:"transformers.BlipForQuestionAnswering.forward.input_ids",description:`<strong>input_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>) — | |
| Indices of input sequence tokens in the vocabulary. Padding will be ignored by default.</p> | |
| <p>Indices can be obtained using <a href="/docs/transformers/pr_33962/en/model_doc/auto#transformers.AutoTokenizer">AutoTokenizer</a>. See <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.encode">PreTrainedTokenizer.encode()</a> and | |
| <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.__call__">PreTrainedTokenizer.<strong>call</strong>()</a> for details.</p> | |
| <p><a href="../glossary#input-ids">What are input IDs?</a>`,name:"input_ids"},{anchor:"transformers.BlipForQuestionAnswering.forward.pixel_values",description:`<strong>pixel_values</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_channels, image_size, image_size)</code>) — | |
| The tensors corresponding to the input images. Pixel values can be obtained using | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a>. See <a href="/docs/transformers/pr_33962/en/model_doc/fuyu#transformers.FuyuImageProcessor.__call__">BlipImageProcessor.<strong>call</strong>()</a> for details (<a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipProcessor">BlipProcessor</a> uses | |
| <a href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipImageProcessor">BlipImageProcessor</a> for processing images).`,name:"pixel_values"},{anchor:"transformers.BlipForQuestionAnswering.forward.decoder_input_ids",description:`<strong>decoder_input_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, target_sequence_length)</code>, <em>optional</em>) — | |
| Indices of decoder input sequence tokens in the vocabulary.</p> | |
| <p>Indices can be obtained using <a href="/docs/transformers/pr_33962/en/model_doc/auto#transformers.AutoTokenizer">AutoTokenizer</a>. See <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.encode">PreTrainedTokenizer.encode()</a> and | |
| <a href="/docs/transformers/pr_33962/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.__call__">PreTrainedTokenizer.<strong>call</strong>()</a> for details.</p> | |
| <p><a href="../glossary#decoder-input-ids">What are decoder input IDs?</a>`,name:"decoder_input_ids"},{anchor:"transformers.BlipForQuestionAnswering.forward.decoder_attention_mask",description:`<strong>decoder_attention_mask</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, target_sequence_length)</code>, <em>optional</em>) — | |
| Mask to avoid performing attention on certain token indices. By default, a causal mask will be used, to | |
| make sure the model can only look at previous inputs in order to predict the future.`,name:"decoder_attention_mask"},{anchor:"transformers.BlipForQuestionAnswering.forward.attention_mask",description:`<strong>attention_mask</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Mask to avoid performing attention on padding token indices. Mask values selected in <code>[0, 1]</code>:</p> | |
| <ul> | |
| <li>1 for tokens that are <strong>not masked</strong>,</li> | |
| <li>0 for tokens that are <strong>masked</strong>.</li> | |
| </ul> | |
| <p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"attention_mask"},{anchor:"transformers.BlipForQuestionAnswering.forward.labels",description:`<strong>labels</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) — | |
| Labels for computing the masked language modeling loss. Indices should either be in <code>[0, ..., config.vocab_size]</code> or -100 (see <code>input_ids</code> docstring). Tokens with indices set to <code>-100</code> are ignored | |
| (masked), the loss is only computed for the tokens with labels in <code>[0, ..., config.vocab_size]</code>.`,name:"labels"},{anchor:"transformers.BlipForQuestionAnswering.forward.interpolate_pos_encoding",description:`<strong>interpolate_pos_encoding</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to interpolate the pre-trained position encodings.`,name:"interpolate_pos_encoding"}],source:"https://github.com/huggingface/transformers/blob/vr_33962/src/transformers/models/blip/modeling_blip.py#L986",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p>A <code>transformers.models.blip.modeling_blip.BlipTextVisionModelOutput</code> or a tuple of | |
| <code>torch.FloatTensor</code> (if <code>return_dict=False</code> is passed or when <code>config.return_dict=False</code>) comprising various | |
| elements depending on the configuration (<a | |
| href="/docs/transformers/pr_33962/en/model_doc/blip#transformers.BlipConfig" | |
| >BlipConfig</a>) and inputs.</p> | |
| <ul> | |
| <li> | |
| <p><strong>loss</strong> (<code>torch.FloatTensor</code> of shape <code>(1,)</code>, <em>optional</em>, returned when <code>labels</code> is provided) — Language modeling loss from the text decoder.</p> | |
| </li> | |
| <li> | |
| <p><strong>image_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, output_dim)</code> <em>optional</em> returned when model is initialized with <code>with_projection=True</code>) — The image embeddings obtained by applying the projection layer to the pooler_output.</p> | |
| </li> | |
| <li> | |
| <p><strong>last_hidden_state</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, hidden_size)</code>, <em>optional</em>, defaults to <code>None</code>) — Sequence of hidden-states at the output of the last layer of the model.</p> | |
| </li> | |
| <li> | |
| <p><strong>hidden_states</strong> (<code>tuple[torch.FloatTensor, ...]</code>, <em>optional</em>, returned when <code>output_hidden_states=True</code> is passed or when <code>config.output_hidden_states=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for the output of the embeddings, if the model has an embedding layer, + | |
| one for the output of each layer) of shape <code>(batch_size, sequence_length, hidden_size)</code>.</p> | |
| <p>Hidden-states of the model at the output of each layer plus the optional initial embedding outputs.</p> | |
| </li> | |
| <li> | |
| <p><strong>attentions</strong> (<code>tuple[torch.FloatTensor, ...]</code>, <em>optional</em>, returned when <code>output_attentions=True</code> is passed or when <code>config.output_attentions=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for each layer) of shape <code>(batch_size, num_heads, sequence_length, sequence_length)</code>.</p> | |
| <p>Attentions weights after the attention softmax, used to compute the weighted average in the self-attention | |
| heads.</p> | |
| </li> | |
| </ul> | |
| `,returnType:`<script context="module">export const metadata = 'undefined';<\/script> | |
| <p><code>transformers.models.blip.modeling_blip.BlipTextVisionModelOutput</code> or <code>tuple(torch.FloatTensor)</code></p> | |
| `}}),je=new fo({props:{$$slots:{default:[_r]},$$scope:{ctx:w}}}),Ce=new ce({props:{anchor:"transformers.BlipForQuestionAnswering.forward.example",$$slots:{default:[br]},$$scope:{ctx:w}}}),Bt=new er({props:{source:"https://github.com/huggingface/transformers/blob/main/docs/source/en/model_doc/blip.md"}}),{c(){t=p("meta"),y=a(),r=p("p"),d=a(),g=p("p"),g.innerHTML=o,v=a(),f(A.$$.fragment),ho=a(),pe=p("div"),pe.innerHTML=as,uo=a(),f(We.$$.fragment),_o=a(),Fe=p("p"),Fe.innerHTML=is,bo=a(),Ze=p("p"),Ze.innerHTML=ls,To=a(),me=p("blockquote"),me.innerHTML=ds,yo=a(),Pe=p("p"),Pe.innerHTML=cs,Mo=a(),f(ge.$$.fragment),vo=a(),f(Ne.$$.fragment),wo=a(),Ve=p("p"),Ve.innerHTML=ps,Bo=a(),f(qe.$$.fragment),$o=a(),W=p("div"),f(Re.$$.fragment),tn=a(),jt=p("p"),jt.innerHTML=ms,on=a(),Ct=p("p"),Ct.innerHTML=gs,nn=a(),f(fe.$$.fragment),xo=a(),f(He.$$.fragment),Jo=a(),F=p("div"),f(Ge.$$.fragment),sn=a(),zt=p("p"),zt.innerHTML=fs,rn=a(),kt=p("p"),kt.innerHTML=hs,an=a(),f(he.$$.fragment),Io=a(),f(Ee.$$.fragment),jo=a(),Z=p("div"),f(Le.$$.fragment),ln=a(),Ut=p("p"),Ut.innerHTML=us,dn=a(),Wt=p("p"),Wt.innerHTML=_s,cn=a(),f(ue.$$.fragment),Co=a(),f(Xe.$$.fragment),zo=a(),R=p("div"),f(Qe.$$.fragment),pn=a(),Ft=p("p"),Ft.textContent=bs,mn=a(),Zt=p("p"),Zt.innerHTML=Ts,ko=a(),f(Ye.$$.fragment),Uo=a(),H=p("div"),f(Se.$$.fragment),gn=a(),Pt=p("p"),Pt.textContent=ys,fn=a(),_e=p("div"),f(Ae.$$.fragment),hn=a(),Nt=p("p"),Nt.textContent=Ms,Wo=a(),f(De.$$.fragment),Fo=a(),G=p("div"),f(Oe.$$.fragment),un=a(),Vt=p("p"),Vt.textContent=vs,_n=a(),qt=p("div"),f(Ke.$$.fragment),Zo=a(),f(et.$$.fragment),Po=a(),tt=p("p"),tt.innerHTML=ws,No=a(),J=p("div"),f(ot.$$.fragment),bn=a(),Rt=p("p"),Rt.innerHTML=Bs,Tn=a(),Ht=p("p"),Ht.innerHTML=$s,yn=a(),Gt=p("p"),Gt.innerHTML=xs,Mn=a(),P=p("div"),f(nt.$$.fragment),vn=a(),Et=p("p"),Et.innerHTML=Js,wn=a(),f(be.$$.fragment),Bn=a(),f(Te.$$.fragment),$n=a(),ye=p("div"),f(st.$$.fragment),xn=a(),f(Me.$$.fragment),Jn=a(),ve=p("div"),f(rt.$$.fragment),In=a(),f(we.$$.fragment),Vo=a(),f(at.$$.fragment),qo=a(),E=p("div"),f(it.$$.fragment),jn=a(),Lt=p("p"),Lt.innerHTML=Is,Cn=a(),D=p("div"),f(lt.$$.fragment),zn=a(),Xt=p("p"),Xt.innerHTML=js,kn=a(),Qt=p("ul"),Qt.innerHTML=Cs,Ro=a(),f(dt.$$.fragment),Ho=a(),ne=p("div"),f(ct.$$.fragment),Un=a(),O=p("div"),f(pt.$$.fragment),Wn=a(),Yt=p("p"),Yt.innerHTML=zs,Fn=a(),St=p("ul"),St.innerHTML=ks,Go=a(),f(mt.$$.fragment),Eo=a(),se=p("div"),f(gt.$$.fragment),Zn=a(),K=p("div"),f(ft.$$.fragment),Pn=a(),At=p("p"),At.innerHTML=Us,Nn=a(),f(Be.$$.fragment),Lo=a(),f(ht.$$.fragment),Xo=a(),C=p("div"),f(ut.$$.fragment),Vn=a(),Dt=p("p"),Dt.innerHTML=Ws,qn=a(),Ot=p("p"),Ot.innerHTML=Fs,Rn=a(),Kt=p("p"),Kt.innerHTML=Zs,Hn=a(),N=p("div"),f(_t.$$.fragment),Gn=a(),eo=p("p"),eo.innerHTML=Ps,En=a(),f($e.$$.fragment),Ln=a(),f(xe.$$.fragment),Qo=a(),f(bt.$$.fragment),Yo=a(),z=p("div"),f(Tt.$$.fragment),Xn=a(),to=p("p"),to.textContent=Ns,Qn=a(),oo=p("p"),oo.innerHTML=Vs,Yn=a(),no=p("p"),no.innerHTML=qs,Sn=a(),V=p("div"),f(yt.$$.fragment),An=a(),so=p("p"),so.innerHTML=Rs,Dn=a(),f(Je.$$.fragment),On=a(),f(Ie.$$.fragment),So=a(),f(Mt.$$.fragment),Ao=a(),k=p("div"),f(vt.$$.fragment),Kn=a(),ro=p("p"),ro.textContent=Hs,es=a(),ao=p("p"),ao.innerHTML=Gs,ts=a(),io=p("p"),io.innerHTML=Es,os=a(),q=p("div"),f(wt.$$.fragment),ns=a(),lo=p("p"),lo.innerHTML=Ls,ss=a(),f(je.$$.fragment),rs=a(),f(Ce.$$.fragment),Do=a(),f(Bt.$$.fragment),Oo=a(),mo=p("p"),this.h()},l(e){const n=Ds("svelte-u9bgzb",document.head);t=m(n,"META",{name:!0,content:!0}),n.forEach(s),y=i(e),r=m(e,"P",{}),$(r).forEach(s),d=i(e),g=m(e,"P",{"data-svelte-h":!0}),M(g)!=="svelte-723gnl"&&(g.innerHTML=o),v=i(e),h(A.$$.fragment,e),ho=i(e),pe=m(e,"DIV",{style:!0,"data-svelte-h":!0}),M(pe)!=="svelte-wa5t4p"&&(pe.innerHTML=as),uo=i(e),h(We.$$.fragment,e),_o=i(e),Fe=m(e,"P",{"data-svelte-h":!0}),M(Fe)!=="svelte-y9k2k5"&&(Fe.innerHTML=is),bo=i(e),Ze=m(e,"P",{"data-svelte-h":!0}),M(Ze)!=="svelte-wloym4"&&(Ze.innerHTML=ls),To=i(e),me=m(e,"BLOCKQUOTE",{class:!0,"data-svelte-h":!0}),M(me)!=="svelte-dvvdby"&&(me.innerHTML=ds),yo=i(e),Pe=m(e,"P",{"data-svelte-h":!0}),M(Pe)!=="svelte-1sa2yh2"&&(Pe.innerHTML=cs),Mo=i(e),h(ge.$$.fragment,e),vo=i(e),h(Ne.$$.fragment,e),wo=i(e),Ve=m(e,"P",{"data-svelte-h":!0}),M(Ve)!=="svelte-1rrn16c"&&(Ve.innerHTML=ps),Bo=i(e),h(qe.$$.fragment,e),$o=i(e),W=m(e,"DIV",{class:!0});var L=$(W);h(Re.$$.fragment,L),tn=i(L),jt=m(L,"P",{"data-svelte-h":!0}),M(jt)!=="svelte-4qald9"&&(jt.innerHTML=ms),on=i(L),Ct=m(L,"P",{"data-svelte-h":!0}),M(Ct)!=="svelte-1ghu04j"&&(Ct.innerHTML=gs),nn=i(L),h(fe.$$.fragment,L),L.forEach(s),xo=i(e),h(He.$$.fragment,e),Jo=i(e),F=m(e,"DIV",{class:!0});var X=$(F);h(Ge.$$.fragment,X),sn=i(X),zt=m(X,"P",{"data-svelte-h":!0}),M(zt)!=="svelte-su8ri9"&&(zt.innerHTML=fs),rn=i(X),kt=m(X,"P",{"data-svelte-h":!0}),M(kt)!=="svelte-1ghu04j"&&(kt.innerHTML=hs),an=i(X),h(he.$$.fragment,X),X.forEach(s),Io=i(e),h(Ee.$$.fragment,e),jo=i(e),Z=m(e,"DIV",{class:!0});var Q=$(Z);h(Le.$$.fragment,Q),ln=i(Q),Ut=m(Q,"P",{"data-svelte-h":!0}),M(Ut)!=="svelte-jz4yom"&&(Ut.innerHTML=us),dn=i(Q),Wt=m(Q,"P",{"data-svelte-h":!0}),M(Wt)!=="svelte-1ghu04j"&&(Wt.innerHTML=_s),cn=i(Q),h(ue.$$.fragment,Q),Q.forEach(s),Co=i(e),h(Xe.$$.fragment,e),zo=i(e),R=m(e,"DIV",{class:!0});var re=$(R);h(Qe.$$.fragment,re),pn=i(re),Ft=m(re,"P",{"data-svelte-h":!0}),M(Ft)!=="svelte-4ee3u1"&&(Ft.textContent=bs),mn=i(re),Zt=m(re,"P",{"data-svelte-h":!0}),M(Zt)!=="svelte-62eksj"&&(Zt.innerHTML=Ts),re.forEach(s),ko=i(e),h(Ye.$$.fragment,e),Uo=i(e),H=m(e,"DIV",{class:!0});var ae=$(H);h(Se.$$.fragment,ae),gn=i(ae),Pt=m(ae,"P",{"data-svelte-h":!0}),M(Pt)!=="svelte-17e80zr"&&(Pt.textContent=ys),fn=i(ae),_e=m(ae,"DIV",{class:!0});var $t=$(_e);h(Ae.$$.fragment,$t),hn=i($t),Nt=m($t,"P",{"data-svelte-h":!0}),M(Nt)!=="svelte-1x3yxsa"&&(Nt.textContent=Ms),$t.forEach(s),ae.forEach(s),Wo=i(e),h(De.$$.fragment,e),Fo=i(e),G=m(e,"DIV",{class:!0});var ie=$(G);h(Oe.$$.fragment,ie),un=i(ie),Vt=m(ie,"P",{"data-svelte-h":!0}),M(Vt)!=="svelte-d36uxd"&&(Vt.textContent=vs),_n=i(ie),qt=m(ie,"DIV",{class:!0});var go=$(qt);h(Ke.$$.fragment,go),go.forEach(s),ie.forEach(s),Zo=i(e),h(et.$$.fragment,e),Po=i(e),tt=m(e,"P",{"data-svelte-h":!0}),M(tt)!=="svelte-1gcpopj"&&(tt.innerHTML=ws),No=i(e),J=m(e,"DIV",{class:!0});var I=$(J);h(ot.$$.fragment,I),bn=i(I),Rt=m(I,"P",{"data-svelte-h":!0}),M(Rt)!=="svelte-1ke3c5j"&&(Rt.innerHTML=Bs),Tn=i(I),Ht=m(I,"P",{"data-svelte-h":!0}),M(Ht)!=="svelte-1kqcut9"&&(Ht.innerHTML=$s),yn=i(I),Gt=m(I,"P",{"data-svelte-h":!0}),M(Gt)!=="svelte-hswkmf"&&(Gt.innerHTML=xs),Mn=i(I),P=m(I,"DIV",{class:!0});var Y=$(P);h(nt.$$.fragment,Y),vn=i(Y),Et=m(Y,"P",{"data-svelte-h":!0}),M(Et)!=="svelte-8vh769"&&(Et.innerHTML=Js),wn=i(Y),h(be.$$.fragment,Y),Bn=i(Y),h(Te.$$.fragment,Y),Y.forEach(s),$n=i(I),ye=m(I,"DIV",{class:!0});var xt=$(ye);h(st.$$.fragment,xt),xn=i(xt),h(Me.$$.fragment,xt),xt.forEach(s),Jn=i(I),ve=m(I,"DIV",{class:!0});var Jt=$(ve);h(rt.$$.fragment,Jt),In=i(Jt),h(we.$$.fragment,Jt),Jt.forEach(s),I.forEach(s),Vo=i(e),h(at.$$.fragment,e),qo=i(e),E=m(e,"DIV",{class:!0});var le=$(E);h(it.$$.fragment,le),jn=i(le),Lt=m(le,"P",{"data-svelte-h":!0}),M(Lt)!=="svelte-m9neaz"&&(Lt.innerHTML=Is),Cn=i(le),D=m(le,"DIV",{class:!0});var de=$(D);h(lt.$$.fragment,de),zn=i(de),Xt=m(de,"P",{"data-svelte-h":!0}),M(Xt)!=="svelte-1misbdl"&&(Xt.innerHTML=js),kn=i(de),Qt=m(de,"UL",{"data-svelte-h":!0}),M(Qt)!=="svelte-18dzh1l"&&(Qt.innerHTML=Cs),de.forEach(s),le.forEach(s),Ro=i(e),h(dt.$$.fragment,e),Ho=i(e),ne=m(e,"DIV",{class:!0});var It=$(ne);h(ct.$$.fragment,It),Un=i(It),O=m(It,"DIV",{class:!0});var co=$(O);h(pt.$$.fragment,co),Wn=i(co),Yt=m(co,"P",{"data-svelte-h":!0}),M(Yt)!=="svelte-1xgfqjr"&&(Yt.innerHTML=zs),Fn=i(co),St=m(co,"UL",{"data-svelte-h":!0}),M(St)!=="svelte-xyof4k"&&(St.innerHTML=ks),co.forEach(s),It.forEach(s),Go=i(e),h(mt.$$.fragment,e),Eo=i(e),se=m(e,"DIV",{class:!0});var en=$(se);h(gt.$$.fragment,en),Zn=i(en),K=m(en,"DIV",{class:!0});var po=$(K);h(ft.$$.fragment,po),Pn=i(po),At=m(po,"P",{"data-svelte-h":!0}),M(At)!=="svelte-caeyo1"&&(At.innerHTML=Us),Nn=i(po),h(Be.$$.fragment,po),po.forEach(s),en.forEach(s),Lo=i(e),h(ht.$$.fragment,e),Xo=i(e),C=m(e,"DIV",{class:!0});var ee=$(C);h(ut.$$.fragment,ee),Vn=i(ee),Dt=m(ee,"P",{"data-svelte-h":!0}),M(Dt)!=="svelte-u9sua2"&&(Dt.innerHTML=Ws),qn=i(ee),Ot=m(ee,"P",{"data-svelte-h":!0}),M(Ot)!=="svelte-1kqcut9"&&(Ot.innerHTML=Fs),Rn=i(ee),Kt=m(ee,"P",{"data-svelte-h":!0}),M(Kt)!=="svelte-hswkmf"&&(Kt.innerHTML=Zs),Hn=i(ee),N=m(ee,"DIV",{class:!0});var ze=$(N);h(_t.$$.fragment,ze),Gn=i(ze),eo=m(ze,"P",{"data-svelte-h":!0}),M(eo)!=="svelte-1ljhz55"&&(eo.innerHTML=Ps),En=i(ze),h($e.$$.fragment,ze),Ln=i(ze),h(xe.$$.fragment,ze),ze.forEach(s),ee.forEach(s),Qo=i(e),h(bt.$$.fragment,e),Yo=i(e),z=m(e,"DIV",{class:!0});var te=$(z);h(Tt.$$.fragment,te),Xn=i(te),to=m(te,"P",{"data-svelte-h":!0}),M(to)!=="svelte-1cwza0e"&&(to.textContent=Ns),Qn=i(te),oo=m(te,"P",{"data-svelte-h":!0}),M(oo)!=="svelte-1kqcut9"&&(oo.innerHTML=Vs),Yn=i(te),no=m(te,"P",{"data-svelte-h":!0}),M(no)!=="svelte-hswkmf"&&(no.innerHTML=qs),Sn=i(te),V=m(te,"DIV",{class:!0});var ke=$(V);h(yt.$$.fragment,ke),An=i(ke),so=m(ke,"P",{"data-svelte-h":!0}),M(so)!=="svelte-4cqre9"&&(so.innerHTML=Rs),Dn=i(ke),h(Je.$$.fragment,ke),On=i(ke),h(Ie.$$.fragment,ke),ke.forEach(s),te.forEach(s),So=i(e),h(Mt.$$.fragment,e),Ao=i(e),k=m(e,"DIV",{class:!0});var oe=$(k);h(vt.$$.fragment,oe),Kn=i(oe),ro=m(oe,"P",{"data-svelte-h":!0}),M(ro)!=="svelte-tf7otj"&&(ro.textContent=Hs),es=i(oe),ao=m(oe,"P",{"data-svelte-h":!0}),M(ao)!=="svelte-1kqcut9"&&(ao.innerHTML=Gs),ts=i(oe),io=m(oe,"P",{"data-svelte-h":!0}),M(io)!=="svelte-hswkmf"&&(io.innerHTML=Es),os=i(oe),q=m(oe,"DIV",{class:!0});var Ue=$(q);h(wt.$$.fragment,Ue),ns=i(Ue),lo=m(Ue,"P",{"data-svelte-h":!0}),M(lo)!=="svelte-10mrrux"&&(lo.innerHTML=Ls),ss=i(Ue),h(je.$$.fragment,Ue),rs=i(Ue),h(Ce.$$.fragment,Ue),Ue.forEach(s),oe.forEach(s),Do=i(e),h(Bt.$$.fragment,e),Oo=i(e),mo=m(e,"P",{}),$(mo).forEach(s),this.h()},h(){B(t,"name","hf:doc:metadata"),B(t,"content",yr),Os(pe,"float","right"),B(me,"class","tip"),B(W,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(F,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(Z,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(R,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(_e,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(H,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(qt,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(G,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(P,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(ye,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(ve,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(J,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(D,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(E,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(O,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(ne,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(K,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(se,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(N,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(C,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(V,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(z,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(q,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(k,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8")},m(e,n){l(document.head,t),c(e,y,n),c(e,r,n),c(e,d,n),c(e,g,n),c(e,v,n),u(A,e,n),c(e,ho,n),c(e,pe,n),c(e,uo,n),u(We,e,n),c(e,_o,n),c(e,Fe,n),c(e,bo,n),c(e,Ze,n),c(e,To,n),c(e,me,n),c(e,yo,n),c(e,Pe,n),c(e,Mo,n),u(ge,e,n),c(e,vo,n),u(Ne,e,n),c(e,wo,n),c(e,Ve,n),c(e,Bo,n),u(qe,e,n),c(e,$o,n),c(e,W,n),u(Re,W,null),l(W,tn),l(W,jt),l(W,on),l(W,Ct),l(W,nn),u(fe,W,null),c(e,xo,n),u(He,e,n),c(e,Jo,n),c(e,F,n),u(Ge,F,null),l(F,sn),l(F,zt),l(F,rn),l(F,kt),l(F,an),u(he,F,null),c(e,Io,n),u(Ee,e,n),c(e,jo,n),c(e,Z,n),u(Le,Z,null),l(Z,ln),l(Z,Ut),l(Z,dn),l(Z,Wt),l(Z,cn),u(ue,Z,null),c(e,Co,n),u(Xe,e,n),c(e,zo,n),c(e,R,n),u(Qe,R,null),l(R,pn),l(R,Ft),l(R,mn),l(R,Zt),c(e,ko,n),u(Ye,e,n),c(e,Uo,n),c(e,H,n),u(Se,H,null),l(H,gn),l(H,Pt),l(H,fn),l(H,_e),u(Ae,_e,null),l(_e,hn),l(_e,Nt),c(e,Wo,n),u(De,e,n),c(e,Fo,n),c(e,G,n),u(Oe,G,null),l(G,un),l(G,Vt),l(G,_n),l(G,qt),u(Ke,qt,null),c(e,Zo,n),u(et,e,n),c(e,Po,n),c(e,tt,n),c(e,No,n),c(e,J,n),u(ot,J,null),l(J,bn),l(J,Rt),l(J,Tn),l(J,Ht),l(J,yn),l(J,Gt),l(J,Mn),l(J,P),u(nt,P,null),l(P,vn),l(P,Et),l(P,wn),u(be,P,null),l(P,Bn),u(Te,P,null),l(J,$n),l(J,ye),u(st,ye,null),l(ye,xn),u(Me,ye,null),l(J,Jn),l(J,ve),u(rt,ve,null),l(ve,In),u(we,ve,null),c(e,Vo,n),u(at,e,n),c(e,qo,n),c(e,E,n),u(it,E,null),l(E,jn),l(E,Lt),l(E,Cn),l(E,D),u(lt,D,null),l(D,zn),l(D,Xt),l(D,kn),l(D,Qt),c(e,Ro,n),u(dt,e,n),c(e,Ho,n),c(e,ne,n),u(ct,ne,null),l(ne,Un),l(ne,O),u(pt,O,null),l(O,Wn),l(O,Yt),l(O,Fn),l(O,St),c(e,Go,n),u(mt,e,n),c(e,Eo,n),c(e,se,n),u(gt,se,null),l(se,Zn),l(se,K),u(ft,K,null),l(K,Pn),l(K,At),l(K,Nn),u(Be,K,null),c(e,Lo,n),u(ht,e,n),c(e,Xo,n),c(e,C,n),u(ut,C,null),l(C,Vn),l(C,Dt),l(C,qn),l(C,Ot),l(C,Rn),l(C,Kt),l(C,Hn),l(C,N),u(_t,N,null),l(N,Gn),l(N,eo),l(N,En),u($e,N,null),l(N,Ln),u(xe,N,null),c(e,Qo,n),u(bt,e,n),c(e,Yo,n),c(e,z,n),u(Tt,z,null),l(z,Xn),l(z,to),l(z,Qn),l(z,oo),l(z,Yn),l(z,no),l(z,Sn),l(z,V),u(yt,V,null),l(V,An),l(V,so),l(V,Dn),u(Je,V,null),l(V,On),u(Ie,V,null),c(e,So,n),u(Mt,e,n),c(e,Ao,n),c(e,k,n),u(vt,k,null),l(k,Kn),l(k,ro),l(k,es),l(k,ao),l(k,ts),l(k,io),l(k,os),l(k,q),u(wt,q,null),l(q,ns),l(q,lo),l(q,ss),u(je,q,null),l(q,rs),u(Ce,q,null),c(e,Do,n),u(Bt,e,n),c(e,Oo,n),c(e,mo,n),Ko=!0},p(e,[n]){const L={};n&2&&(L.$$scope={dirty:n,ctx:e}),ge.$set(L);const X={};n&2&&(X.$$scope={dirty:n,ctx:e}),fe.$set(X);const Q={};n&2&&(Q.$$scope={dirty:n,ctx:e}),he.$set(Q);const re={};n&2&&(re.$$scope={dirty:n,ctx:e}),ue.$set(re);const ae={};n&2&&(ae.$$scope={dirty:n,ctx:e}),be.$set(ae);const $t={};n&2&&($t.$$scope={dirty:n,ctx:e}),Te.$set($t);const ie={};n&2&&(ie.$$scope={dirty:n,ctx:e}),Me.$set(ie);const go={};n&2&&(go.$$scope={dirty:n,ctx:e}),we.$set(go);const I={};n&2&&(I.$$scope={dirty:n,ctx:e}),Be.$set(I);const Y={};n&2&&(Y.$$scope={dirty:n,ctx:e}),$e.$set(Y);const xt={};n&2&&(xt.$$scope={dirty:n,ctx:e}),xe.$set(xt);const Jt={};n&2&&(Jt.$$scope={dirty:n,ctx:e}),Je.$set(Jt);const le={};n&2&&(le.$$scope={dirty:n,ctx:e}),Ie.$set(le);const de={};n&2&&(de.$$scope={dirty:n,ctx:e}),je.$set(de);const It={};n&2&&(It.$$scope={dirty:n,ctx:e}),Ce.$set(It)},i(e){Ko||(_(A.$$.fragment,e),_(We.$$.fragment,e),_(ge.$$.fragment,e),_(Ne.$$.fragment,e),_(qe.$$.fragment,e),_(Re.$$.fragment,e),_(fe.$$.fragment,e),_(He.$$.fragment,e),_(Ge.$$.fragment,e),_(he.$$.fragment,e),_(Ee.$$.fragment,e),_(Le.$$.fragment,e),_(ue.$$.fragment,e),_(Xe.$$.fragment,e),_(Qe.$$.fragment,e),_(Ye.$$.fragment,e),_(Se.$$.fragment,e),_(Ae.$$.fragment,e),_(De.$$.fragment,e),_(Oe.$$.fragment,e),_(Ke.$$.fragment,e),_(et.$$.fragment,e),_(ot.$$.fragment,e),_(nt.$$.fragment,e),_(be.$$.fragment,e),_(Te.$$.fragment,e),_(st.$$.fragment,e),_(Me.$$.fragment,e),_(rt.$$.fragment,e),_(we.$$.fragment,e),_(at.$$.fragment,e),_(it.$$.fragment,e),_(lt.$$.fragment,e),_(dt.$$.fragment,e),_(ct.$$.fragment,e),_(pt.$$.fragment,e),_(mt.$$.fragment,e),_(gt.$$.fragment,e),_(ft.$$.fragment,e),_(Be.$$.fragment,e),_(ht.$$.fragment,e),_(ut.$$.fragment,e),_(_t.$$.fragment,e),_($e.$$.fragment,e),_(xe.$$.fragment,e),_(bt.$$.fragment,e),_(Tt.$$.fragment,e),_(yt.$$.fragment,e),_(Je.$$.fragment,e),_(Ie.$$.fragment,e),_(Mt.$$.fragment,e),_(vt.$$.fragment,e),_(wt.$$.fragment,e),_(je.$$.fragment,e),_(Ce.$$.fragment,e),_(Bt.$$.fragment,e),Ko=!0)},o(e){b(A.$$.fragment,e),b(We.$$.fragment,e),b(ge.$$.fragment,e),b(Ne.$$.fragment,e),b(qe.$$.fragment,e),b(Re.$$.fragment,e),b(fe.$$.fragment,e),b(He.$$.fragment,e),b(Ge.$$.fragment,e),b(he.$$.fragment,e),b(Ee.$$.fragment,e),b(Le.$$.fragment,e),b(ue.$$.fragment,e),b(Xe.$$.fragment,e),b(Qe.$$.fragment,e),b(Ye.$$.fragment,e),b(Se.$$.fragment,e),b(Ae.$$.fragment,e),b(De.$$.fragment,e),b(Oe.$$.fragment,e),b(Ke.$$.fragment,e),b(et.$$.fragment,e),b(ot.$$.fragment,e),b(nt.$$.fragment,e),b(be.$$.fragment,e),b(Te.$$.fragment,e),b(st.$$.fragment,e),b(Me.$$.fragment,e),b(rt.$$.fragment,e),b(we.$$.fragment,e),b(at.$$.fragment,e),b(it.$$.fragment,e),b(lt.$$.fragment,e),b(dt.$$.fragment,e),b(ct.$$.fragment,e),b(pt.$$.fragment,e),b(mt.$$.fragment,e),b(gt.$$.fragment,e),b(ft.$$.fragment,e),b(Be.$$.fragment,e),b(ht.$$.fragment,e),b(ut.$$.fragment,e),b(_t.$$.fragment,e),b($e.$$.fragment,e),b(xe.$$.fragment,e),b(bt.$$.fragment,e),b(Tt.$$.fragment,e),b(yt.$$.fragment,e),b(Je.$$.fragment,e),b(Ie.$$.fragment,e),b(Mt.$$.fragment,e),b(vt.$$.fragment,e),b(wt.$$.fragment,e),b(je.$$.fragment,e),b(Ce.$$.fragment,e),b(Bt.$$.fragment,e),Ko=!1},d(e){e&&(s(y),s(r),s(d),s(g),s(v),s(ho),s(pe),s(uo),s(_o),s(Fe),s(bo),s(Ze),s(To),s(me),s(yo),s(Pe),s(Mo),s(vo),s(wo),s(Ve),s(Bo),s($o),s(W),s(xo),s(Jo),s(F),s(Io),s(jo),s(Z),s(Co),s(zo),s(R),s(ko),s(Uo),s(H),s(Wo),s(Fo),s(G),s(Zo),s(Po),s(tt),s(No),s(J),s(Vo),s(qo),s(E),s(Ro),s(Ho),s(ne),s(Go),s(Eo),s(se),s(Lo),s(Xo),s(C),s(Qo),s(Yo),s(z),s(So),s(Ao),s(k),s(Do),s(Oo),s(mo)),s(t),T(A,e),T(We,e),T(ge,e),T(Ne,e),T(qe,e),T(Re),T(fe),T(He,e),T(Ge),T(he),T(Ee,e),T(Le),T(ue),T(Xe,e),T(Qe),T(Ye,e),T(Se),T(Ae),T(De,e),T(Oe),T(Ke),T(et,e),T(ot),T(nt),T(be),T(Te),T(st),T(Me),T(rt),T(we),T(at,e),T(it),T(lt),T(dt,e),T(ct),T(pt),T(mt,e),T(gt),T(ft),T(Be),T(ht,e),T(ut),T(_t),T($e),T(xe),T(bt,e),T(Tt),T(yt),T(Je),T(Ie),T(Mt,e),T(vt),T(wt),T(je),T(Ce),T(Bt,e)}}}const yr='{"title":"BLIP","local":"blip","sections":[{"title":"Resources","local":"resources","sections":[],"depth":2},{"title":"BlipConfig","local":"transformers.BlipConfig","sections":[],"depth":2},{"title":"BlipTextConfig","local":"transformers.BlipTextConfig","sections":[],"depth":2},{"title":"BlipVisionConfig","local":"transformers.BlipVisionConfig","sections":[],"depth":2},{"title":"BlipProcessor","local":"transformers.BlipProcessor","sections":[],"depth":2},{"title":"BlipImageProcessor","local":"transformers.BlipImageProcessor","sections":[],"depth":2},{"title":"BlipImageProcessorFast","local":"transformers.BlipImageProcessorFast","sections":[],"depth":2},{"title":"BlipModel","local":"transformers.BlipModel","sections":[],"depth":2},{"title":"BlipTextModel","local":"transformers.BlipTextModel","sections":[],"depth":2},{"title":"BlipTextLMHeadModel","local":"transformers.BlipTextLMHeadModel","sections":[],"depth":2},{"title":"BlipVisionModel","local":"transformers.BlipVisionModel","sections":[],"depth":2},{"title":"BlipForConditionalGeneration","local":"transformers.BlipForConditionalGeneration","sections":[],"depth":2},{"title":"BlipForImageTextRetrieval","local":"transformers.BlipForImageTextRetrieval","sections":[],"depth":2},{"title":"BlipForQuestionAnswering","local":"transformers.BlipForQuestionAnswering","sections":[],"depth":2}],"depth":1}';function Mr(w){return Ys(()=>{new URLSearchParams(window.location.search).get("fw")}),[]}class zr extends Ss{constructor(t){super(),As(this,t,Mr,Tr,Qs,{})}}export{zr as component}; | |
Xet Storage Details
- Size:
- 146 kB
- Xet hash:
- 4c401e48df9a7918caec6eca50746bb66b587dffdaed8f90af228c7639a56850
·
Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.