Buckets:

HuggingFaceDocBuilder's picture
download
raw
133 kB
import{s as vs,b as Bs,o as Js,n as S}from"../chunks/scheduler.31fdf58d.js";import{S as ks,i as xs,e as d,s,c as h,h as Us,a as c,d as t,b as n,f as J,j as g,g as f,k as B,l,m as i,n as u,t as w,o as T,p as _}from"../chunks/index.2f76fdf0.js";import{T as Lt}from"../chunks/Tip.8d349121.js";import{C as js}from"../chunks/CopyLLMTxtMenu.53b607bf.js";import{D as k}from"../chunks/Docstring.7acc6835.js";import{C as oe}from"../chunks/CodeBlock.e52df5d6.js";import{E as mo}from"../chunks/ExampleCodeBlock.f9704f52.js";import{H as P,E as $s}from"../chunks/MermaidChart.svelte_svelte_type_style_lang.08750ec0.js";function Is(v){let a,b="Example:",p,m,y;return m=new oe({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJyaWRnZVRvd2VyTW9kZWwlMkMlMjBCcmlkZ2VUb3dlckNvbmZpZyUwQSUwQSUyMyUyMEluaXRpYWxpemluZyUyMGElMjBCcmlkZ2VUb3dlciUyMEJyaWRnZVRvd2VyJTJGYnJpZGdldG93ZXItYmFzZSUyMHN0eWxlJTIwY29uZmlndXJhdGlvbiUwQWNvbmZpZ3VyYXRpb24lMjAlM0QlMjBCcmlkZ2VUb3dlckNvbmZpZygpJTBBJTBBJTIzJTIwSW5pdGlhbGl6aW5nJTIwYSUyMG1vZGVsJTIwZnJvbSUyMHRoZSUyMEJyaWRnZVRvd2VyJTJGYnJpZGdldG93ZXItYmFzZSUyMHN0eWxlJTIwY29uZmlndXJhdGlvbiUwQW1vZGVsJTIwJTNEJTIwQnJpZGdlVG93ZXJNb2RlbChjb25maWd1cmF0aW9uKSUwQSUwQSUyMyUyMEFjY2Vzc2luZyUyMHRoZSUyMG1vZGVsJTIwY29uZmlndXJhdGlvbiUwQWNvbmZpZ3VyYXRpb24lMjAlM0QlMjBtb2RlbC5jb25maWc=",highlighted:`<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BridgeTowerModel, BridgeTowerConfig
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># Initializing a BridgeTower BridgeTower/bridgetower-base style configuration</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>configuration = BridgeTowerConfig()
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># Initializing a model from the BridgeTower/bridgetower-base style configuration</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>model = BridgeTowerModel(configuration)
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># Accessing the model configuration</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>configuration = model.config`,lang:"python",wrap:!1}}),{c(){a=d("p"),a.textContent=b,p=s(),h(m.$$.fragment)},l(r){a=c(r,"P",{"data-svelte-h":!0}),g(a)!=="svelte-11lpom8"&&(a.textContent=b),p=n(r),f(m.$$.fragment,r)},m(r,M){i(r,a,M),i(r,p,M),u(m,r,M),y=!0},p:S,i(r){y||(w(m.$$.fragment,r),y=!0)},o(r){T(m.$$.fragment,r),y=!1},d(r){r&&(t(a),t(p)),_(m,r)}}}function Cs(v){let a,b="Example:",p,m,y;return m=new oe({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJyaWRnZVRvd2VyVGV4dENvbmZpZyUwQSUwQSUyMyUyMEluaXRpYWxpemluZyUyMGElMjBCcmlkZ2VUb3dlciUyMEJyaWRnZVRvd2VyJTJGYnJpZGdldG93ZXItYmFzZSUyMHN0eWxlJTIwY29uZmlndXJhdGlvbiUyMGZvciUyMHRoZSUyMHRleHQlMjBtb2RlbCUwQWNvbmZpZ3VyYXRpb24lMjAlM0QlMjBCcmlkZ2VUb3dlclRleHRDb25maWcoKSUwQSUwQSUyMyUyMEFjY2Vzc2luZyUyMHRoZSUyMGNvbmZpZ3VyYXRpb24lMEFjb25maWd1cmF0aW9u",highlighted:`<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BridgeTowerTextConfig
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># Initializing a BridgeTower BridgeTower/bridgetower-base style configuration for the text model</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>configuration = BridgeTowerTextConfig()
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># Accessing the configuration</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>configuration`,lang:"python",wrap:!1}}),{c(){a=d("p"),a.textContent=b,p=s(),h(m.$$.fragment)},l(r){a=c(r,"P",{"data-svelte-h":!0}),g(a)!=="svelte-11lpom8"&&(a.textContent=b),p=n(r),f(m.$$.fragment,r)},m(r,M){i(r,a,M),i(r,p,M),u(m,r,M),y=!0},p:S,i(r){y||(w(m.$$.fragment,r),y=!0)},o(r){T(m.$$.fragment,r),y=!1},d(r){r&&(t(a),t(p)),_(m,r)}}}function Zs(v){let a,b="Example:",p,m,y;return m=new oe({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJyaWRnZVRvd2VyVmlzaW9uQ29uZmlnJTBBJTBBJTIzJTIwSW5pdGlhbGl6aW5nJTIwYSUyMEJyaWRnZVRvd2VyJTIwQnJpZGdlVG93ZXIlMkZicmlkZ2V0b3dlci1iYXNlJTIwc3R5bGUlMjBjb25maWd1cmF0aW9uJTIwZm9yJTIwdGhlJTIwdmlzaW9uJTIwbW9kZWwlMEFjb25maWd1cmF0aW9uJTIwJTNEJTIwQnJpZGdlVG93ZXJWaXNpb25Db25maWcoKSUwQSUwQSUyMyUyMEFjY2Vzc2luZyUyMHRoZSUyMGNvbmZpZ3VyYXRpb24lMEFjb25maWd1cmF0aW9u",highlighted:`<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BridgeTowerVisionConfig
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># Initializing a BridgeTower BridgeTower/bridgetower-base style configuration for the vision model</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>configuration = BridgeTowerVisionConfig()
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># Accessing the configuration</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>configuration`,lang:"python",wrap:!1}}),{c(){a=d("p"),a.textContent=b,p=s(),h(m.$$.fragment)},l(r){a=c(r,"P",{"data-svelte-h":!0}),g(a)!=="svelte-11lpom8"&&(a.textContent=b),p=n(r),f(m.$$.fragment,r)},m(r,M){i(r,a,M),i(r,p,M),u(m,r,M),y=!0},p:S,i(r){y||(w(m.$$.fragment,r),y=!0)},o(r){T(m.$$.fragment,r),y=!1},d(r){r&&(t(a),t(p)),_(m,r)}}}function zs(v){let a,b=`Although the recipe for forward pass needs to be defined within this function, one should call the <code>Module</code>
instance afterwards instead of this since the former takes care of running the pre and post processing steps while
the latter silently ignores them.`;return{c(){a=d("p"),a.innerHTML=b},l(p){a=c(p,"P",{"data-svelte-h":!0}),g(a)!=="svelte-fincs2"&&(a.innerHTML=b)},m(p,m){i(p,a,m)},p:S,d(p){p&&t(a)}}}function Rs(v){let a,b="Examples:",p,m,y;return m=new oe({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJyaWRnZVRvd2VyUHJvY2Vzc29yJTJDJTIwQnJpZGdlVG93ZXJNb2RlbCUwQWZyb20lMjBQSUwlMjBpbXBvcnQlMjBJbWFnZSUwQWltcG9ydCUyMGh0dHB4JTBBZnJvbSUyMGlvJTIwaW1wb3J0JTIwQnl0ZXNJTyUwQSUwQSUyMyUyMHByZXBhcmUlMjBpbWFnZSUyMGFuZCUyMHRleHQlMEF1cmwlMjAlM0QlMjAlMjJodHRwJTNBJTJGJTJGaW1hZ2VzLmNvY29kYXRhc2V0Lm9yZyUyRnZhbDIwMTclMkYwMDAwMDAwMzk3NjkuanBnJTIyJTBBd2l0aCUyMGh0dHB4LnN0cmVhbSglMjJHRVQlMjIlMkMlMjB1cmwpJTIwYXMlMjByZXNwb25zZSUzQSUwQSUyMCUyMCUyMCUyMGltYWdlJTIwJTNEJTIwSW1hZ2Uub3BlbihCeXRlc0lPKHJlc3BvbnNlLnJlYWQoKSkpJTBBdGV4dCUyMCUzRCUyMCUyMmhlbGxvJTIwd29ybGQlMjIlMEFwcm9jZXNzb3IlMjAlM0QlMjBCcmlkZ2VUb3dlclByb2Nlc3Nvci5mcm9tX3ByZXRyYWluZWQoJTIyQnJpZGdlVG93ZXIlMkZicmlkZ2V0b3dlci1iYXNlJTIyKSUwQW1vZGVsJTIwJTNEJTIwQnJpZGdlVG93ZXJNb2RlbC5mcm9tX3ByZXRyYWluZWQoJTIyQnJpZGdlVG93ZXIlMkZicmlkZ2V0b3dlci1iYXNlJTIyKSUwQSUwQWlucHV0cyUyMCUzRCUyMHByb2Nlc3NvcihpbWFnZSUyQyUyMHRleHQlMkMlMjByZXR1cm5fdGVuc29ycyUzRCUyMnB0JTIyKSUwQW91dHB1dHMlMjAlM0QlMjBtb2RlbCgqKmlucHV0cyklMEFvdXRwdXRzLmtleXMoKQ==",highlighted:`<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BridgeTowerProcessor, BridgeTowerModel
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">import</span> httpx
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> io <span class="hljs-keyword">import</span> BytesIO
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># prepare image and text</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>url = <span class="hljs-string">&quot;http://images.cocodataset.org/val2017/000000039769.jpg&quot;</span>
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">with</span> httpx.stream(<span class="hljs-string">&quot;GET&quot;</span>, url) <span class="hljs-keyword">as</span> response:
<span class="hljs-meta">... </span> image = Image.<span class="hljs-built_in">open</span>(BytesIO(response.read()))
<span class="hljs-meta">&gt;&gt;&gt; </span>text = <span class="hljs-string">&quot;hello world&quot;</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>processor = BridgeTowerProcessor.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-base&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span>model = BridgeTowerModel.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-base&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span>inputs = processor(image, text, return_tensors=<span class="hljs-string">&quot;pt&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span>outputs = model(**inputs)
<span class="hljs-meta">&gt;&gt;&gt; </span>outputs.keys()
odict_keys([<span class="hljs-string">&#x27;text_features&#x27;</span>, <span class="hljs-string">&#x27;image_features&#x27;</span>, <span class="hljs-string">&#x27;pooler_output&#x27;</span>])`,lang:"python",wrap:!1}}),{c(){a=d("p"),a.textContent=b,p=s(),h(m.$$.fragment)},l(r){a=c(r,"P",{"data-svelte-h":!0}),g(a)!=="svelte-kvfsh7"&&(a.textContent=b),p=n(r),f(m.$$.fragment,r)},m(r,M){i(r,a,M),i(r,p,M),u(m,r,M),y=!0},p:S,i(r){y||(w(m.$$.fragment,r),y=!0)},o(r){T(m.$$.fragment,r),y=!1},d(r){r&&(t(a),t(p)),_(m,r)}}}function Fs(v){let a,b=`Although the recipe for forward pass needs to be defined within this function, one should call the <code>Module</code>
instance afterwards instead of this since the former takes care of running the pre and post processing steps while
the latter silently ignores them.`;return{c(){a=d("p"),a.innerHTML=b},l(p){a=c(p,"P",{"data-svelte-h":!0}),g(a)!=="svelte-fincs2"&&(a.innerHTML=b)},m(p,m){i(p,a,m)},p:S,d(p){p&&t(a)}}}function Ns(v){let a,b="Examples:",p,m,y;return m=new oe({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJyaWRnZVRvd2VyUHJvY2Vzc29yJTJDJTIwQnJpZGdlVG93ZXJGb3JDb250cmFzdGl2ZUxlYXJuaW5nJTBBaW1wb3J0JTIwaHR0cHglMEFmcm9tJTIwaW8lMjBpbXBvcnQlMjBCeXRlc0lPJTBBZnJvbSUyMFBJTCUyMGltcG9ydCUyMEltYWdlJTBBaW1wb3J0JTIwdG9yY2glMEElMEFpbWFnZV91cmxzJTIwJTNEJTIwJTVCJTBBJTIwJTIwJTIwJTIwJTIyaHR0cHMlM0ElMkYlMkZmYXJtNC5zdGF0aWNmbGlja3IuY29tJTJGMzM5NSUyRjM0MjgyNzg0MTVfODFjM2UyN2YxNV96LmpwZyUyMiUyQyUwQSUyMCUyMCUyMCUyMCUyMmh0dHAlM0ElMkYlMkZpbWFnZXMuY29jb2RhdGFzZXQub3JnJTJGdmFsMjAxNyUyRjAwMDAwMDAzOTc2OS5qcGclMjIlMkMlMEElNUQlMEF0ZXh0cyUyMCUzRCUyMCU1QiUyMnR3byUyMGRvZ3MlMjBpbiUyMGElMjBjYXIlMjIlMkMlMjAlMjJ0d28lMjBjYXRzJTIwc2xlZXBpbmclMjBvbiUyMGElMjBjb3VjaCUyMiU1RCUwQSUwQXdpdGglMjBodHRweC5zdHJlYW0oJTIyR0VUJTIyJTJDJTIwdXJscyU1QjAlNUQpJTIwYXMlMjByZXNwb25zZSUzQSUwQSUyMCUyMCUyMCUyMGltYWdlMSUyMCUzRCUyMEltYWdlLm9wZW4oQnl0ZXNJTyhyZXNwb25zZS5yZWFkKCkpKSUwQSUwQXdpdGglMjBodHRweC5zdHJlYW0oJTIyR0VUJTIyJTJDJTIwdXJscyU1QjElNUQpJTIwYXMlMjByZXNwb25zZSUzQSUwQSUyMCUyMCUyMCUyMGltYWdlMiUyMCUzRCUyMEltYWdlLm9wZW4oQnl0ZXNJTyhyZXNwb25zZS5yZWFkKCkpKSUwQSUwQWltYWdlcyUyMCUzRCUyMCU1QmltYWdlMSUyQyUyMGltYWdlMiU1RCUwQSUwQXByb2Nlc3NvciUyMCUzRCUyMEJyaWRnZVRvd2VyUHJvY2Vzc29yLmZyb21fcHJldHJhaW5lZCglMjJCcmlkZ2VUb3dlciUyRmJyaWRnZXRvd2VyLWxhcmdlLWl0bS1tbG0taXRjJTIyKSUwQW1vZGVsJTIwJTNEJTIwQnJpZGdlVG93ZXJGb3JDb250cmFzdGl2ZUxlYXJuaW5nLmZyb21fcHJldHJhaW5lZCglMjJCcmlkZ2VUb3dlciUyRmJyaWRnZXRvd2VyLWxhcmdlLWl0bS1tbG0taXRjJTIyKSUwQSUwQWlucHV0cyUyMCUzRCUyMHByb2Nlc3NvcihpbWFnZXMlMkMlMjB0ZXh0cyUyQyUyMHBhZGRpbmclM0RUcnVlJTJDJTIwcmV0dXJuX3RlbnNvcnMlM0QlMjJwdCUyMiklMEFsb3NzJTIwJTNEJTIwbW9kZWwoKippbnB1dHMlMkMlMjByZXR1cm5fbG9zcyUzRFRydWUpLmxvc3MlMEElMEFpbnB1dHMlMjAlM0QlMjBwcm9jZXNzb3IoaW1hZ2VzJTJDJTIwdGV4dHMlNUIlM0ElM0EtMSU1RCUyQyUyMHBhZGRpbmclM0RUcnVlJTJDJTIwcmV0dXJuX3RlbnNvcnMlM0QlMjJwdCUyMiklMEFsb3NzX3N3YXBwZWQlMjAlM0QlMjBtb2RlbCgqKmlucHV0cyUyQyUyMHJldHVybl9sb3NzJTNEVHJ1ZSkubG9zcyUwQSUwQXByaW50KCUyMkxvc3MlMjIlMkMlMjByb3VuZChsb3NzLml0ZW0oKSUyQyUyMDQpKSUwQSUwQXByaW50KCUyMkxvc3MlMjB3aXRoJTIwc3dhcHBlZCUyMGltYWdlcyUyMiUyQyUyMHJvdW5kKGxvc3Nfc3dhcHBlZC5pdGVtKCklMkMlMjA0KSk=",highlighted:`<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BridgeTowerProcessor, BridgeTowerForContrastiveLearning
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">import</span> httpx
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> io <span class="hljs-keyword">import</span> BytesIO
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">import</span> torch
<span class="hljs-meta">&gt;&gt;&gt; </span>image_urls = [
<span class="hljs-meta">... </span> <span class="hljs-string">&quot;https://farm4.staticflickr.com/3395/3428278415_81c3e27f15_z.jpg&quot;</span>,
<span class="hljs-meta">... </span> <span class="hljs-string">&quot;http://images.cocodataset.org/val2017/000000039769.jpg&quot;</span>,
<span class="hljs-meta">... </span>]
<span class="hljs-meta">&gt;&gt;&gt; </span>texts = [<span class="hljs-string">&quot;two dogs in a car&quot;</span>, <span class="hljs-string">&quot;two cats sleeping on a couch&quot;</span>]
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">with</span> httpx.stream(<span class="hljs-string">&quot;GET&quot;</span>, urls[<span class="hljs-number">0</span>]) <span class="hljs-keyword">as</span> response:
<span class="hljs-meta">... </span> image1 = Image.<span class="hljs-built_in">open</span>(BytesIO(response.read()))
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">with</span> httpx.stream(<span class="hljs-string">&quot;GET&quot;</span>, urls[<span class="hljs-number">1</span>]) <span class="hljs-keyword">as</span> response:
<span class="hljs-meta">... </span> image2 = Image.<span class="hljs-built_in">open</span>(BytesIO(response.read()))
<span class="hljs-meta">&gt;&gt;&gt; </span>images = [image1, image2]
<span class="hljs-meta">&gt;&gt;&gt; </span>processor = BridgeTowerProcessor.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-large-itm-mlm-itc&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span>model = BridgeTowerForContrastiveLearning.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-large-itm-mlm-itc&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span>inputs = processor(images, texts, padding=<span class="hljs-literal">True</span>, return_tensors=<span class="hljs-string">&quot;pt&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span>loss = model(**inputs, return_loss=<span class="hljs-literal">True</span>).loss
<span class="hljs-meta">&gt;&gt;&gt; </span>inputs = processor(images, texts[::-<span class="hljs-number">1</span>], padding=<span class="hljs-literal">True</span>, return_tensors=<span class="hljs-string">&quot;pt&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span>loss_swapped = model(**inputs, return_loss=<span class="hljs-literal">True</span>).loss
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-built_in">print</span>(<span class="hljs-string">&quot;Loss&quot;</span>, <span class="hljs-built_in">round</span>(loss.item(), <span class="hljs-number">4</span>))
Loss <span class="hljs-number">0.0019</span>
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-built_in">print</span>(<span class="hljs-string">&quot;Loss with swapped images&quot;</span>, <span class="hljs-built_in">round</span>(loss_swapped.item(), <span class="hljs-number">4</span>))
Loss <span class="hljs-keyword">with</span> swapped images <span class="hljs-number">2.126</span>`,lang:"python",wrap:!1}}),{c(){a=d("p"),a.textContent=b,p=s(),h(m.$$.fragment)},l(r){a=c(r,"P",{"data-svelte-h":!0}),g(a)!=="svelte-kvfsh7"&&(a.textContent=b),p=n(r),f(m.$$.fragment,r)},m(r,M){i(r,a,M),i(r,p,M),u(m,r,M),y=!0},p:S,i(r){y||(w(m.$$.fragment,r),y=!0)},o(r){T(m.$$.fragment,r),y=!1},d(r){r&&(t(a),t(p)),_(m,r)}}}function Ls(v){let a,b=`Although the recipe for forward pass needs to be defined within this function, one should call the <code>Module</code>
instance afterwards instead of this since the former takes care of running the pre and post processing steps while
the latter silently ignores them.`;return{c(){a=d("p"),a.innerHTML=b},l(p){a=c(p,"P",{"data-svelte-h":!0}),g(a)!=="svelte-fincs2"&&(a.innerHTML=b)},m(p,m){i(p,a,m)},p:S,d(p){p&&t(a)}}}function Ws(v){let a,b="Examples:",p,m,y;return m=new oe({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJyaWRnZVRvd2VyUHJvY2Vzc29yJTJDJTIwQnJpZGdlVG93ZXJGb3JNYXNrZWRMTSUwQWZyb20lMjBQSUwlMjBpbXBvcnQlMjBJbWFnZSUwQWltcG9ydCUyMGh0dHB4JTBBZnJvbSUyMGlvJTIwaW1wb3J0JTIwQnl0ZXNJTyUwQSUwQXVybCUyMCUzRCUyMCUyMmh0dHAlM0ElMkYlMkZpbWFnZXMuY29jb2RhdGFzZXQub3JnJTJGdmFsMjAxNyUyRjAwMDAwMDM2MDk0My5qcGclMjIlMEF3aXRoJTIwaHR0cHguc3RyZWFtKCUyMkdFVCUyMiUyQyUyMHVybCklMjBhcyUyMHJlc3BvbnNlJTNBJTBBJTIwJTIwJTIwJTIwaW1hZ2UlMjAlM0QlMjBJbWFnZS5vcGVuKEJ5dGVzSU8ocmVzcG9uc2UucmVhZCgpKSkuY29udmVydCglMjJSR0IlMjIpJTBBdGV4dCUyMCUzRCUyMCUyMmElMjAlM0NtYXNrJTNFJTIwbG9va2luZyUyMG91dCUyMG9mJTIwdGhlJTIwd2luZG93JTIyJTBBJTBBcHJvY2Vzc29yJTIwJTNEJTIwQnJpZGdlVG93ZXJQcm9jZXNzb3IuZnJvbV9wcmV0cmFpbmVkKCUyMkJyaWRnZVRvd2VyJTJGYnJpZGdldG93ZXItYmFzZS1pdG0tbWxtJTIyKSUwQW1vZGVsJTIwJTNEJTIwQnJpZGdlVG93ZXJGb3JNYXNrZWRMTS5mcm9tX3ByZXRyYWluZWQoJTIyQnJpZGdlVG93ZXIlMkZicmlkZ2V0b3dlci1iYXNlLWl0bS1tbG0lMjIpJTBBJTBBJTIzJTIwcHJlcGFyZSUyMGlucHV0cyUwQWVuY29kaW5nJTIwJTNEJTIwcHJvY2Vzc29yKGltYWdlJTJDJTIwdGV4dCUyQyUyMHJldHVybl90ZW5zb3JzJTNEJTIycHQlMjIpJTBBJTBBJTIzJTIwZm9yd2FyZCUyMHBhc3MlMEFvdXRwdXRzJTIwJTNEJTIwbW9kZWwoKiplbmNvZGluZyklMEElMEFyZXN1bHRzJTIwJTNEJTIwcHJvY2Vzc29yLmRlY29kZShvdXRwdXRzLmxvZ2l0cy5hcmdtYXgoZGltJTNELTEpLnNxdWVlemUoMCkudG9saXN0KCkpJTBBJTBBcHJpbnQocmVzdWx0cyk=",highlighted:`<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BridgeTowerProcessor, BridgeTowerForMaskedLM
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">import</span> httpx
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> io <span class="hljs-keyword">import</span> BytesIO
<span class="hljs-meta">&gt;&gt;&gt; </span>url = <span class="hljs-string">&quot;http://images.cocodataset.org/val2017/000000360943.jpg&quot;</span>
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">with</span> httpx.stream(<span class="hljs-string">&quot;GET&quot;</span>, url) <span class="hljs-keyword">as</span> response:
<span class="hljs-meta">... </span> image = Image.<span class="hljs-built_in">open</span>(BytesIO(response.read())).convert(<span class="hljs-string">&quot;RGB&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span>text = <span class="hljs-string">&quot;a &lt;mask&gt; looking out of the window&quot;</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>processor = BridgeTowerProcessor.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-base-itm-mlm&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span>model = BridgeTowerForMaskedLM.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-base-itm-mlm&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># prepare inputs</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>encoding = processor(image, text, return_tensors=<span class="hljs-string">&quot;pt&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># forward pass</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>outputs = model(**encoding)
<span class="hljs-meta">&gt;&gt;&gt; </span>results = processor.decode(outputs.logits.argmax(dim=-<span class="hljs-number">1</span>).squeeze(<span class="hljs-number">0</span>).tolist())
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-built_in">print</span>(results)
.a cat looking out of the window.`,lang:"python",wrap:!1}}),{c(){a=d("p"),a.textContent=b,p=s(),h(m.$$.fragment)},l(r){a=c(r,"P",{"data-svelte-h":!0}),g(a)!=="svelte-kvfsh7"&&(a.textContent=b),p=n(r),f(m.$$.fragment,r)},m(r,M){i(r,a,M),i(r,p,M),u(m,r,M),y=!0},p:S,i(r){y||(w(m.$$.fragment,r),y=!0)},o(r){T(m.$$.fragment,r),y=!1},d(r){r&&(t(a),t(p)),_(m,r)}}}function Vs(v){let a,b=`Although the recipe for forward pass needs to be defined within this function, one should call the <code>Module</code>
instance afterwards instead of this since the former takes care of running the pre and post processing steps while
the latter silently ignores them.`;return{c(){a=d("p"),a.innerHTML=b},l(p){a=c(p,"P",{"data-svelte-h":!0}),g(a)!=="svelte-fincs2"&&(a.innerHTML=b)},m(p,m){i(p,a,m)},p:S,d(p){p&&t(a)}}}function Ps(v){let a,b="Examples:",p,m,y;return m=new oe({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJyaWRnZVRvd2VyUHJvY2Vzc29yJTJDJTIwQnJpZGdlVG93ZXJGb3JJbWFnZUFuZFRleHRSZXRyaWV2YWwlMEFpbXBvcnQlMjBodHRweCUwQWZyb20lMjBpbyUyMGltcG9ydCUyMEJ5dGVzSU8lMEFmcm9tJTIwUElMJTIwaW1wb3J0JTIwSW1hZ2UlMEElMEF1cmwlMjAlM0QlMjAlMjJodHRwJTNBJTJGJTJGaW1hZ2VzLmNvY29kYXRhc2V0Lm9yZyUyRnZhbDIwMTclMkYwMDAwMDAwMzk3NjkuanBnJTIyJTBBd2l0aCUyMGh0dHB4LnN0cmVhbSglMjJHRVQlMjIlMkMlMjB1cmwpJTIwYXMlMjByZXNwb25zZSUzQSUwQSUyMCUyMCUyMCUyMGltYWdlJTIwJTNEJTIwSW1hZ2Uub3BlbihCeXRlc0lPKHJlc3BvbnNlLnJlYWQoKSkpJTBBdGV4dHMlMjAlM0QlMjAlNUIlMjJBbiUyMGltYWdlJTIwb2YlMjB0d28lMjBjYXRzJTIwY2hpbGxpbmclMjBvbiUyMGElMjBjb3VjaCUyMiUyQyUyMCUyMkElMjBmb290YmFsbCUyMHBsYXllciUyMHNjb3JpbmclMjBhJTIwZ29hbCUyMiU1RCUwQSUwQXByb2Nlc3NvciUyMCUzRCUyMEJyaWRnZVRvd2VyUHJvY2Vzc29yLmZyb21fcHJldHJhaW5lZCglMjJCcmlkZ2VUb3dlciUyRmJyaWRnZXRvd2VyLWJhc2UtaXRtLW1sbSUyMiklMEFtb2RlbCUyMCUzRCUyMEJyaWRnZVRvd2VyRm9ySW1hZ2VBbmRUZXh0UmV0cmlldmFsLmZyb21fcHJldHJhaW5lZCglMjJCcmlkZ2VUb3dlciUyRmJyaWRnZXRvd2VyLWJhc2UtaXRtLW1sbSUyMiklMEElMEElMjMlMjBmb3J3YXJkJTIwcGFzcyUwQXNjb3JlcyUyMCUzRCUyMGRpY3QoKSUwQWZvciUyMHRleHQlMjBpbiUyMHRleHRzJTNBJTBBJTIwJTIwJTIwJTIwJTIzJTIwcHJlcGFyZSUyMGlucHV0cyUwQSUyMCUyMCUyMCUyMGVuY29kaW5nJTIwJTNEJTIwcHJvY2Vzc29yKGltYWdlJTJDJTIwdGV4dCUyQyUyMHJldHVybl90ZW5zb3JzJTNEJTIycHQlMjIpJTBBJTIwJTIwJTIwJTIwb3V0cHV0cyUyMCUzRCUyMG1vZGVsKCoqZW5jb2RpbmcpJTBBJTIwJTIwJTIwJTIwc2NvcmVzJTVCdGV4dCU1RCUyMCUzRCUyMG91dHB1dHMubG9naXRzJTVCMCUyQyUyMDElNUQuaXRlbSgp",highlighted:`<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BridgeTowerProcessor, BridgeTowerForImageAndTextRetrieval
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">import</span> httpx
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> io <span class="hljs-keyword">import</span> BytesIO
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image
<span class="hljs-meta">&gt;&gt;&gt; </span>url = <span class="hljs-string">&quot;http://images.cocodataset.org/val2017/000000039769.jpg&quot;</span>
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">with</span> httpx.stream(<span class="hljs-string">&quot;GET&quot;</span>, url) <span class="hljs-keyword">as</span> response:
<span class="hljs-meta">... </span> image = Image.<span class="hljs-built_in">open</span>(BytesIO(response.read()))
<span class="hljs-meta">&gt;&gt;&gt; </span>texts = [<span class="hljs-string">&quot;An image of two cats chilling on a couch&quot;</span>, <span class="hljs-string">&quot;A football player scoring a goal&quot;</span>]
<span class="hljs-meta">&gt;&gt;&gt; </span>processor = BridgeTowerProcessor.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-base-itm-mlm&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span>model = BridgeTowerForImageAndTextRetrieval.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-base-itm-mlm&quot;</span>)
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-comment"># forward pass</span>
<span class="hljs-meta">&gt;&gt;&gt; </span>scores = <span class="hljs-built_in">dict</span>()
<span class="hljs-meta">&gt;&gt;&gt; </span><span class="hljs-keyword">for</span> text <span class="hljs-keyword">in</span> texts:
<span class="hljs-meta">... </span> <span class="hljs-comment"># prepare inputs</span>
<span class="hljs-meta">... </span> encoding = processor(image, text, return_tensors=<span class="hljs-string">&quot;pt&quot;</span>)
<span class="hljs-meta">... </span> outputs = model(**encoding)
<span class="hljs-meta">... </span> scores[text] = outputs.logits[<span class="hljs-number">0</span>, <span class="hljs-number">1</span>].item()`,lang:"python",wrap:!1}}),{c(){a=d("p"),a.textContent=b,p=s(),h(m.$$.fragment)},l(r){a=c(r,"P",{"data-svelte-h":!0}),g(a)!=="svelte-kvfsh7"&&(a.textContent=b),p=n(r),f(m.$$.fragment,r)},m(r,M){i(r,a,M),i(r,p,M),u(m,r,M),y=!0},p:S,i(r){y||(w(m.$$.fragment,r),y=!0)},o(r){T(m.$$.fragment,r),y=!1},d(r){r&&(t(a),t(p)),_(m,r)}}}function Gs(v){let a,b,p,m,y,r="<em>This model was published in HF papers on 2022-06-17 and contributed to Hugging Face Transformers on 2023-01-25.</em>",M,ue,Yo,we,Ao,Te,Do,_e,Zr=`The BridgeTower model was proposed in <a href="https://huggingface.co/papers/2206.08657" rel="nofollow">BridgeTower: Building Bridges Between Encoders in Vision-Language Representative Learning</a> by Xiao Xu, Chenfei Wu, Shachar Rosenman, Vasudev Lal, Wanxiang Che, Nan Duan. The goal of this model is to build a
bridge between each uni-modal encoder and the cross-modal encoder to enable comprehensive and detailed interaction at each layer of the cross-modal encoder thus achieving remarkable performance on various downstream tasks with almost negligible additional performance and computational costs.`,Ko,ye,zr='This paper has been accepted to the <a href="https://aaai.org/Conferences/AAAI-23/" rel="nofollow">AAAI’23</a> conference.',Oo,be,Rr="The abstract from the paper is the following:",et,Me,Fr=`<em>Vision-Language (VL) models with the TWO-TOWER architecture have dominated visual-language representation learning in recent years.
Current VL models either use lightweight uni-modal encoders and learn to extract, align and fuse both modalities simultaneously in a deep cross-modal encoder, or feed the last-layer uni-modal representations from the deep pre-trained uni-modal encoders into the top cross-modal encoder.
Both approaches potentially restrict vision-language representation learning and limit model performance. In this paper, we propose BRIDGETOWER, which introduces multiple bridge layers that build a connection between the top layers of uni-modal encoders and each layer of the crossmodal encoder.
This enables effective bottom-up cross-modal alignment and fusion between visual and textual representations of different semantic levels of pre-trained uni-modal encoders in the cross-modal encoder. Pre-trained with only 4M images, BRIDGETOWER achieves state-of-the-art performance on various downstream vision-language tasks.
In particular, on the VQAv2 test-std set, BRIDGETOWER achieves an accuracy of 78.73%, outperforming the previous state-of-the-art model METER by 1.09% with the same pre-training data and almost negligible additional parameters and computational costs.
Notably, when further scaling the model, BRIDGETOWER achieves an accuracy of 81.15%, surpassing models that are pre-trained on orders-of-magnitude larger datasets.</em>`,ot,se,Nr,tt,ve,Lr='BridgeTower architecture. Taken from the <a href="https://huggingface.co/papers/2206.08657">original paper.</a>',rt,Be,Wr='This model was contributed by <a href="https://huggingface.co/anahita-b" rel="nofollow">Anahita Bhiwandiwalla</a>, <a href="https://huggingface.co/Tile" rel="nofollow">Tiep Le</a> and <a href="https://huggingface.co/shaoyent" rel="nofollow">Shaoyen Tseng</a>. The original code can be found <a href="https://github.com/microsoft/BridgeTower" rel="nofollow">here</a>.',st,Je,nt,ke,Vr=`BridgeTower consists of a visual encoder, a textual encoder and cross-modal encoder with multiple lightweight bridge layers.
The goal of this approach was to build a bridge between each uni-modal encoder and the cross-modal encoder to enable comprehensive and detailed interaction at each layer of the cross-modal encoder.
In principle, one can apply any visual, textual or cross-modal encoder in the proposed architecture.`,at,xe,Pr=`The <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerProcessor">BridgeTowerProcessor</a> wraps <a href="/docs/transformers/pr_43265/en/model_doc/led#transformers.RobertaTokenizer">RobertaTokenizer</a> and <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">BridgeTowerImageProcessor</a> into a single instance to both
encode the text and prepare the images respectively.`,it,Ue,Gr='The following example shows how to run contrastive learning using <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerProcessor">BridgeTowerProcessor</a> and <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerForContrastiveLearning">BridgeTowerForContrastiveLearning</a>.',lt,je,dt,$e,Hr='The following example shows how to run image-text retrieval using <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerProcessor">BridgeTowerProcessor</a> and <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerForImageAndTextRetrieval">BridgeTowerForImageAndTextRetrieval</a>.',ct,Ie,mt,Ce,Xr='The following example shows how to run masked language modeling using <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerProcessor">BridgeTowerProcessor</a> and <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerForMaskedLM">BridgeTowerForMaskedLM</a>.',pt,Ze,gt,ze,Er="Tips:",ht,Re,qr='<li>This implementation of BridgeTower uses <a href="/docs/transformers/pr_43265/en/model_doc/led#transformers.RobertaTokenizer">RobertaTokenizer</a> to generate text embeddings and OpenAI’s CLIP/ViT model to compute visual embeddings.</li> <li>Checkpoints for pre-trained <a href="https://huggingface.co/BridgeTower/bridgetower-base" rel="nofollow">bridgeTower-base</a> and <a href="https://huggingface.co/BridgeTower/bridgetower-base-itm-mlm" rel="nofollow">bridgetower masked language modeling and image text matching</a> are released.</li> <li>Please refer to <a href="https://huggingface.co/papers/2206.08657" rel="nofollow">Table 5</a> for BridgeTower’s performance on Image Retrieval and other down stream tasks.</li>',ft,Fe,ut,R,Ne,Wt,po,Qr=`This is the configuration class to store the configuration of a BridgeTowerModel. It is used to instantiate a Bridgetower
model according to the specified arguments, defining the model architecture. Instantiating a configuration with the
defaults will yield a similar configuration to that of the <a href="https://huggingface.co/BridgeTower/bridgetower-base" rel="nofollow">BridgeTower/bridgetower-base</a>`,Vt,go,Sr=`Configuration objects inherit from <a href="/docs/transformers/pr_43265/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> and can be used to control the model outputs. Read the
documentation from <a href="/docs/transformers/pr_43265/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> for more information.`,Pt,ne,wt,Le,Tt,F,We,Gt,ho,Yr=`This is the configuration class to store the configuration of a BridgeTowerModel. It is used to instantiate a Bridgetower
model according to the specified arguments, defining the model architecture. Instantiating a configuration with the
defaults will yield a similar configuration to that of the <a href="https://huggingface.co/BridgeTower/bridgetower-base" rel="nofollow">BridgeTower/bridgetower-base</a>`,Ht,fo,Ar=`Configuration objects inherit from <a href="/docs/transformers/pr_43265/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> and can be used to control the model outputs. Read the
documentation from <a href="/docs/transformers/pr_43265/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> for more information.`,Xt,ae,_t,Ve,yt,N,Pe,Et,uo,Dr=`This is the configuration class to store the configuration of a BridgeTowerModel. It is used to instantiate a Bridgetower
model according to the specified arguments, defining the model architecture. Instantiating a configuration with the
defaults will yield a similar configuration to that of the <a href="https://huggingface.co/BridgeTower/bridgetower-base" rel="nofollow">BridgeTower/bridgetower-base</a>`,qt,wo,Kr=`Configuration objects inherit from <a href="/docs/transformers/pr_43265/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> and can be used to control the model outputs. Read the
documentation from <a href="/docs/transformers/pr_43265/en/main_classes/configuration#transformers.PreTrainedConfig">PreTrainedConfig</a> for more information.`,Qt,ie,bt,Ge,Mt,G,He,St,To,Or="Constructs a BridgeTowerImageProcessor image processor.",Yt,_o,Xe,vt,Ee,Bt,H,qe,At,yo,es="Constructs a BridgeTowerImageProcessor image processor.",Dt,bo,Qe,Jt,Se,kt,L,Ye,Kt,Mo,os="Constructs a BridgeTowerProcessor which wraps a image processor and a tokenizer into a single processor.",Ot,vo,ts=`<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerProcessor">BridgeTowerProcessor</a> offers all the functionalities of <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">BridgeTowerImageProcessor</a> and <a href="/docs/transformers/pr_43265/en/model_doc/led#transformers.RobertaTokenizer">RobertaTokenizer</a>. See the
<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">~BridgeTowerImageProcessor</a> and <a href="/docs/transformers/pr_43265/en/model_doc/led#transformers.RobertaTokenizer">~RobertaTokenizer</a> for more information.`,er,Bo,Ae,xt,De,Ut,x,Ke,or,Jo,rs="The bare BridgeTower Model transformer outputting BridgeTowerModelOutput object without any specific head on",tr,ko,ss=`This model inherits from <a href="/docs/transformers/pr_43265/en/main_classes/model#transformers.PreTrainedModel">PreTrainedModel</a>. Check the superclass documentation for the generic methods the
library implements for all its model (such as downloading or saving, resizing the input embeddings, pruning heads
etc.)`,rr,xo,ns=`This model is also a PyTorch <a href="https://pytorch.org/docs/stable/nn.html#torch.nn.Module" rel="nofollow">torch.nn.Module</a> subclass.
Use it as a regular PyTorch Module and refer to the PyTorch documentation for all matter related to general usage
and behavior.`,sr,I,Oe,nr,Uo,as='The <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerModel">BridgeTowerModel</a> forward method, overrides the <code>__call__</code> special method.',ar,le,ir,jo,is=`<li><p><strong>text_features</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, text_sequence_length, hidden_size)</code>) — Sequence of hidden-states at the text output of the last layer of the model.</p></li> <li><p><strong>image_features</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, image_sequence_length, hidden_size)</code>) — Sequence of hidden-states at the image output of the last layer of the model.</p></li> <li><p><strong>pooler_output</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, hidden_size x 2)</code>) — Concatenation of last layer hidden-state of the first token of the text and image sequence (classification
token), respectively, after further processing through layers used for auxiliary pretraining tasks.</p></li> <li><p><strong>hidden_states</strong> (<code>tuple[torch.FloatTensor]</code>, <em>optional</em>, returned when <code>output_hidden_states=True</code> is passed or when <code>config.output_hidden_states=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for the output of the embeddings, if the model has an embedding layer, +
one for the output of each layer) of shape <code>(batch_size, sequence_length, hidden_size)</code>.</p> <p>Hidden-states of the model at the output of each layer plus the optional initial embedding outputs.</p></li> <li><p><strong>attentions</strong> (<code>tuple[torch.FloatTensor]</code>, <em>optional</em>, returned when <code>output_attentions=True</code> is passed or when <code>config.output_attentions=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for each layer) of shape <code>(batch_size, num_heads, sequence_length, sequence_length)</code>.</p> <p>Attentions weights after the attention softmax, used to compute the weighted average in the self-attention
heads.</p></li>`,lr,de,jt,eo,$t,U,oo,dr,$o,ls="BridgeTower Model with a image-text contrastive head on top computing image-text contrastive loss.",cr,Io,ds=`This model inherits from <a href="/docs/transformers/pr_43265/en/main_classes/model#transformers.PreTrainedModel">PreTrainedModel</a>. Check the superclass documentation for the generic methods the
library implements for all its model (such as downloading or saving, resizing the input embeddings, pruning heads
etc.)`,mr,Co,cs=`This model is also a PyTorch <a href="https://pytorch.org/docs/stable/nn.html#torch.nn.Module" rel="nofollow">torch.nn.Module</a> subclass.
Use it as a regular PyTorch Module and refer to the PyTorch documentation for all matter related to general usage
and behavior.`,pr,C,to,gr,Zo,ms='The <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerForContrastiveLearning">BridgeTowerForContrastiveLearning</a> forward method, overrides the <code>__call__</code> special method.',hr,ce,fr,zo,ps=`<li><p><strong>loss</strong> (<code>torch.FloatTensor</code> of shape <code>(1,)</code>, <em>optional</em>, returned when <code>return_loss</code> is <code>True</code>) — Image-text contrastive loss.</p></li> <li><p><strong>logits</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, config.vocab_size)</code>) — Prediction scores of the language modeling head (scores for each vocabulary token before SoftMax).</p></li> <li><p><strong>text_embeds</strong> (<code>torch.FloatTensor)</code>, <em>optional</em>, returned when model is initialized with <code>with_projection=True</code>) — The text embeddings obtained by applying the projection layer to the pooler_output.</p></li> <li><p><strong>image_embeds</strong> (<code>torch.FloatTensor)</code>, <em>optional</em>, returned when model is initialized with <code>with_projection=True</code>) — The image embeddings obtained by applying the projection layer to the pooler_output.</p></li> <li><p><strong>cross_embeds</strong> (<code>torch.FloatTensor)</code>, <em>optional</em>, returned when model is initialized with <code>with_projection=True</code>) — The text-image cross-modal embeddings obtained by applying the projection layer to the pooler_output.</p></li> <li><p><strong>hidden_states</strong> (<code>tuple[torch.FloatTensor]</code>, <em>optional</em>, returned when <code>output_hidden_states=True</code> is passed or when <code>config.output_hidden_states=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for the output of the embeddings, if the model has an embedding layer, +
one for the output of each layer) of shape <code>(batch_size, sequence_length, hidden_size)</code>.</p> <p>Hidden-states of the model at the output of each layer plus the optional initial embedding outputs.</p></li> <li><p><strong>attentions</strong> (<code>tuple(torch.FloatTensor)</code>, <em>optional</em>, returned when <code>output_attentions=True</code> is passed or when <code>config.output_attentions=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for each layer) of shape <code>(batch_size, num_heads, sequence_length, sequence_length)</code>.</p></li>`,ur,me,It,ro,Ct,j,so,wr,Ro,gs="BridgeTower Model with a language modeling head on top as done during pretraining.",Tr,Fo,hs=`This model inherits from <a href="/docs/transformers/pr_43265/en/main_classes/model#transformers.PreTrainedModel">PreTrainedModel</a>. Check the superclass documentation for the generic methods the
library implements for all its model (such as downloading or saving, resizing the input embeddings, pruning heads
etc.)`,_r,No,fs=`This model is also a PyTorch <a href="https://pytorch.org/docs/stable/nn.html#torch.nn.Module" rel="nofollow">torch.nn.Module</a> subclass.
Use it as a regular PyTorch Module and refer to the PyTorch documentation for all matter related to general usage
and behavior.`,yr,Z,no,br,Lo,us='The <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerForMaskedLM">BridgeTowerForMaskedLM</a> forward method, overrides the <code>__call__</code> special method.',Mr,pe,vr,Wo,ws=`<li><p><strong>loss</strong> (<code>torch.FloatTensor</code> of shape <code>(1,)</code>, <em>optional</em>, returned when <code>labels</code> is provided) — Masked language modeling (MLM) loss.</p></li> <li><p><strong>logits</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, config.vocab_size)</code>) — Prediction scores of the language modeling head (scores for each vocabulary token before SoftMax).</p></li> <li><p><strong>hidden_states</strong> (<code>tuple(torch.FloatTensor)</code>, <em>optional</em>, returned when <code>output_hidden_states=True</code> is passed or when <code>config.output_hidden_states=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for the output of the embeddings, if the model has an embedding layer, +
one for the output of each layer) of shape <code>(batch_size, sequence_length, hidden_size)</code>.</p> <p>Hidden-states of the model at the output of each layer plus the optional initial embedding outputs.</p></li> <li><p><strong>attentions</strong> (<code>tuple(torch.FloatTensor)</code>, <em>optional</em>, returned when <code>output_attentions=True</code> is passed or when <code>config.output_attentions=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for each layer) of shape <code>(batch_size, num_heads, sequence_length, sequence_length)</code>.</p> <p>Attentions weights after the attention softmax, used to compute the weighted average in the self-attention
heads.</p></li>`,Br,ge,Zt,ao,zt,$,io,Jr,Vo,Ts=`BridgeTower Model transformer with a classifier head on top (a linear layer on top of the final hidden state of the
[CLS] token) for image-to-text matching.`,kr,Po,_s=`This model inherits from <a href="/docs/transformers/pr_43265/en/main_classes/model#transformers.PreTrainedModel">PreTrainedModel</a>. Check the superclass documentation for the generic methods the
library implements for all its model (such as downloading or saving, resizing the input embeddings, pruning heads
etc.)`,xr,Go,ys=`This model is also a PyTorch <a href="https://pytorch.org/docs/stable/nn.html#torch.nn.Module" rel="nofollow">torch.nn.Module</a> subclass.
Use it as a regular PyTorch Module and refer to the PyTorch documentation for all matter related to general usage
and behavior.`,Ur,z,lo,jr,Ho,bs='The <a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerForImageAndTextRetrieval">BridgeTowerForImageAndTextRetrieval</a> forward method, overrides the <code>__call__</code> special method.',$r,he,Ir,Xo,Ms=`<li><p><strong>loss</strong> (<code>torch.FloatTensor</code> of shape <code>(1,)</code>, <em>optional</em>, returned when <code>labels</code> is provided) — Classification (or regression if config.num_labels==1) loss.</p></li> <li><p><strong>logits</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, config.num_labels)</code>) — Classification (or regression if config.num_labels==1) scores (before SoftMax).</p></li> <li><p><strong>hidden_states</strong> (<code>tuple(torch.FloatTensor)</code>, <em>optional</em>, returned when <code>output_hidden_states=True</code> is passed or when <code>config.output_hidden_states=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for the output of the embeddings, if the model has an embedding layer, +
one for the output of each layer) of shape <code>(batch_size, sequence_length, hidden_size)</code>.</p> <p>Hidden-states of the model at the output of each layer plus the optional initial embedding outputs.</p></li> <li><p><strong>attentions</strong> (<code>tuple(torch.FloatTensor)</code>, <em>optional</em>, returned when <code>output_attentions=True</code> is passed or when <code>config.output_attentions=True</code>) — Tuple of <code>torch.FloatTensor</code> (one for each layer) of shape <code>(batch_size, num_heads, sequence_length, sequence_length)</code>.</p> <p>Attentions weights after the attention softmax, used to compute the weighted average in the self-attention
heads.</p></li>`,Cr,fe,Rt,co,Ft,Eo,Nt;return ue=new js({props:{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"}}),we=new P({props:{title:"BridgeTower",local:"bridgetower",headingTag:"h1"}}),Te=new P({props:{title:"Overview",local:"overview",headingTag:"h2"}}),Je=new P({props:{title:"Usage tips and examples",local:"usage-tips-and-examples",headingTag:"h2"}}),je=new oe({props:{code:"aW1wb3J0JTIwcmVxdWVzdHMlMEFmcm9tJTIwUElMJTIwaW1wb3J0JTIwSW1hZ2UlMEElMEFmcm9tJTIwdHJhbnNmb3JtZXJzJTIwaW1wb3J0JTIwQnJpZGdlVG93ZXJGb3JDb250cmFzdGl2ZUxlYXJuaW5nJTJDJTIwQnJpZGdlVG93ZXJQcm9jZXNzb3IlMEElMEElMEF1cmwlMjAlM0QlMjAlMjJodHRwJTNBJTJGJTJGaW1hZ2VzLmNvY29kYXRhc2V0Lm9yZyUyRnZhbDIwMTclMkYwMDAwMDAwMzk3NjkuanBnJTIyJTBBaW1hZ2UlMjAlM0QlMjBJbWFnZS5vcGVuKHJlcXVlc3RzLmdldCh1cmwlMkMlMjBzdHJlYW0lM0RUcnVlKS5yYXcpJTBBdGV4dHMlMjAlM0QlMjAlNUIlMjJBbiUyMGltYWdlJTIwb2YlMjB0d28lMjBjYXRzJTIwY2hpbGxpbmclMjBvbiUyMGElMjBjb3VjaCUyMiUyQyUyMCUyMkElMjBmb290YmFsbCUyMHBsYXllciUyMHNjb3JpbmclMjBhJTIwZ29hbCUyMiU1RCUwQSUwQXByb2Nlc3NvciUyMCUzRCUyMEJyaWRnZVRvd2VyUHJvY2Vzc29yLmZyb21fcHJldHJhaW5lZCglMjJCcmlkZ2VUb3dlciUyRmJyaWRnZXRvd2VyLWxhcmdlLWl0bS1tbG0taXRjJTIyKSUwQW1vZGVsJTIwJTNEJTIwQnJpZGdlVG93ZXJGb3JDb250cmFzdGl2ZUxlYXJuaW5nLmZyb21fcHJldHJhaW5lZCglMjJCcmlkZ2VUb3dlciUyRmJyaWRnZXRvd2VyLWxhcmdlLWl0bS1tbG0taXRjJTIyJTJDJTIwZGV2aWNlX21hcCUzRCUyMmF1dG8lMjIpJTBBJTBBJTIzJTIwZm9yd2FyZCUyMHBhc3MlMEFzY29yZXMlMjAlM0QlMjBkaWN0KCklMEFmb3IlMjB0ZXh0JTIwaW4lMjB0ZXh0cyUzQSUwQSUyMCUyMCUyMCUyMCUyMyUyMHByZXBhcmUlMjBpbnB1dHMlMEElMjAlMjAlMjAlMjBlbmNvZGluZyUyMCUzRCUyMHByb2Nlc3NvcihpbWFnZSUyQyUyMHRleHQlMkMlMjByZXR1cm5fdGVuc29ycyUzRCUyMnB0JTIyKS50byhtb2RlbC5kZXZpY2UpJTBBJTIwJTIwJTIwJTIwb3V0cHV0cyUyMCUzRCUyMG1vZGVsKCoqZW5jb2RpbmcpJTBBJTIwJTIwJTIwJTIwc2NvcmVzJTVCdGV4dCU1RCUyMCUzRCUyMG91dHB1dHM=",highlighted:`<span class="hljs-keyword">import</span> requests
<span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image
<span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BridgeTowerForContrastiveLearning, BridgeTowerProcessor
url = <span class="hljs-string">&quot;http://images.cocodataset.org/val2017/000000039769.jpg&quot;</span>
image = Image.<span class="hljs-built_in">open</span>(requests.get(url, stream=<span class="hljs-literal">True</span>).raw)
texts = [<span class="hljs-string">&quot;An image of two cats chilling on a couch&quot;</span>, <span class="hljs-string">&quot;A football player scoring a goal&quot;</span>]
processor = BridgeTowerProcessor.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-large-itm-mlm-itc&quot;</span>)
model = BridgeTowerForContrastiveLearning.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-large-itm-mlm-itc&quot;</span>, device_map=<span class="hljs-string">&quot;auto&quot;</span>)
<span class="hljs-comment"># forward pass</span>
scores = <span class="hljs-built_in">dict</span>()
<span class="hljs-keyword">for</span> text <span class="hljs-keyword">in</span> texts:
<span class="hljs-comment"># prepare inputs</span>
encoding = processor(image, text, return_tensors=<span class="hljs-string">&quot;pt&quot;</span>).to(model.device)
outputs = model(**encoding)
scores[text] = outputs`,lang:"python",wrap:!1}}),Ie=new oe({props:{code:"aW1wb3J0JTIwcmVxdWVzdHMlMEFmcm9tJTIwUElMJTIwaW1wb3J0JTIwSW1hZ2UlMEElMEFmcm9tJTIwdHJhbnNmb3JtZXJzJTIwaW1wb3J0JTIwQnJpZGdlVG93ZXJGb3JJbWFnZUFuZFRleHRSZXRyaWV2YWwlMkMlMjBCcmlkZ2VUb3dlclByb2Nlc3NvciUwQSUwQSUwQXVybCUyMCUzRCUyMCUyMmh0dHAlM0ElMkYlMkZpbWFnZXMuY29jb2RhdGFzZXQub3JnJTJGdmFsMjAxNyUyRjAwMDAwMDAzOTc2OS5qcGclMjIlMEFpbWFnZSUyMCUzRCUyMEltYWdlLm9wZW4ocmVxdWVzdHMuZ2V0KHVybCUyQyUyMHN0cmVhbSUzRFRydWUpLnJhdyklMEF0ZXh0cyUyMCUzRCUyMCU1QiUyMkFuJTIwaW1hZ2UlMjBvZiUyMHR3byUyMGNhdHMlMjBjaGlsbGluZyUyMG9uJTIwYSUyMGNvdWNoJTIyJTJDJTIwJTIyQSUyMGZvb3RiYWxsJTIwcGxheWVyJTIwc2NvcmluZyUyMGElMjBnb2FsJTIyJTVEJTBBJTBBcHJvY2Vzc29yJTIwJTNEJTIwQnJpZGdlVG93ZXJQcm9jZXNzb3IuZnJvbV9wcmV0cmFpbmVkKCUyMkJyaWRnZVRvd2VyJTJGYnJpZGdldG93ZXItYmFzZS1pdG0tbWxtJTIyKSUwQW1vZGVsJTIwJTNEJTIwQnJpZGdlVG93ZXJGb3JJbWFnZUFuZFRleHRSZXRyaWV2YWwuZnJvbV9wcmV0cmFpbmVkKCUyMkJyaWRnZVRvd2VyJTJGYnJpZGdldG93ZXItYmFzZS1pdG0tbWxtJTIyJTJDJTIwZGV2aWNlX21hcCUzRCUyMmF1dG8lMjIpJTBBJTBBJTIzJTIwZm9yd2FyZCUyMHBhc3MlMEFzY29yZXMlMjAlM0QlMjBkaWN0KCklMEFmb3IlMjB0ZXh0JTIwaW4lMjB0ZXh0cyUzQSUwQSUyMCUyMCUyMCUyMCUyMyUyMHByZXBhcmUlMjBpbnB1dHMlMEElMjAlMjAlMjAlMjBlbmNvZGluZyUyMCUzRCUyMHByb2Nlc3NvcihpbWFnZSUyQyUyMHRleHQlMkMlMjByZXR1cm5fdGVuc29ycyUzRCUyMnB0JTIyKS50byhtb2RlbC5kZXZpY2UpJTBBJTIwJTIwJTIwJTIwb3V0cHV0cyUyMCUzRCUyMG1vZGVsKCoqZW5jb2RpbmcpJTBBJTIwJTIwJTIwJTIwc2NvcmVzJTVCdGV4dCU1RCUyMCUzRCUyMG91dHB1dHMubG9naXRzJTVCMCUyQyUyMDElNUQuaXRlbSgp",highlighted:`<span class="hljs-keyword">import</span> requests
<span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image
<span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BridgeTowerForImageAndTextRetrieval, BridgeTowerProcessor
url = <span class="hljs-string">&quot;http://images.cocodataset.org/val2017/000000039769.jpg&quot;</span>
image = Image.<span class="hljs-built_in">open</span>(requests.get(url, stream=<span class="hljs-literal">True</span>).raw)
texts = [<span class="hljs-string">&quot;An image of two cats chilling on a couch&quot;</span>, <span class="hljs-string">&quot;A football player scoring a goal&quot;</span>]
processor = BridgeTowerProcessor.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-base-itm-mlm&quot;</span>)
model = BridgeTowerForImageAndTextRetrieval.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-base-itm-mlm&quot;</span>, device_map=<span class="hljs-string">&quot;auto&quot;</span>)
<span class="hljs-comment"># forward pass</span>
scores = <span class="hljs-built_in">dict</span>()
<span class="hljs-keyword">for</span> text <span class="hljs-keyword">in</span> texts:
<span class="hljs-comment"># prepare inputs</span>
encoding = processor(image, text, return_tensors=<span class="hljs-string">&quot;pt&quot;</span>).to(model.device)
outputs = model(**encoding)
scores[text] = outputs.logits[<span class="hljs-number">0</span>, <span class="hljs-number">1</span>].item()`,lang:"python",wrap:!1}}),Ze=new oe({props:{code:"ZnJvbSUyMHRyYW5zZm9ybWVycyUyMGltcG9ydCUyMEJyaWRnZVRvd2VyUHJvY2Vzc29yJTJDJTIwQnJpZGdlVG93ZXJGb3JNYXNrZWRMTSUwQWZyb20lMjBQSUwlMjBpbXBvcnQlMjBJbWFnZSUwQWltcG9ydCUyMHJlcXVlc3RzJTBBJTBBdXJsJTIwJTNEJTIwJTIyaHR0cCUzQSUyRiUyRmltYWdlcy5jb2NvZGF0YXNldC5vcmclMkZ2YWwyMDE3JTJGMDAwMDAwMzYwOTQzLmpwZyUyMiUwQWltYWdlJTIwJTNEJTIwSW1hZ2Uub3BlbihyZXF1ZXN0cy5nZXQodXJsJTJDJTIwc3RyZWFtJTNEVHJ1ZSkucmF3KS5jb252ZXJ0KCUyMlJHQiUyMiklMEF0ZXh0JTIwJTNEJTIwJTIyYSUyMCUzQ21hc2slM0UlMjBsb29raW5nJTIwb3V0JTIwb2YlMjB0aGUlMjB3aW5kb3clMjIlMEElMEFwcm9jZXNzb3IlMjAlM0QlMjBCcmlkZ2VUb3dlclByb2Nlc3Nvci5mcm9tX3ByZXRyYWluZWQoJTIyQnJpZGdlVG93ZXIlMkZicmlkZ2V0b3dlci1iYXNlLWl0bS1tbG0lMjIpJTBBbW9kZWwlMjAlM0QlMjBCcmlkZ2VUb3dlckZvck1hc2tlZExNLmZyb21fcHJldHJhaW5lZCglMjJCcmlkZ2VUb3dlciUyRmJyaWRnZXRvd2VyLWJhc2UtaXRtLW1sbSUyMiUyQyUyMGRldmljZV9tYXAlM0QlMjJhdXRvJTIyKSUwQSUwQSUyMyUyMHByZXBhcmUlMjBpbnB1dHMlMEFlbmNvZGluZyUyMCUzRCUyMHByb2Nlc3NvcihpbWFnZSUyQyUyMHRleHQlMkMlMjByZXR1cm5fdGVuc29ycyUzRCUyMnB0JTIyKS50byhtb2RlbC5kZXZpY2UpJTBBJTBBJTIzJTIwZm9yd2FyZCUyMHBhc3MlMEFvdXRwdXRzJTIwJTNEJTIwbW9kZWwoKiplbmNvZGluZyklMEElMEFyZXN1bHRzJTIwJTNEJTIwcHJvY2Vzc29yLmRlY29kZShvdXRwdXRzLmxvZ2l0cy5hcmdtYXgoZGltJTNELTEpLnNxdWVlemUoMCkudG9saXN0KCkpJTBBJTBBcHJpbnQocmVzdWx0cyklMEEuYSUyMGNhdCUyMGxvb2tpbmclMjBvdXQlMjBvZiUyMHRoZSUyMHdpbmRvdy4=",highlighted:`<span class="hljs-keyword">from</span> transformers <span class="hljs-keyword">import</span> BridgeTowerProcessor, BridgeTowerForMaskedLM
<span class="hljs-keyword">from</span> PIL <span class="hljs-keyword">import</span> Image
<span class="hljs-keyword">import</span> requests
url = <span class="hljs-string">&quot;http://images.cocodataset.org/val2017/000000360943.jpg&quot;</span>
image = Image.<span class="hljs-built_in">open</span>(requests.get(url, stream=<span class="hljs-literal">True</span>).raw).convert(<span class="hljs-string">&quot;RGB&quot;</span>)
text = <span class="hljs-string">&quot;a &lt;mask&gt; looking out of the window&quot;</span>
processor = BridgeTowerProcessor.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-base-itm-mlm&quot;</span>)
model = BridgeTowerForMaskedLM.from_pretrained(<span class="hljs-string">&quot;BridgeTower/bridgetower-base-itm-mlm&quot;</span>, device_map=<span class="hljs-string">&quot;auto&quot;</span>)
<span class="hljs-comment"># prepare inputs</span>
encoding = processor(image, text, return_tensors=<span class="hljs-string">&quot;pt&quot;</span>).to(model.device)
<span class="hljs-comment"># forward pass</span>
outputs = model(**encoding)
results = processor.decode(outputs.logits.argmax(dim=-<span class="hljs-number">1</span>).squeeze(<span class="hljs-number">0</span>).tolist())
<span class="hljs-built_in">print</span>(results)
.a cat looking out of the window.`,lang:"python",wrap:!1}}),Fe=new P({props:{title:"BridgeTowerConfig",local:"transformers.BridgeTowerConfig",headingTag:"h2"}}),Ne=new k({props:{name:"class transformers.BridgeTowerConfig",anchor:"transformers.BridgeTowerConfig",parameters:[{name:"transformers_version",val:": str | None = None"},{name:"architectures",val:": list[str] | None = None"},{name:"output_hidden_states",val:": bool | None = False"},{name:"return_dict",val:": bool | None = True"},{name:"dtype",val:": typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None"},{name:"chunk_size_feed_forward",val:": int = 0"},{name:"is_encoder_decoder",val:": bool = False"},{name:"id2label",val:": dict[int, str] | dict[str, str] | None = None"},{name:"label2id",val:": dict[str, int] | dict[str, str] | None = None"},{name:"problem_type",val:": typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None"},{name:"share_cross_modal_transformer_layers",val:": bool = True"},{name:"hidden_act",val:": str = 'gelu'"},{name:"hidden_size",val:": int = 768"},{name:"initializer_factor",val:": float | int = 1"},{name:"layer_norm_eps",val:": float = 1e-05"},{name:"share_link_tower_layers",val:": bool = False"},{name:"link_tower_type",val:": str = 'add'"},{name:"num_attention_heads",val:": int = 12"},{name:"num_hidden_layers",val:": int = 6"},{name:"tie_word_embeddings",val:": bool = False"},{name:"init_layernorm_from_vision_encoder",val:": bool = False"},{name:"text_config",val:": dict | transformers.configuration_utils.PreTrainedConfig | None = None"},{name:"vision_config",val:": dict | transformers.configuration_utils.PreTrainedConfig | None = None"}],parametersDescription:[{anchor:"transformers.BridgeTowerConfig.share_cross_modal_transformer_layers",description:`<strong>share_cross_modal_transformer_layers</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) &#x2014;
Whether cross modal transformer layers are shared.`,name:"share_cross_modal_transformer_layers"},{anchor:"transformers.BridgeTowerConfig.hidden_act",description:`<strong>hidden_act</strong> (<code>str</code>, <em>optional</em>, defaults to <code>gelu</code>) &#x2014;
The non-linear activation function (function or string) in the decoder. For example, <code>&quot;gelu&quot;</code>,
<code>&quot;relu&quot;</code>, <code>&quot;silu&quot;</code>, etc.`,name:"hidden_act"},{anchor:"transformers.BridgeTowerConfig.hidden_size",description:`<strong>hidden_size</strong> (<code>int</code>, <em>optional</em>, defaults to <code>768</code>) &#x2014;
Dimension of the hidden representations.`,name:"hidden_size"},{anchor:"transformers.BridgeTowerConfig.initializer_factor",description:`<strong>initializer_factor</strong> (<code>Union[float, int]</code>, <em>optional</em>, defaults to <code>1</code>) &#x2014;
A factor for initializing all weight matrices (should be kept to 1, used internally for initialization
testing).`,name:"initializer_factor"},{anchor:"transformers.BridgeTowerConfig.layer_norm_eps",description:`<strong>layer_norm_eps</strong> (<code>float</code>, <em>optional</em>, defaults to <code>1e-05</code>) &#x2014;
The epsilon used by the layer normalization layers.`,name:"layer_norm_eps"},{anchor:"transformers.BridgeTowerConfig.share_link_tower_layers",description:`<strong>share_link_tower_layers</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>False</code>) &#x2014;
Whether the bride/link tower layers are shared.`,name:"share_link_tower_layers"},{anchor:"transformers.BridgeTowerConfig.link_tower_type",description:`<strong>link_tower_type</strong> (<code>str</code>, <em>optional</em>, defaults to <code>&quot;add&quot;</code>) &#x2014;
Type of the bridge/link layer.`,name:"link_tower_type"},{anchor:"transformers.BridgeTowerConfig.num_attention_heads",description:`<strong>num_attention_heads</strong> (<code>int</code>, <em>optional</em>, defaults to <code>12</code>) &#x2014;
Number of attention heads for each attention layer in the Transformer decoder.`,name:"num_attention_heads"},{anchor:"transformers.BridgeTowerConfig.num_hidden_layers",description:`<strong>num_hidden_layers</strong> (<code>int</code>, <em>optional</em>, defaults to <code>6</code>) &#x2014;
Number of hidden layers in the Transformer decoder.`,name:"num_hidden_layers"},{anchor:"transformers.BridgeTowerConfig.tie_word_embeddings",description:`<strong>tie_word_embeddings</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>False</code>) &#x2014;
Whether to tie weight embeddings according to model&#x2019;s <code>tied_weights_keys</code> mapping.`,name:"tie_word_embeddings"},{anchor:"transformers.BridgeTowerConfig.init_layernorm_from_vision_encoder",description:`<strong>init_layernorm_from_vision_encoder</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>False</code>) &#x2014;
Whether to init LayerNorm from the vision encoder.`,name:"init_layernorm_from_vision_encoder"},{anchor:"transformers.BridgeTowerConfig.text_config",description:`<strong>text_config</strong> (<code>Union[dict, ~configuration_utils.PreTrainedConfig]</code>, <em>optional</em>) &#x2014;
The config object or dictionary of the text backbone.`,name:"text_config"},{anchor:"transformers.BridgeTowerConfig.vision_config",description:`<strong>vision_config</strong> (<code>Union[dict, ~configuration_utils.PreTrainedConfig]</code>, <em>optional</em>) &#x2014;
The config object or dictionary of the vision backbone.`,name:"vision_config"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/configuration_bridgetower.py#L104"}}),ne=new mo({props:{anchor:"transformers.BridgeTowerConfig.example",$$slots:{default:[Is]},$$scope:{ctx:v}}}),Le=new P({props:{title:"BridgeTowerTextConfig",local:"transformers.BridgeTowerTextConfig",headingTag:"h2"}}),We=new k({props:{name:"class transformers.BridgeTowerTextConfig",anchor:"transformers.BridgeTowerTextConfig",parameters:[{name:"transformers_version",val:": str | None = None"},{name:"architectures",val:": list[str] | None = None"},{name:"output_hidden_states",val:": bool | None = False"},{name:"return_dict",val:": bool | None = True"},{name:"dtype",val:": typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None"},{name:"chunk_size_feed_forward",val:": int = 0"},{name:"is_encoder_decoder",val:": bool = False"},{name:"id2label",val:": dict[int, str] | dict[str, str] | None = None"},{name:"label2id",val:": dict[str, int] | dict[str, str] | None = None"},{name:"problem_type",val:": typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None"},{name:"vocab_size",val:": int = 50265"},{name:"hidden_size",val:": int = 768"},{name:"num_hidden_layers",val:": int = 12"},{name:"num_attention_heads",val:": int = 12"},{name:"initializer_factor",val:": float | int = 1"},{name:"intermediate_size",val:": int = 3072"},{name:"hidden_act",val:": str = 'gelu'"},{name:"hidden_dropout_prob",val:": float | int = 0.1"},{name:"attention_probs_dropout_prob",val:": float | int = 0.1"},{name:"max_position_embeddings",val:": int = 514"},{name:"type_vocab_size",val:": int = 1"},{name:"layer_norm_eps",val:": float = 1e-05"},{name:"pad_token_id",val:": int | None = 1"},{name:"bos_token_id",val:": int | None = 0"},{name:"eos_token_id",val:": int | list[int] | None = 2"},{name:"use_cache",val:": bool = True"},{name:"is_decoder",val:": bool = False"},{name:"add_cross_attention",val:": bool = False"}],parametersDescription:[{anchor:"transformers.BridgeTowerTextConfig.vocab_size",description:`<strong>vocab_size</strong> (<code>int</code>, <em>optional</em>, defaults to <code>50265</code>) &#x2014;
Vocabulary size of the model. Defines the number of different tokens that can be represented by the <code>input_ids</code>.`,name:"vocab_size"},{anchor:"transformers.BridgeTowerTextConfig.hidden_size",description:`<strong>hidden_size</strong> (<code>int</code>, <em>optional</em>, defaults to <code>768</code>) &#x2014;
Dimension of the hidden representations.`,name:"hidden_size"},{anchor:"transformers.BridgeTowerTextConfig.num_hidden_layers",description:`<strong>num_hidden_layers</strong> (<code>int</code>, <em>optional</em>, defaults to <code>12</code>) &#x2014;
Number of hidden layers in the Transformer decoder.`,name:"num_hidden_layers"},{anchor:"transformers.BridgeTowerTextConfig.num_attention_heads",description:`<strong>num_attention_heads</strong> (<code>int</code>, <em>optional</em>, defaults to <code>12</code>) &#x2014;
Number of attention heads for each attention layer in the Transformer decoder.`,name:"num_attention_heads"},{anchor:"transformers.BridgeTowerTextConfig.initializer_factor",description:`<strong>initializer_factor</strong> (<code>Union[float, int]</code>, <em>optional</em>, defaults to <code>1</code>) &#x2014;
A factor for initializing all weight matrices (should be kept to 1, used internally for initialization
testing).`,name:"initializer_factor"},{anchor:"transformers.BridgeTowerTextConfig.intermediate_size",description:`<strong>intermediate_size</strong> (<code>int</code>, <em>optional</em>, defaults to <code>3072</code>) &#x2014;
Dimension of the MLP representations.`,name:"intermediate_size"},{anchor:"transformers.BridgeTowerTextConfig.hidden_act",description:`<strong>hidden_act</strong> (<code>str</code>, <em>optional</em>, defaults to <code>gelu</code>) &#x2014;
The non-linear activation function (function or string) in the decoder. For example, <code>&quot;gelu&quot;</code>,
<code>&quot;relu&quot;</code>, <code>&quot;silu&quot;</code>, etc.`,name:"hidden_act"},{anchor:"transformers.BridgeTowerTextConfig.hidden_dropout_prob",description:`<strong>hidden_dropout_prob</strong> (<code>Union[float, int]</code>, <em>optional</em>, defaults to <code>0.1</code>) &#x2014;
The dropout probability for all fully connected layers in the embeddings, encoder, and pooler.`,name:"hidden_dropout_prob"},{anchor:"transformers.BridgeTowerTextConfig.attention_probs_dropout_prob",description:`<strong>attention_probs_dropout_prob</strong> (<code>Union[float, int]</code>, <em>optional</em>, defaults to <code>0.1</code>) &#x2014;
The dropout ratio for the attention probabilities.`,name:"attention_probs_dropout_prob"},{anchor:"transformers.BridgeTowerTextConfig.max_position_embeddings",description:`<strong>max_position_embeddings</strong> (<code>int</code>, <em>optional</em>, defaults to <code>514</code>) &#x2014;
The maximum sequence length that this model might ever be used with.`,name:"max_position_embeddings"},{anchor:"transformers.BridgeTowerTextConfig.type_vocab_size",description:`<strong>type_vocab_size</strong> (<code>int</code>, <em>optional</em>, defaults to <code>1</code>) &#x2014;
The vocabulary size of the <code>token_type_ids</code>.`,name:"type_vocab_size"},{anchor:"transformers.BridgeTowerTextConfig.layer_norm_eps",description:`<strong>layer_norm_eps</strong> (<code>float</code>, <em>optional</em>, defaults to <code>1e-05</code>) &#x2014;
The epsilon used by the layer normalization layers.`,name:"layer_norm_eps"},{anchor:"transformers.BridgeTowerTextConfig.pad_token_id",description:`<strong>pad_token_id</strong> (<code>int</code>, <em>optional</em>, defaults to <code>1</code>) &#x2014;
Token id used for padding in the vocabulary.`,name:"pad_token_id"},{anchor:"transformers.BridgeTowerTextConfig.bos_token_id",description:`<strong>bos_token_id</strong> (<code>int</code>, <em>optional</em>, defaults to <code>0</code>) &#x2014;
Token id used for beginning-of-stream in the vocabulary.`,name:"bos_token_id"},{anchor:"transformers.BridgeTowerTextConfig.eos_token_id",description:`<strong>eos_token_id</strong> (<code>Union[int, list[int]]</code>, <em>optional</em>, defaults to <code>2</code>) &#x2014;
Token id used for end-of-stream in the vocabulary.`,name:"eos_token_id"},{anchor:"transformers.BridgeTowerTextConfig.use_cache",description:`<strong>use_cache</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) &#x2014;
Whether or not the model should return the last key/values attentions (not used by all models). Only
relevant if <code>config.is_decoder=True</code> or when the model is a decoder-only generative model.`,name:"use_cache"},{anchor:"transformers.BridgeTowerTextConfig.is_decoder",description:`<strong>is_decoder</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>False</code>) &#x2014;
Whether the model is used as a decoder or not. If <code>False</code>, the model is used as an encoder.`,name:"is_decoder"},{anchor:"transformers.BridgeTowerTextConfig.add_cross_attention",description:`<strong>add_cross_attention</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>False</code>) &#x2014;
Whether cross-attention layers should be added to the model.`,name:"add_cross_attention"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/configuration_bridgetower.py#L65"}}),ae=new mo({props:{anchor:"transformers.BridgeTowerTextConfig.example",$$slots:{default:[Cs]},$$scope:{ctx:v}}}),Ve=new P({props:{title:"BridgeTowerVisionConfig",local:"transformers.BridgeTowerVisionConfig",headingTag:"h2"}}),Pe=new k({props:{name:"class transformers.BridgeTowerVisionConfig",anchor:"transformers.BridgeTowerVisionConfig",parameters:[{name:"transformers_version",val:": str | None = None"},{name:"architectures",val:": list[str] | None = None"},{name:"output_hidden_states",val:": bool | None = False"},{name:"return_dict",val:": bool | None = True"},{name:"dtype",val:": typing.Union[str, ForwardRef('torch.dtype'), NoneType] = None"},{name:"chunk_size_feed_forward",val:": int = 0"},{name:"is_encoder_decoder",val:": bool = False"},{name:"id2label",val:": dict[int, str] | dict[str, str] | None = None"},{name:"label2id",val:": dict[str, int] | dict[str, str] | None = None"},{name:"problem_type",val:": typing.Optional[typing.Literal['regression', 'single_label_classification', 'multi_label_classification']] = None"},{name:"hidden_size",val:": int = 768"},{name:"num_hidden_layers",val:": int = 12"},{name:"num_channels",val:": int = 3"},{name:"patch_size",val:": int | list[int] | tuple[int, int] = 16"},{name:"image_size",val:": int | list[int] | tuple[int, int] = 288"},{name:"initializer_factor",val:": float | int = 1"},{name:"layer_norm_eps",val:": float = 1e-05"},{name:"stop_gradient",val:": bool = False"},{name:"share_layernorm",val:": bool = True"},{name:"remove_last_layer",val:": bool = False"}],parametersDescription:[{anchor:"transformers.BridgeTowerVisionConfig.hidden_size",description:`<strong>hidden_size</strong> (<code>int</code>, <em>optional</em>, defaults to <code>768</code>) &#x2014;
Dimension of the hidden representations.`,name:"hidden_size"},{anchor:"transformers.BridgeTowerVisionConfig.num_hidden_layers",description:`<strong>num_hidden_layers</strong> (<code>int</code>, <em>optional</em>, defaults to <code>12</code>) &#x2014;
Number of hidden layers in the Transformer decoder.`,name:"num_hidden_layers"},{anchor:"transformers.BridgeTowerVisionConfig.num_channels",description:`<strong>num_channels</strong> (<code>int</code>, <em>optional</em>, defaults to <code>3</code>) &#x2014;
The number of input channels.`,name:"num_channels"},{anchor:"transformers.BridgeTowerVisionConfig.patch_size",description:`<strong>patch_size</strong> (<code>Union[int, list[int], tuple[int, int]]</code>, <em>optional</em>, defaults to <code>16</code>) &#x2014;
The size (resolution) of each patch.`,name:"patch_size"},{anchor:"transformers.BridgeTowerVisionConfig.image_size",description:`<strong>image_size</strong> (<code>Union[int, list[int], tuple[int, int]]</code>, <em>optional</em>, defaults to <code>288</code>) &#x2014;
The size (resolution) of each image.`,name:"image_size"},{anchor:"transformers.BridgeTowerVisionConfig.initializer_factor",description:`<strong>initializer_factor</strong> (<code>Union[float, int]</code>, <em>optional</em>, defaults to <code>1</code>) &#x2014;
A factor for initializing all weight matrices (should be kept to 1, used internally for initialization
testing).`,name:"initializer_factor"},{anchor:"transformers.BridgeTowerVisionConfig.layer_norm_eps",description:`<strong>layer_norm_eps</strong> (<code>float</code>, <em>optional</em>, defaults to <code>1e-05</code>) &#x2014;
The epsilon used by the layer normalization layers.`,name:"layer_norm_eps"},{anchor:"transformers.BridgeTowerVisionConfig.stop_gradient",description:`<strong>stop_gradient</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>False</code>) &#x2014;
Whether to stop gradient for training.`,name:"stop_gradient"},{anchor:"transformers.BridgeTowerVisionConfig.share_layernorm",description:`<strong>share_layernorm</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>True</code>) &#x2014;
Whether LayerNorm layers are shared.`,name:"share_layernorm"},{anchor:"transformers.BridgeTowerVisionConfig.remove_last_layer",description:`<strong>remove_last_layer</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>False</code>) &#x2014;
Whether to remove the last layer from the vision encoder.`,name:"remove_last_layer"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/configuration_bridgetower.py#L27"}}),ie=new mo({props:{anchor:"transformers.BridgeTowerVisionConfig.example",$$slots:{default:[Zs]},$$scope:{ctx:v}}}),Ge=new P({props:{title:"BridgeTowerImageProcessor",local:"transformers.BridgeTowerImageProcessor",headingTag:"h2"}}),He=new k({props:{name:"class transformers.BridgeTowerImageProcessor",anchor:"transformers.BridgeTowerImageProcessor",parameters:[{name:"**kwargs",val:": typing_extensions.Unpack[transformers.models.bridgetower.image_processing_bridgetower.BridgeTowerImageProcessorKwargs]"}],parametersDescription:[{anchor:"transformers.BridgeTowerImageProcessor.size_divisor",description:`<strong>size_divisor</strong> (<code>int</code>, <em>kwargs</em>, <em>optional</em>, defaults to <code>self.size_divisor</code>) &#x2014;
The size by which to make sure both the height and width can be divided.`,name:"size_divisor"},{anchor:"transformers.BridgeTowerImageProcessor.*kwargs",description:`*<strong>*kwargs</strong> (<a href="/docs/transformers/pr_43265/en/main_classes/processors#transformers.ImagesKwargs">ImagesKwargs</a>, <em>optional</em>) &#x2014;
Additional image preprocessing options. Model-specific kwargs are listed above; see the TypedDict class
for the complete list of supported arguments.`,name:"*kwargs"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/image_processing_bridgetower.py#L81"}}),Xe=new k({props:{name:"preprocess",anchor:"transformers.BridgeTowerImageProcessor.preprocess",parameters:[{name:"images",val:": typing.Union[ForwardRef('PIL.Image.Image'), numpy.ndarray, ForwardRef('torch.Tensor'), list['PIL.Image.Image'], list[numpy.ndarray], list['torch.Tensor']]"},{name:"*args",val:""},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.processing_utils.ImagesKwargs]"}],parametersDescription:[{anchor:"transformers.BridgeTowerImageProcessor.preprocess.images",description:`<strong>images</strong> (<code>Union[PIL.Image.Image, numpy.ndarray, torch.Tensor, list[PIL.Image.Image], list[numpy.ndarray], list[torch.Tensor]]</code>) &#x2014;
Image to preprocess. Expects a single or batch of images with pixel values ranging from 0 to 255. If
passing in images with pixel values between 0 and 1, set <code>do_rescale=False</code>.`,name:"images"},{anchor:"transformers.BridgeTowerImageProcessor.preprocess.return_tensors",description:`<strong>return_tensors</strong> (<code>str</code> or <a href="/docs/transformers/pr_43265/en/internal/file_utils#transformers.TensorType">TensorType</a>, <em>optional</em>) &#x2014;
Returns stacked tensors if set to <code>&apos;pt&apos;</code>, otherwise returns a list of tensors.`,name:"return_tensors"},{anchor:"transformers.BridgeTowerImageProcessor.preprocess.*kwargs",description:`*<strong>*kwargs</strong> (<a href="/docs/transformers/pr_43265/en/main_classes/processors#transformers.ImagesKwargs">ImagesKwargs</a>, <em>optional</em>) &#x2014;
Additional image preprocessing options. Model-specific kwargs are listed above; see the TypedDict class
for the complete list of supported arguments.`,name:"*kwargs"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/image_processing_utils.py#L382",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script>
<ul>
<li><strong>data</strong> (<code>dict</code>) — Dictionary of lists/arrays/tensors returned by the <strong>call</strong> method (‘pixel_values’, etc.).</li>
<li><strong>tensor_type</strong> (<code>Union[None, str, TensorType]</code>, <em>optional</em>) — You can give a tensor_type here to convert the lists of integers in PyTorch/Numpy Tensors at
initialization.</li>
</ul>
`,returnType:`<script context="module">export const metadata = 'undefined';<\/script>
<p><code>~image_processing_base.BatchFeature</code></p>
`}}),Ee=new P({props:{title:"BridgeTowerImageProcessorPil",local:"transformers.BridgeTowerImageProcessorPil",headingTag:"h2"}}),qe=new k({props:{name:"class transformers.BridgeTowerImageProcessorPil",anchor:"transformers.BridgeTowerImageProcessorPil",parameters:[{name:"**kwargs",val:": typing_extensions.Unpack[transformers.models.bridgetower.image_processing_pil_bridgetower.BridgeTowerImageProcessorKwargs]"}],parametersDescription:[{anchor:"transformers.BridgeTowerImageProcessorPil.size_divisor",description:`<strong>size_divisor</strong> (<code>int</code>, <em>kwargs</em>, <em>optional</em>, defaults to <code>self.size_divisor</code>) &#x2014;
The size by which to make sure both the height and width can be divided.`,name:"size_divisor"},{anchor:"transformers.BridgeTowerImageProcessorPil.*kwargs",description:`*<strong>*kwargs</strong> (<a href="/docs/transformers/pr_43265/en/main_classes/processors#transformers.ImagesKwargs">ImagesKwargs</a>, <em>optional</em>) &#x2014;
Additional image preprocessing options. Model-specific kwargs are listed above; see the TypedDict class
for the complete list of supported arguments.`,name:"*kwargs"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/image_processing_pil_bridgetower.py#L75"}}),Qe=new k({props:{name:"preprocess",anchor:"transformers.BridgeTowerImageProcessorPil.preprocess",parameters:[{name:"images",val:": typing.Union[ForwardRef('PIL.Image.Image'), numpy.ndarray, ForwardRef('torch.Tensor'), list['PIL.Image.Image'], list[numpy.ndarray], list['torch.Tensor']]"},{name:"*args",val:""},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.processing_utils.ImagesKwargs]"}],parametersDescription:[{anchor:"transformers.BridgeTowerImageProcessorPil.preprocess.images",description:`<strong>images</strong> (<code>Union[PIL.Image.Image, numpy.ndarray, torch.Tensor, list[PIL.Image.Image], list[numpy.ndarray], list[torch.Tensor]]</code>) &#x2014;
Image to preprocess. Expects a single or batch of images with pixel values ranging from 0 to 255. If
passing in images with pixel values between 0 and 1, set <code>do_rescale=False</code>.`,name:"images"},{anchor:"transformers.BridgeTowerImageProcessorPil.preprocess.return_tensors",description:`<strong>return_tensors</strong> (<code>str</code> or <a href="/docs/transformers/pr_43265/en/internal/file_utils#transformers.TensorType">TensorType</a>, <em>optional</em>) &#x2014;
Returns stacked tensors if set to <code>&apos;pt&apos;</code>, otherwise returns a list of tensors.`,name:"return_tensors"},{anchor:"transformers.BridgeTowerImageProcessorPil.preprocess.*kwargs",description:`*<strong>*kwargs</strong> (<a href="/docs/transformers/pr_43265/en/main_classes/processors#transformers.ImagesKwargs">ImagesKwargs</a>, <em>optional</em>) &#x2014;
Additional image preprocessing options. Model-specific kwargs are listed above; see the TypedDict class
for the complete list of supported arguments.`,name:"*kwargs"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/image_processing_utils.py#L382",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script>
<ul>
<li><strong>data</strong> (<code>dict</code>) — Dictionary of lists/arrays/tensors returned by the <strong>call</strong> method (‘pixel_values’, etc.).</li>
<li><strong>tensor_type</strong> (<code>Union[None, str, TensorType]</code>, <em>optional</em>) — You can give a tensor_type here to convert the lists of integers in PyTorch/Numpy Tensors at
initialization.</li>
</ul>
`,returnType:`<script context="module">export const metadata = 'undefined';<\/script>
<p><code>~image_processing_base.BatchFeature</code></p>
`}}),Se=new P({props:{title:"BridgeTowerProcessor",local:"transformers.BridgeTowerProcessor",headingTag:"h2"}}),Ye=new k({props:{name:"class transformers.BridgeTowerProcessor",anchor:"transformers.BridgeTowerProcessor",parameters:[{name:"image_processor",val:""},{name:"tokenizer",val:""}],parametersDescription:[{anchor:"transformers.BridgeTowerProcessor.image_processor",description:`<strong>image_processor</strong> (<code>BridgeTowerImageProcessor</code>) &#x2014;
The image processor is a required input.`,name:"image_processor"},{anchor:"transformers.BridgeTowerProcessor.tokenizer",description:`<strong>tokenizer</strong> (<code>RobertaTokenizer</code>) &#x2014;
The tokenizer is a required input.`,name:"tokenizer"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/processing_bridgetower.py#L42"}}),Ae=new k({props:{name:"__call__",anchor:"transformers.BridgeTowerProcessor.__call__",parameters:[{name:"images",val:": typing.Union[ForwardRef('PIL.Image.Image'), numpy.ndarray, ForwardRef('torch.Tensor'), list['PIL.Image.Image'], list[numpy.ndarray], list['torch.Tensor'], NoneType] = None"},{name:"text",val:": str | list[str] | list[list[str]] | None = None"},{name:"videos",val:": typing.Union[list['PIL.Image.Image'], numpy.ndarray, ForwardRef('torch.Tensor'), list[numpy.ndarray], list['torch.Tensor'], list[list['PIL.Image.Image']], list[list[numpy.ndarray]], list[list['torch.Tensor']], transformers.video_utils.URL, list[transformers.video_utils.URL], list[list[transformers.video_utils.URL]], transformers.video_utils.Path, list[transformers.video_utils.Path], list[list[transformers.video_utils.Path]], NoneType] = None"},{name:"audio",val:": typing.Union[numpy.ndarray, ForwardRef('torch.Tensor'), collections.abc.Sequence[numpy.ndarray], collections.abc.Sequence['torch.Tensor'], NoneType] = None"},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.processing_utils.ProcessingKwargs]"}],parametersDescription:[{anchor:"transformers.BridgeTowerProcessor.__call__.images",description:`<strong>images</strong> (<code>Union[PIL.Image.Image, numpy.ndarray, torch.Tensor, list[PIL.Image.Image], list[numpy.ndarray], list[torch.Tensor]]</code>, <em>optional</em>) &#x2014;
Image to preprocess. Expects a single or batch of images with pixel values ranging from 0 to 255. If
passing in images with pixel values between 0 and 1, set <code>do_rescale=False</code>.`,name:"images"},{anchor:"transformers.BridgeTowerProcessor.__call__.text",description:`<strong>text</strong> (<code>Union[str, list[str], list[list[str]]]</code>, <em>optional</em>) &#x2014;
The sequence or batch of sequences to be encoded. Each sequence can be a string or a list of strings
(pretokenized string). If you pass a pretokenized input, set <code>is_split_into_words=True</code> to avoid ambiguity with batched inputs.`,name:"text"},{anchor:"transformers.BridgeTowerProcessor.__call__.videos",description:`<strong>videos</strong> (<code>Union[list[PIL.Image.Image], numpy.ndarray, torch.Tensor, list[numpy.ndarray], list[torch.Tensor], list[list[PIL.Image.Image]], list[list[numpy.ndarray]], list[list[torch.Tensor]], ~video_utils.URL, list[~video_utils.URL], list[list[~video_utils.URL]], ~video_utils.Path, list[~video_utils.Path], list[list[~video_utils.Path]]]</code>, <em>optional</em>) &#x2014;
Video to preprocess. Expects a single or batch of videos with pixel values ranging from 0 to 255. If
passing in videos with pixel values between 0 and 1, set <code>do_rescale=False</code>.`,name:"videos"},{anchor:"transformers.BridgeTowerProcessor.__call__.audio",description:`<strong>audio</strong> (<code>Union[numpy.ndarray, torch.Tensor, collections.abc.Sequence[numpy.ndarray], collections.abc.Sequence[torch.Tensor]]</code>, <em>optional</em>) &#x2014;
The audio or batch of audios to be prepared. Each audio can be a NumPy array or PyTorch tensor.
In case of a NumPy array/PyTorch tensor, each audio should be of shape (C, T), where C is a number of channels,
and T is the sample length of the audio.`,name:"audio"},{anchor:"transformers.BridgeTowerProcessor.__call__.return_tensors",description:`<strong>return_tensors</strong> (<code>str</code> or <a href="/docs/transformers/pr_43265/en/internal/file_utils#transformers.TensorType">TensorType</a>, <em>optional</em>) &#x2014;
If set, will return tensors of a particular framework. Acceptable values are:</p>
<ul>
<li><code>&apos;pt&apos;</code>: Return PyTorch <code>torch.Tensor</code> objects.</li>
<li><code>&apos;np&apos;</code>: Return NumPy <code>np.ndarray</code> objects.</li>
</ul>`,name:"return_tensors"},{anchor:"transformers.BridgeTowerProcessor.__call__.*kwargs",description:`*<strong>*kwargs</strong> (<a href="/docs/transformers/pr_43265/en/main_classes/processors#transformers.ProcessingKwargs">ProcessingKwargs</a>, <em>optional</em>) &#x2014;
Additional processing options for each modality (text, images, videos, audio). Model-specific parameters
are listed above; see the TypedDict class for the complete list of supported arguments.`,name:"*kwargs"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/processing_utils.py#L643"}}),De=new P({props:{title:"BridgeTowerModel",local:"transformers.BridgeTowerModel",headingTag:"h2"}}),Ke=new k({props:{name:"class transformers.BridgeTowerModel",anchor:"transformers.BridgeTowerModel",parameters:[{name:"config",val:""}],parametersDescription:[{anchor:"transformers.BridgeTowerModel.config",description:`<strong>config</strong> (<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerModel">BridgeTowerModel</a>) &#x2014;
Model configuration class with all the parameters of the model. Initializing with a config file does not
load the weights associated with the model, only the configuration. Check out the
<a href="/docs/transformers/pr_43265/en/main_classes/model#transformers.PreTrainedModel.from_pretrained">from_pretrained()</a> method to load the model weights.`,name:"config"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/modeling_bridgetower.py#L1085"}}),Oe=new k({props:{name:"forward",anchor:"transformers.BridgeTowerModel.forward",parameters:[{name:"input_ids",val:": torch.LongTensor | None = None"},{name:"attention_mask",val:": torch.FloatTensor | None = None"},{name:"token_type_ids",val:": torch.LongTensor | None = None"},{name:"pixel_values",val:": torch.FloatTensor | None = None"},{name:"pixel_mask",val:": torch.LongTensor | None = None"},{name:"inputs_embeds",val:": torch.FloatTensor | None = None"},{name:"image_embeds",val:": torch.FloatTensor | None = None"},{name:"image_token_type_idx",val:": int | None = None"},{name:"labels",val:": torch.LongTensor | None = None"},{name:"interpolate_pos_encoding",val:": bool = False"},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs]"}],parametersDescription:[{anchor:"transformers.BridgeTowerModel.forward.input_ids",description:`<strong>input_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Indices of input sequence tokens in the vocabulary. Padding will be ignored by default.</p>
<p>Indices can be obtained using <a href="/docs/transformers/pr_43265/en/model_doc/auto#transformers.AutoTokenizer">AutoTokenizer</a>. See <a href="/docs/transformers/pr_43265/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.encode">PreTrainedTokenizer.encode()</a> and
<a href="/docs/transformers/pr_43265/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.__call__">PreTrainedTokenizer.<strong>call</strong>()</a> for details.</p>
<p><a href="../glossary#input-ids">What are input IDs?</a>`,name:"input_ids"},{anchor:"transformers.BridgeTowerModel.forward.attention_mask",description:`<strong>attention_mask</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Mask to avoid performing attention on padding token indices. Mask values selected in <code>[0, 1]</code>:</p>
<ul>
<li>1 for tokens that are <strong>not masked</strong>,</li>
<li>0 for tokens that are <strong>masked</strong>.</li>
</ul>
<p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"attention_mask"},{anchor:"transformers.BridgeTowerModel.forward.token_type_ids",description:`<strong>token_type_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Segment token indices to indicate first and second portions of the inputs. Indices are selected in <code>[0, 1]</code>:</p>
<ul>
<li>0 corresponds to a <em>sentence A</em> token,</li>
<li>1 corresponds to a <em>sentence B</em> token.</li>
</ul>
<p><a href="../glossary#token-type-ids">What are token type IDs?</a>`,name:"token_type_ids"},{anchor:"transformers.BridgeTowerModel.forward.pixel_values",description:`<strong>pixel_values</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_channels, image_size, image_size)</code>, <em>optional</em>) &#x2014;
The tensors corresponding to the input images. Pixel values can be obtained using
<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">BridgeTowerImageProcessor</a>. See <code>BridgeTowerImageProcessor.__call__()</code> for details (<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerProcessor">BridgeTowerProcessor</a> uses
<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">BridgeTowerImageProcessor</a> for processing images).`,name:"pixel_values"},{anchor:"transformers.BridgeTowerModel.forward.pixel_mask",description:`<strong>pixel_mask</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, height, width)</code>, <em>optional</em>) &#x2014;
Mask to avoid performing attention on padding pixel values. Mask values selected in <code>[0, 1]</code>:</p>
<ul>
<li>1 for pixels that are real (i.e. <strong>not masked</strong>),</li>
<li>0 for pixels that are padding (i.e. <strong>masked</strong>).</li>
</ul>
<p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"pixel_mask"},{anchor:"transformers.BridgeTowerModel.forward.inputs_embeds",description:`<strong>inputs_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, hidden_size)</code>, <em>optional</em>) &#x2014;
Optionally, instead of passing <code>input_ids</code> you can choose to directly pass an embedded representation. This
is useful if you want more control over how to convert <code>input_ids</code> indices into associated vectors than the
model&#x2019;s internal embedding lookup matrix.`,name:"inputs_embeds"},{anchor:"transformers.BridgeTowerModel.forward.image_embeds",description:`<strong>image_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_patches, hidden_size)</code>, <em>optional</em>) &#x2014;
Optionally, instead of passing <code>pixel_values</code>, you can choose to directly pass an embedded representation.
This is useful if you want more control over how to convert <code>pixel_values</code> into patch embeddings.`,name:"image_embeds"},{anchor:"transformers.BridgeTowerModel.forward.image_token_type_idx",description:`<strong>image_token_type_idx</strong> (<code>int</code>, <em>optional</em>) &#x2014;</p>
<ul>
<li>The token type ids for images.</li>
</ul>`,name:"image_token_type_idx"},{anchor:"transformers.BridgeTowerModel.forward.labels",description:`<strong>labels</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size,)</code>, <em>optional</em>) &#x2014;
Labels are currently not supported.`,name:"labels"},{anchor:"transformers.BridgeTowerModel.forward.interpolate_pos_encoding",description:`<strong>interpolate_pos_encoding</strong> (<code>bool</code>, <em>optional</em>, defaults to <code>False</code>) &#x2014;
Whether to interpolate the pre-trained position encodings.`,name:"interpolate_pos_encoding"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/modeling_bridgetower.py#L1158",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script>
<p>A <code>BridgeTowerModelOutput</code> or a tuple of
<code>torch.FloatTensor</code> (if <code>return_dict=False</code> is passed or when <code>config.return_dict=False</code>) comprising various
elements depending on the configuration (<a
href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerConfig"
>BridgeTowerConfig</a>) and inputs.</p>
`,returnType:`<script context="module">export const metadata = 'undefined';<\/script>
<p><code>BridgeTowerModelOutput</code> or <code>tuple(torch.FloatTensor)</code></p>
`}}),le=new Lt({props:{$$slots:{default:[zs]},$$scope:{ctx:v}}}),de=new mo({props:{anchor:"transformers.BridgeTowerModel.forward.example",$$slots:{default:[Rs]},$$scope:{ctx:v}}}),eo=new P({props:{title:"BridgeTowerForContrastiveLearning",local:"transformers.BridgeTowerForContrastiveLearning",headingTag:"h2"}}),oo=new k({props:{name:"class transformers.BridgeTowerForContrastiveLearning",anchor:"transformers.BridgeTowerForContrastiveLearning",parameters:[{name:"config",val:""}],parametersDescription:[{anchor:"transformers.BridgeTowerForContrastiveLearning.config",description:`<strong>config</strong> (<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerForContrastiveLearning">BridgeTowerForContrastiveLearning</a>) &#x2014;
Model configuration class with all the parameters of the model. Initializing with a config file does not
load the weights associated with the model, only the configuration. Check out the
<a href="/docs/transformers/pr_43265/en/main_classes/model#transformers.PreTrainedModel.from_pretrained">from_pretrained()</a> method to load the model weights.`,name:"config"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/modeling_bridgetower.py#L1626"}}),to=new k({props:{name:"forward",anchor:"transformers.BridgeTowerForContrastiveLearning.forward",parameters:[{name:"input_ids",val:": torch.LongTensor | None = None"},{name:"attention_mask",val:": torch.FloatTensor | None = None"},{name:"token_type_ids",val:": torch.LongTensor | None = None"},{name:"pixel_values",val:": torch.FloatTensor | None = None"},{name:"pixel_mask",val:": torch.LongTensor | None = None"},{name:"inputs_embeds",val:": torch.FloatTensor | None = None"},{name:"image_embeds",val:": torch.FloatTensor | None = None"},{name:"return_loss",val:": bool | None = None"},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs]"}],parametersDescription:[{anchor:"transformers.BridgeTowerForContrastiveLearning.forward.input_ids",description:`<strong>input_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Indices of input sequence tokens in the vocabulary. Padding will be ignored by default.</p>
<p>Indices can be obtained using <a href="/docs/transformers/pr_43265/en/model_doc/auto#transformers.AutoTokenizer">AutoTokenizer</a>. See <a href="/docs/transformers/pr_43265/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.encode">PreTrainedTokenizer.encode()</a> and
<a href="/docs/transformers/pr_43265/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.__call__">PreTrainedTokenizer.<strong>call</strong>()</a> for details.</p>
<p><a href="../glossary#input-ids">What are input IDs?</a>`,name:"input_ids"},{anchor:"transformers.BridgeTowerForContrastiveLearning.forward.attention_mask",description:`<strong>attention_mask</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Mask to avoid performing attention on padding token indices. Mask values selected in <code>[0, 1]</code>:</p>
<ul>
<li>1 for tokens that are <strong>not masked</strong>,</li>
<li>0 for tokens that are <strong>masked</strong>.</li>
</ul>
<p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"attention_mask"},{anchor:"transformers.BridgeTowerForContrastiveLearning.forward.token_type_ids",description:`<strong>token_type_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Segment token indices to indicate first and second portions of the inputs. Indices are selected in <code>[0, 1]</code>:</p>
<ul>
<li>0 corresponds to a <em>sentence A</em> token,</li>
<li>1 corresponds to a <em>sentence B</em> token.</li>
</ul>
<p><a href="../glossary#token-type-ids">What are token type IDs?</a>`,name:"token_type_ids"},{anchor:"transformers.BridgeTowerForContrastiveLearning.forward.pixel_values",description:`<strong>pixel_values</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_channels, image_size, image_size)</code>, <em>optional</em>) &#x2014;
The tensors corresponding to the input images. Pixel values can be obtained using
<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">BridgeTowerImageProcessor</a>. See <code>BridgeTowerImageProcessor.__call__()</code> for details (<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerProcessor">BridgeTowerProcessor</a> uses
<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">BridgeTowerImageProcessor</a> for processing images).`,name:"pixel_values"},{anchor:"transformers.BridgeTowerForContrastiveLearning.forward.pixel_mask",description:`<strong>pixel_mask</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, height, width)</code>, <em>optional</em>) &#x2014;
Mask to avoid performing attention on padding pixel values. Mask values selected in <code>[0, 1]</code>:</p>
<ul>
<li>1 for pixels that are real (i.e. <strong>not masked</strong>),</li>
<li>0 for pixels that are padding (i.e. <strong>masked</strong>).</li>
</ul>
<p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"pixel_mask"},{anchor:"transformers.BridgeTowerForContrastiveLearning.forward.inputs_embeds",description:`<strong>inputs_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, hidden_size)</code>, <em>optional</em>) &#x2014;
Optionally, instead of passing <code>input_ids</code> you can choose to directly pass an embedded representation. This
is useful if you want more control over how to convert <code>input_ids</code> indices into associated vectors than the
model&#x2019;s internal embedding lookup matrix.`,name:"inputs_embeds"},{anchor:"transformers.BridgeTowerForContrastiveLearning.forward.image_embeds",description:`<strong>image_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_patches, hidden_size)</code>, <em>optional</em>) &#x2014;
Optionally, instead of passing <code>pixel_values</code>, you can choose to directly pass an embedded representation.
This is useful if you want more control over how to convert <code>pixel_values</code> into patch embeddings.`,name:"image_embeds"},{anchor:"transformers.BridgeTowerForContrastiveLearning.forward.return_loss",description:`<strong>return_loss</strong> (<code>bool</code>, <em>optional</em>) &#x2014;
Whether or not to return the contrastive loss.`,name:"return_loss"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/modeling_bridgetower.py#L1640",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script>
<p>A <code>BridgeTowerContrastiveOutput</code> or a tuple of
<code>torch.FloatTensor</code> (if <code>return_dict=False</code> is passed or when <code>config.return_dict=False</code>) comprising various
elements depending on the configuration (<a
href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerConfig"
>BridgeTowerConfig</a>) and inputs.</p>
`,returnType:`<script context="module">export const metadata = 'undefined';<\/script>
<p><code>BridgeTowerContrastiveOutput</code> or <code>tuple(torch.FloatTensor)</code></p>
`}}),ce=new Lt({props:{$$slots:{default:[Fs]},$$scope:{ctx:v}}}),me=new mo({props:{anchor:"transformers.BridgeTowerForContrastiveLearning.forward.example",$$slots:{default:[Ns]},$$scope:{ctx:v}}}),ro=new P({props:{title:"BridgeTowerForMaskedLM",local:"transformers.BridgeTowerForMaskedLM",headingTag:"h2"}}),so=new k({props:{name:"class transformers.BridgeTowerForMaskedLM",anchor:"transformers.BridgeTowerForMaskedLM",parameters:[{name:"config",val:""}],parametersDescription:[{anchor:"transformers.BridgeTowerForMaskedLM.config",description:`<strong>config</strong> (<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerForMaskedLM">BridgeTowerForMaskedLM</a>) &#x2014;
Model configuration class with all the parameters of the model. Initializing with a config file does not
load the weights associated with the model, only the configuration. Check out the
<a href="/docs/transformers/pr_43265/en/main_classes/model#transformers.PreTrainedModel.from_pretrained">from_pretrained()</a> method to load the model weights.`,name:"config"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/modeling_bridgetower.py#L1423"}}),no=new k({props:{name:"forward",anchor:"transformers.BridgeTowerForMaskedLM.forward",parameters:[{name:"input_ids",val:": torch.LongTensor | None = None"},{name:"attention_mask",val:": torch.FloatTensor | None = None"},{name:"token_type_ids",val:": torch.LongTensor | None = None"},{name:"pixel_values",val:": torch.FloatTensor | None = None"},{name:"pixel_mask",val:": torch.LongTensor | None = None"},{name:"inputs_embeds",val:": torch.FloatTensor | None = None"},{name:"image_embeds",val:": torch.FloatTensor | None = None"},{name:"labels",val:": torch.LongTensor | None = None"},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs]"}],parametersDescription:[{anchor:"transformers.BridgeTowerForMaskedLM.forward.input_ids",description:`<strong>input_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Indices of input sequence tokens in the vocabulary. Padding will be ignored by default.</p>
<p>Indices can be obtained using <a href="/docs/transformers/pr_43265/en/model_doc/auto#transformers.AutoTokenizer">AutoTokenizer</a>. See <a href="/docs/transformers/pr_43265/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.encode">PreTrainedTokenizer.encode()</a> and
<a href="/docs/transformers/pr_43265/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.__call__">PreTrainedTokenizer.<strong>call</strong>()</a> for details.</p>
<p><a href="../glossary#input-ids">What are input IDs?</a>`,name:"input_ids"},{anchor:"transformers.BridgeTowerForMaskedLM.forward.attention_mask",description:`<strong>attention_mask</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Mask to avoid performing attention on padding token indices. Mask values selected in <code>[0, 1]</code>:</p>
<ul>
<li>1 for tokens that are <strong>not masked</strong>,</li>
<li>0 for tokens that are <strong>masked</strong>.</li>
</ul>
<p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"attention_mask"},{anchor:"transformers.BridgeTowerForMaskedLM.forward.token_type_ids",description:`<strong>token_type_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Segment token indices to indicate first and second portions of the inputs. Indices are selected in <code>[0, 1]</code>:</p>
<ul>
<li>0 corresponds to a <em>sentence A</em> token,</li>
<li>1 corresponds to a <em>sentence B</em> token.</li>
</ul>
<p><a href="../glossary#token-type-ids">What are token type IDs?</a>`,name:"token_type_ids"},{anchor:"transformers.BridgeTowerForMaskedLM.forward.pixel_values",description:`<strong>pixel_values</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_channels, image_size, image_size)</code>, <em>optional</em>) &#x2014;
The tensors corresponding to the input images. Pixel values can be obtained using
<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">BridgeTowerImageProcessor</a>. See <code>BridgeTowerImageProcessor.__call__()</code> for details (<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerProcessor">BridgeTowerProcessor</a> uses
<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">BridgeTowerImageProcessor</a> for processing images).`,name:"pixel_values"},{anchor:"transformers.BridgeTowerForMaskedLM.forward.pixel_mask",description:`<strong>pixel_mask</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, height, width)</code>, <em>optional</em>) &#x2014;
Mask to avoid performing attention on padding pixel values. Mask values selected in <code>[0, 1]</code>:</p>
<ul>
<li>1 for pixels that are real (i.e. <strong>not masked</strong>),</li>
<li>0 for pixels that are padding (i.e. <strong>masked</strong>).</li>
</ul>
<p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"pixel_mask"},{anchor:"transformers.BridgeTowerForMaskedLM.forward.inputs_embeds",description:`<strong>inputs_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, hidden_size)</code>, <em>optional</em>) &#x2014;
Optionally, instead of passing <code>input_ids</code> you can choose to directly pass an embedded representation. This
is useful if you want more control over how to convert <code>input_ids</code> indices into associated vectors than the
model&#x2019;s internal embedding lookup matrix.`,name:"inputs_embeds"},{anchor:"transformers.BridgeTowerForMaskedLM.forward.image_embeds",description:`<strong>image_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_patches, hidden_size)</code>, <em>optional</em>) &#x2014;
Optionally, instead of passing <code>pixel_values</code>, you can choose to directly pass an embedded representation.
This is useful if you want more control over how to convert <code>pixel_values</code> into patch embeddings.`,name:"image_embeds"},{anchor:"transformers.BridgeTowerForMaskedLM.forward.labels",description:`<strong>labels</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Labels for computing the masked language modeling loss. Indices should be in <code>[-100, 0, ..., config.vocab_size]</code> (see <code>input_ids</code> docstring) Tokens with indices set to <code>-100</code> are ignored (masked), the
loss is only computed for the tokens with labels in <code>[0, ..., config.vocab_size]</code>`,name:"labels"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/modeling_bridgetower.py#L1441",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script>
<p>A <a
href="/docs/transformers/pr_43265/en/main_classes/output#transformers.modeling_outputs.MaskedLMOutput"
>MaskedLMOutput</a> or a tuple of
<code>torch.FloatTensor</code> (if <code>return_dict=False</code> is passed or when <code>config.return_dict=False</code>) comprising various
elements depending on the configuration (<a
href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerConfig"
>BridgeTowerConfig</a>) and inputs.</p>
`,returnType:`<script context="module">export const metadata = 'undefined';<\/script>
<p><a
href="/docs/transformers/pr_43265/en/main_classes/output#transformers.modeling_outputs.MaskedLMOutput"
>MaskedLMOutput</a> or <code>tuple(torch.FloatTensor)</code></p>
`}}),pe=new Lt({props:{$$slots:{default:[Ls]},$$scope:{ctx:v}}}),ge=new mo({props:{anchor:"transformers.BridgeTowerForMaskedLM.forward.example",$$slots:{default:[Ws]},$$scope:{ctx:v}}}),ao=new P({props:{title:"BridgeTowerForImageAndTextRetrieval",local:"transformers.BridgeTowerForImageAndTextRetrieval",headingTag:"h2"}}),io=new k({props:{name:"class transformers.BridgeTowerForImageAndTextRetrieval",anchor:"transformers.BridgeTowerForImageAndTextRetrieval",parameters:[{name:"config",val:""}],parametersDescription:[{anchor:"transformers.BridgeTowerForImageAndTextRetrieval.config",description:`<strong>config</strong> (<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerForImageAndTextRetrieval">BridgeTowerForImageAndTextRetrieval</a>) &#x2014;
Model configuration class with all the parameters of the model. Initializing with a config file does not
load the weights associated with the model, only the configuration. Check out the
<a href="/docs/transformers/pr_43265/en/main_classes/model#transformers.PreTrainedModel.from_pretrained">from_pretrained()</a> method to load the model weights.`,name:"config"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/modeling_bridgetower.py#L1524"}}),lo=new k({props:{name:"forward",anchor:"transformers.BridgeTowerForImageAndTextRetrieval.forward",parameters:[{name:"input_ids",val:": torch.LongTensor | None = None"},{name:"attention_mask",val:": torch.FloatTensor | None = None"},{name:"token_type_ids",val:": torch.LongTensor | None = None"},{name:"pixel_values",val:": torch.FloatTensor | None = None"},{name:"pixel_mask",val:": torch.LongTensor | None = None"},{name:"inputs_embeds",val:": torch.FloatTensor | None = None"},{name:"image_embeds",val:": torch.FloatTensor | None = None"},{name:"labels",val:": torch.LongTensor | None = None"},{name:"**kwargs",val:": typing_extensions.Unpack[transformers.utils.generic.TransformersKwargs]"}],parametersDescription:[{anchor:"transformers.BridgeTowerForImageAndTextRetrieval.forward.input_ids",description:`<strong>input_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Indices of input sequence tokens in the vocabulary. Padding will be ignored by default.</p>
<p>Indices can be obtained using <a href="/docs/transformers/pr_43265/en/model_doc/auto#transformers.AutoTokenizer">AutoTokenizer</a>. See <a href="/docs/transformers/pr_43265/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.encode">PreTrainedTokenizer.encode()</a> and
<a href="/docs/transformers/pr_43265/en/internal/tokenization_utils#transformers.PreTrainedTokenizerBase.__call__">PreTrainedTokenizer.<strong>call</strong>()</a> for details.</p>
<p><a href="../glossary#input-ids">What are input IDs?</a>`,name:"input_ids"},{anchor:"transformers.BridgeTowerForImageAndTextRetrieval.forward.attention_mask",description:`<strong>attention_mask</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Mask to avoid performing attention on padding token indices. Mask values selected in <code>[0, 1]</code>:</p>
<ul>
<li>1 for tokens that are <strong>not masked</strong>,</li>
<li>0 for tokens that are <strong>masked</strong>.</li>
</ul>
<p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"attention_mask"},{anchor:"transformers.BridgeTowerForImageAndTextRetrieval.forward.token_type_ids",description:`<strong>token_type_ids</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, sequence_length)</code>, <em>optional</em>) &#x2014;
Segment token indices to indicate first and second portions of the inputs. Indices are selected in <code>[0, 1]</code>:</p>
<ul>
<li>0 corresponds to a <em>sentence A</em> token,</li>
<li>1 corresponds to a <em>sentence B</em> token.</li>
</ul>
<p><a href="../glossary#token-type-ids">What are token type IDs?</a>`,name:"token_type_ids"},{anchor:"transformers.BridgeTowerForImageAndTextRetrieval.forward.pixel_values",description:`<strong>pixel_values</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_channels, image_size, image_size)</code>, <em>optional</em>) &#x2014;
The tensors corresponding to the input images. Pixel values can be obtained using
<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">BridgeTowerImageProcessor</a>. See <code>BridgeTowerImageProcessor.__call__()</code> for details (<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerProcessor">BridgeTowerProcessor</a> uses
<a href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerImageProcessor">BridgeTowerImageProcessor</a> for processing images).`,name:"pixel_values"},{anchor:"transformers.BridgeTowerForImageAndTextRetrieval.forward.pixel_mask",description:`<strong>pixel_mask</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, height, width)</code>, <em>optional</em>) &#x2014;
Mask to avoid performing attention on padding pixel values. Mask values selected in <code>[0, 1]</code>:</p>
<ul>
<li>1 for pixels that are real (i.e. <strong>not masked</strong>),</li>
<li>0 for pixels that are padding (i.e. <strong>masked</strong>).</li>
</ul>
<p><a href="../glossary#attention-mask">What are attention masks?</a>`,name:"pixel_mask"},{anchor:"transformers.BridgeTowerForImageAndTextRetrieval.forward.inputs_embeds",description:`<strong>inputs_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, sequence_length, hidden_size)</code>, <em>optional</em>) &#x2014;
Optionally, instead of passing <code>input_ids</code> you can choose to directly pass an embedded representation. This
is useful if you want more control over how to convert <code>input_ids</code> indices into associated vectors than the
model&#x2019;s internal embedding lookup matrix.`,name:"inputs_embeds"},{anchor:"transformers.BridgeTowerForImageAndTextRetrieval.forward.image_embeds",description:`<strong>image_embeds</strong> (<code>torch.FloatTensor</code> of shape <code>(batch_size, num_patches, hidden_size)</code>, <em>optional</em>) &#x2014;
Optionally, instead of passing <code>pixel_values</code>, you can choose to directly pass an embedded representation.
This is useful if you want more control over how to convert <code>pixel_values</code> into patch embeddings.`,name:"image_embeds"},{anchor:"transformers.BridgeTowerForImageAndTextRetrieval.forward.labels",description:`<strong>labels</strong> (<code>torch.LongTensor</code> of shape <code>(batch_size, 1)</code>, <em>optional</em>) &#x2014;
Labels for computing the image-text matching loss. 0 means the pairs don&#x2019;t match and 1 means they match.
The pairs with 0 will be skipped for calculation.`,name:"labels"}],source:"https://github.com/huggingface/transformers/blob/vr_43265/src/transformers/models/bridgetower/modeling_bridgetower.py#L1535",returnDescription:`<script context="module">export const metadata = 'undefined';<\/script>
<p>A <a
href="/docs/transformers/pr_43265/en/main_classes/output#transformers.modeling_outputs.SequenceClassifierOutput"
>SequenceClassifierOutput</a> or a tuple of
<code>torch.FloatTensor</code> (if <code>return_dict=False</code> is passed or when <code>config.return_dict=False</code>) comprising various
elements depending on the configuration (<a
href="/docs/transformers/pr_43265/en/model_doc/bridgetower#transformers.BridgeTowerConfig"
>BridgeTowerConfig</a>) and inputs.</p>
`,returnType:`<script context="module">export const metadata = 'undefined';<\/script>
<p><a
href="/docs/transformers/pr_43265/en/main_classes/output#transformers.modeling_outputs.SequenceClassifierOutput"
>SequenceClassifierOutput</a> or <code>tuple(torch.FloatTensor)</code></p>
`}}),he=new Lt({props:{$$slots:{default:[Vs]},$$scope:{ctx:v}}}),fe=new mo({props:{anchor:"transformers.BridgeTowerForImageAndTextRetrieval.forward.example",$$slots:{default:[Ps]},$$scope:{ctx:v}}}),co=new $s({props:{source:"https://github.com/huggingface/transformers/blob/main/docs/source/en/model_doc/bridgetower.md"}}),{c(){a=d("meta"),b=s(),p=d("p"),m=s(),y=d("p"),y.innerHTML=r,M=s(),h(ue.$$.fragment),Yo=s(),h(we.$$.fragment),Ao=s(),h(Te.$$.fragment),Do=s(),_e=d("p"),_e.innerHTML=Zr,Ko=s(),ye=d("p"),ye.innerHTML=zr,Oo=s(),be=d("p"),be.textContent=Rr,et=s(),Me=d("p"),Me.innerHTML=Fr,ot=s(),se=d("img"),tt=s(),ve=d("small"),ve.innerHTML=Lr,rt=s(),Be=d("p"),Be.innerHTML=Wr,st=s(),h(Je.$$.fragment),nt=s(),ke=d("p"),ke.textContent=Vr,at=s(),xe=d("p"),xe.innerHTML=Pr,it=s(),Ue=d("p"),Ue.innerHTML=Gr,lt=s(),h(je.$$.fragment),dt=s(),$e=d("p"),$e.innerHTML=Hr,ct=s(),h(Ie.$$.fragment),mt=s(),Ce=d("p"),Ce.innerHTML=Xr,pt=s(),h(Ze.$$.fragment),gt=s(),ze=d("p"),ze.textContent=Er,ht=s(),Re=d("ul"),Re.innerHTML=qr,ft=s(),h(Fe.$$.fragment),ut=s(),R=d("div"),h(Ne.$$.fragment),Wt=s(),po=d("p"),po.innerHTML=Qr,Vt=s(),go=d("p"),go.innerHTML=Sr,Pt=s(),h(ne.$$.fragment),wt=s(),h(Le.$$.fragment),Tt=s(),F=d("div"),h(We.$$.fragment),Gt=s(),ho=d("p"),ho.innerHTML=Yr,Ht=s(),fo=d("p"),fo.innerHTML=Ar,Xt=s(),h(ae.$$.fragment),_t=s(),h(Ve.$$.fragment),yt=s(),N=d("div"),h(Pe.$$.fragment),Et=s(),uo=d("p"),uo.innerHTML=Dr,qt=s(),wo=d("p"),wo.innerHTML=Kr,Qt=s(),h(ie.$$.fragment),bt=s(),h(Ge.$$.fragment),Mt=s(),G=d("div"),h(He.$$.fragment),St=s(),To=d("p"),To.textContent=Or,Yt=s(),_o=d("div"),h(Xe.$$.fragment),vt=s(),h(Ee.$$.fragment),Bt=s(),H=d("div"),h(qe.$$.fragment),At=s(),yo=d("p"),yo.textContent=es,Dt=s(),bo=d("div"),h(Qe.$$.fragment),Jt=s(),h(Se.$$.fragment),kt=s(),L=d("div"),h(Ye.$$.fragment),Kt=s(),Mo=d("p"),Mo.textContent=os,Ot=s(),vo=d("p"),vo.innerHTML=ts,er=s(),Bo=d("div"),h(Ae.$$.fragment),xt=s(),h(De.$$.fragment),Ut=s(),x=d("div"),h(Ke.$$.fragment),or=s(),Jo=d("p"),Jo.textContent=rs,tr=s(),ko=d("p"),ko.innerHTML=ss,rr=s(),xo=d("p"),xo.innerHTML=ns,sr=s(),I=d("div"),h(Oe.$$.fragment),nr=s(),Uo=d("p"),Uo.innerHTML=as,ar=s(),h(le.$$.fragment),ir=s(),jo=d("ul"),jo.innerHTML=is,lr=s(),h(de.$$.fragment),jt=s(),h(eo.$$.fragment),$t=s(),U=d("div"),h(oo.$$.fragment),dr=s(),$o=d("p"),$o.textContent=ls,cr=s(),Io=d("p"),Io.innerHTML=ds,mr=s(),Co=d("p"),Co.innerHTML=cs,pr=s(),C=d("div"),h(to.$$.fragment),gr=s(),Zo=d("p"),Zo.innerHTML=ms,hr=s(),h(ce.$$.fragment),fr=s(),zo=d("ul"),zo.innerHTML=ps,ur=s(),h(me.$$.fragment),It=s(),h(ro.$$.fragment),Ct=s(),j=d("div"),h(so.$$.fragment),wr=s(),Ro=d("p"),Ro.textContent=gs,Tr=s(),Fo=d("p"),Fo.innerHTML=hs,_r=s(),No=d("p"),No.innerHTML=fs,yr=s(),Z=d("div"),h(no.$$.fragment),br=s(),Lo=d("p"),Lo.innerHTML=us,Mr=s(),h(pe.$$.fragment),vr=s(),Wo=d("ul"),Wo.innerHTML=ws,Br=s(),h(ge.$$.fragment),Zt=s(),h(ao.$$.fragment),zt=s(),$=d("div"),h(io.$$.fragment),Jr=s(),Vo=d("p"),Vo.textContent=Ts,kr=s(),Po=d("p"),Po.innerHTML=_s,xr=s(),Go=d("p"),Go.innerHTML=ys,Ur=s(),z=d("div"),h(lo.$$.fragment),jr=s(),Ho=d("p"),Ho.innerHTML=bs,$r=s(),h(he.$$.fragment),Ir=s(),Xo=d("ul"),Xo.innerHTML=Ms,Cr=s(),h(fe.$$.fragment),Rt=s(),h(co.$$.fragment),Ft=s(),Eo=d("p"),this.h()},l(e){const o=Us("svelte-u9bgzb",document.head);a=c(o,"META",{name:!0,content:!0}),o.forEach(t),b=n(e),p=c(e,"P",{}),J(p).forEach(t),m=n(e),y=c(e,"P",{"data-svelte-h":!0}),g(y)!=="svelte-170214h"&&(y.innerHTML=r),M=n(e),f(ue.$$.fragment,e),Yo=n(e),f(we.$$.fragment,e),Ao=n(e),f(Te.$$.fragment,e),Do=n(e),_e=c(e,"P",{"data-svelte-h":!0}),g(_e)!=="svelte-1qb4h26"&&(_e.innerHTML=Zr),Ko=n(e),ye=c(e,"P",{"data-svelte-h":!0}),g(ye)!=="svelte-gooud"&&(ye.innerHTML=zr),Oo=n(e),be=c(e,"P",{"data-svelte-h":!0}),g(be)!=="svelte-vfdo9a"&&(be.textContent=Rr),et=n(e),Me=c(e,"P",{"data-svelte-h":!0}),g(Me)!=="svelte-wv6d1z"&&(Me.innerHTML=Fr),ot=n(e),se=c(e,"IMG",{src:!0,alt:!0,width:!0}),tt=n(e),ve=c(e,"SMALL",{"data-svelte-h":!0}),g(ve)!=="svelte-fliqk1"&&(ve.innerHTML=Lr),rt=n(e),Be=c(e,"P",{"data-svelte-h":!0}),g(Be)!=="svelte-8ov80u"&&(Be.innerHTML=Wr),st=n(e),f(Je.$$.fragment,e),nt=n(e),ke=c(e,"P",{"data-svelte-h":!0}),g(ke)!=="svelte-pbbts2"&&(ke.textContent=Vr),at=n(e),xe=c(e,"P",{"data-svelte-h":!0}),g(xe)!=="svelte-b9ujn7"&&(xe.innerHTML=Pr),it=n(e),Ue=c(e,"P",{"data-svelte-h":!0}),g(Ue)!=="svelte-166y73j"&&(Ue.innerHTML=Gr),lt=n(e),f(je.$$.fragment,e),dt=n(e),$e=c(e,"P",{"data-svelte-h":!0}),g($e)!=="svelte-w5yzpy"&&($e.innerHTML=Hr),ct=n(e),f(Ie.$$.fragment,e),mt=n(e),Ce=c(e,"P",{"data-svelte-h":!0}),g(Ce)!=="svelte-vkvb9b"&&(Ce.innerHTML=Xr),pt=n(e),f(Ze.$$.fragment,e),gt=n(e),ze=c(e,"P",{"data-svelte-h":!0}),g(ze)!=="svelte-axv494"&&(ze.textContent=Er),ht=n(e),Re=c(e,"UL",{"data-svelte-h":!0}),g(Re)!=="svelte-6gpnqv"&&(Re.innerHTML=qr),ft=n(e),f(Fe.$$.fragment,e),ut=n(e),R=c(e,"DIV",{class:!0});var X=J(R);f(Ne.$$.fragment,X),Wt=n(X),po=c(X,"P",{"data-svelte-h":!0}),g(po)!=="svelte-16jlr7g"&&(po.innerHTML=Qr),Vt=n(X),go=c(X,"P",{"data-svelte-h":!0}),g(go)!=="svelte-1e8815j"&&(go.innerHTML=Sr),Pt=n(X),f(ne.$$.fragment,X),X.forEach(t),wt=n(e),f(Le.$$.fragment,e),Tt=n(e),F=c(e,"DIV",{class:!0});var E=J(F);f(We.$$.fragment,E),Gt=n(E),ho=c(E,"P",{"data-svelte-h":!0}),g(ho)!=="svelte-16jlr7g"&&(ho.innerHTML=Yr),Ht=n(E),fo=c(E,"P",{"data-svelte-h":!0}),g(fo)!=="svelte-1e8815j"&&(fo.innerHTML=Ar),Xt=n(E),f(ae.$$.fragment,E),E.forEach(t),_t=n(e),f(Ve.$$.fragment,e),yt=n(e),N=c(e,"DIV",{class:!0});var q=J(N);f(Pe.$$.fragment,q),Et=n(q),uo=c(q,"P",{"data-svelte-h":!0}),g(uo)!=="svelte-16jlr7g"&&(uo.innerHTML=Dr),qt=n(q),wo=c(q,"P",{"data-svelte-h":!0}),g(wo)!=="svelte-1e8815j"&&(wo.innerHTML=Kr),Qt=n(q),f(ie.$$.fragment,q),q.forEach(t),bt=n(e),f(Ge.$$.fragment,e),Mt=n(e),G=c(e,"DIV",{class:!0});var te=J(G);f(He.$$.fragment,te),St=n(te),To=c(te,"P",{"data-svelte-h":!0}),g(To)!=="svelte-1kelh3l"&&(To.textContent=Or),Yt=n(te),_o=c(te,"DIV",{class:!0});var qo=J(_o);f(Xe.$$.fragment,qo),qo.forEach(t),te.forEach(t),vt=n(e),f(Ee.$$.fragment,e),Bt=n(e),H=c(e,"DIV",{class:!0});var re=J(H);f(qe.$$.fragment,re),At=n(re),yo=c(re,"P",{"data-svelte-h":!0}),g(yo)!=="svelte-1kelh3l"&&(yo.textContent=es),Dt=n(re),bo=c(re,"DIV",{class:!0});var Qo=J(bo);f(Qe.$$.fragment,Qo),Qo.forEach(t),re.forEach(t),Jt=n(e),f(Se.$$.fragment,e),kt=n(e),L=c(e,"DIV",{class:!0});var Q=J(L);f(Ye.$$.fragment,Q),Kt=n(Q),Mo=c(Q,"P",{"data-svelte-h":!0}),g(Mo)!=="svelte-lhygst"&&(Mo.textContent=os),Ot=n(Q),vo=c(Q,"P",{"data-svelte-h":!0}),g(vo)!=="svelte-1xu720g"&&(vo.innerHTML=ts),er=n(Q),Bo=c(Q,"DIV",{class:!0});var So=J(Bo);f(Ae.$$.fragment,So),So.forEach(t),Q.forEach(t),xt=n(e),f(De.$$.fragment,e),Ut=n(e),x=c(e,"DIV",{class:!0});var W=J(x);f(Ke.$$.fragment,W),or=n(W),Jo=c(W,"P",{"data-svelte-h":!0}),g(Jo)!=="svelte-xbc9fk"&&(Jo.textContent=rs),tr=n(W),ko=c(W,"P",{"data-svelte-h":!0}),g(ko)!=="svelte-1gb3c10"&&(ko.innerHTML=ss),rr=n(W),xo=c(W,"P",{"data-svelte-h":!0}),g(xo)!=="svelte-hswkmf"&&(xo.innerHTML=ns),sr=n(W),I=c(W,"DIV",{class:!0});var V=J(I);f(Oe.$$.fragment,V),nr=n(V),Uo=c(V,"P",{"data-svelte-h":!0}),g(Uo)!=="svelte-1jy72sz"&&(Uo.innerHTML=as),ar=n(V),f(le.$$.fragment,V),ir=n(V),jo=c(V,"UL",{"data-svelte-h":!0}),g(jo)!=="svelte-g9kahc"&&(jo.innerHTML=is),lr=n(V),f(de.$$.fragment,V),V.forEach(t),W.forEach(t),jt=n(e),f(eo.$$.fragment,e),$t=n(e),U=c(e,"DIV",{class:!0});var Y=J(U);f(oo.$$.fragment,Y),dr=n(Y),$o=c(Y,"P",{"data-svelte-h":!0}),g($o)!=="svelte-7iw5gf"&&($o.textContent=ls),cr=n(Y),Io=c(Y,"P",{"data-svelte-h":!0}),g(Io)!=="svelte-1gb3c10"&&(Io.innerHTML=ds),mr=n(Y),Co=c(Y,"P",{"data-svelte-h":!0}),g(Co)!=="svelte-hswkmf"&&(Co.innerHTML=cs),pr=n(Y),C=c(Y,"DIV",{class:!0});var A=J(C);f(to.$$.fragment,A),gr=n(A),Zo=c(A,"P",{"data-svelte-h":!0}),g(Zo)!=="svelte-rcyov1"&&(Zo.innerHTML=ms),hr=n(A),f(ce.$$.fragment,A),fr=n(A),zo=c(A,"UL",{"data-svelte-h":!0}),g(zo)!=="svelte-1hg4msr"&&(zo.innerHTML=ps),ur=n(A),f(me.$$.fragment,A),A.forEach(t),Y.forEach(t),It=n(e),f(ro.$$.fragment,e),Ct=n(e),j=c(e,"DIV",{class:!0});var D=J(j);f(so.$$.fragment,D),wr=n(D),Ro=c(D,"P",{"data-svelte-h":!0}),g(Ro)!=="svelte-1mczdox"&&(Ro.textContent=gs),Tr=n(D),Fo=c(D,"P",{"data-svelte-h":!0}),g(Fo)!=="svelte-1gb3c10"&&(Fo.innerHTML=hs),_r=n(D),No=c(D,"P",{"data-svelte-h":!0}),g(No)!=="svelte-hswkmf"&&(No.innerHTML=fs),yr=n(D),Z=c(D,"DIV",{class:!0});var K=J(Z);f(no.$$.fragment,K),br=n(K),Lo=c(K,"P",{"data-svelte-h":!0}),g(Lo)!=="svelte-1b9qcsv"&&(Lo.innerHTML=us),Mr=n(K),f(pe.$$.fragment,K),vr=n(K),Wo=c(K,"UL",{"data-svelte-h":!0}),g(Wo)!=="svelte-7icumn"&&(Wo.innerHTML=ws),Br=n(K),f(ge.$$.fragment,K),K.forEach(t),D.forEach(t),Zt=n(e),f(ao.$$.fragment,e),zt=n(e),$=c(e,"DIV",{class:!0});var O=J($);f(io.$$.fragment,O),Jr=n(O),Vo=c(O,"P",{"data-svelte-h":!0}),g(Vo)!=="svelte-7q7qrd"&&(Vo.textContent=Ts),kr=n(O),Po=c(O,"P",{"data-svelte-h":!0}),g(Po)!=="svelte-1gb3c10"&&(Po.innerHTML=_s),xr=n(O),Go=c(O,"P",{"data-svelte-h":!0}),g(Go)!=="svelte-hswkmf"&&(Go.innerHTML=ys),Ur=n(O),z=c(O,"DIV",{class:!0});var ee=J(z);f(lo.$$.fragment,ee),jr=n(ee),Ho=c(ee,"P",{"data-svelte-h":!0}),g(Ho)!=="svelte-1x1k8u5"&&(Ho.innerHTML=bs),$r=n(ee),f(he.$$.fragment,ee),Ir=n(ee),Xo=c(ee,"UL",{"data-svelte-h":!0}),g(Xo)!=="svelte-7jmpe7"&&(Xo.innerHTML=Ms),Cr=n(ee),f(fe.$$.fragment,ee),ee.forEach(t),O.forEach(t),Rt=n(e),f(co.$$.fragment,e),Ft=n(e),Eo=c(e,"P",{}),J(Eo).forEach(t),this.h()},h(){B(a,"name","hf:doc:metadata"),B(a,"content",Hs),Bs(se.src,Nr="https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/transformers/model_doc/bridgetower_architecture%20.jpg")||B(se,"src",Nr),B(se,"alt","drawing"),B(se,"width","600"),B(R,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(F,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(N,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(_o,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(G,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(bo,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(H,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(Bo,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(L,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(I,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(x,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(C,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(U,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(Z,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(j,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B(z,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"),B($,"class","docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8")},m(e,o){l(document.head,a),i(e,b,o),i(e,p,o),i(e,m,o),i(e,y,o),i(e,M,o),u(ue,e,o),i(e,Yo,o),u(we,e,o),i(e,Ao,o),u(Te,e,o),i(e,Do,o),i(e,_e,o),i(e,Ko,o),i(e,ye,o),i(e,Oo,o),i(e,be,o),i(e,et,o),i(e,Me,o),i(e,ot,o),i(e,se,o),i(e,tt,o),i(e,ve,o),i(e,rt,o),i(e,Be,o),i(e,st,o),u(Je,e,o),i(e,nt,o),i(e,ke,o),i(e,at,o),i(e,xe,o),i(e,it,o),i(e,Ue,o),i(e,lt,o),u(je,e,o),i(e,dt,o),i(e,$e,o),i(e,ct,o),u(Ie,e,o),i(e,mt,o),i(e,Ce,o),i(e,pt,o),u(Ze,e,o),i(e,gt,o),i(e,ze,o),i(e,ht,o),i(e,Re,o),i(e,ft,o),u(Fe,e,o),i(e,ut,o),i(e,R,o),u(Ne,R,null),l(R,Wt),l(R,po),l(R,Vt),l(R,go),l(R,Pt),u(ne,R,null),i(e,wt,o),u(Le,e,o),i(e,Tt,o),i(e,F,o),u(We,F,null),l(F,Gt),l(F,ho),l(F,Ht),l(F,fo),l(F,Xt),u(ae,F,null),i(e,_t,o),u(Ve,e,o),i(e,yt,o),i(e,N,o),u(Pe,N,null),l(N,Et),l(N,uo),l(N,qt),l(N,wo),l(N,Qt),u(ie,N,null),i(e,bt,o),u(Ge,e,o),i(e,Mt,o),i(e,G,o),u(He,G,null),l(G,St),l(G,To),l(G,Yt),l(G,_o),u(Xe,_o,null),i(e,vt,o),u(Ee,e,o),i(e,Bt,o),i(e,H,o),u(qe,H,null),l(H,At),l(H,yo),l(H,Dt),l(H,bo),u(Qe,bo,null),i(e,Jt,o),u(Se,e,o),i(e,kt,o),i(e,L,o),u(Ye,L,null),l(L,Kt),l(L,Mo),l(L,Ot),l(L,vo),l(L,er),l(L,Bo),u(Ae,Bo,null),i(e,xt,o),u(De,e,o),i(e,Ut,o),i(e,x,o),u(Ke,x,null),l(x,or),l(x,Jo),l(x,tr),l(x,ko),l(x,rr),l(x,xo),l(x,sr),l(x,I),u(Oe,I,null),l(I,nr),l(I,Uo),l(I,ar),u(le,I,null),l(I,ir),l(I,jo),l(I,lr),u(de,I,null),i(e,jt,o),u(eo,e,o),i(e,$t,o),i(e,U,o),u(oo,U,null),l(U,dr),l(U,$o),l(U,cr),l(U,Io),l(U,mr),l(U,Co),l(U,pr),l(U,C),u(to,C,null),l(C,gr),l(C,Zo),l(C,hr),u(ce,C,null),l(C,fr),l(C,zo),l(C,ur),u(me,C,null),i(e,It,o),u(ro,e,o),i(e,Ct,o),i(e,j,o),u(so,j,null),l(j,wr),l(j,Ro),l(j,Tr),l(j,Fo),l(j,_r),l(j,No),l(j,yr),l(j,Z),u(no,Z,null),l(Z,br),l(Z,Lo),l(Z,Mr),u(pe,Z,null),l(Z,vr),l(Z,Wo),l(Z,Br),u(ge,Z,null),i(e,Zt,o),u(ao,e,o),i(e,zt,o),i(e,$,o),u(io,$,null),l($,Jr),l($,Vo),l($,kr),l($,Po),l($,xr),l($,Go),l($,Ur),l($,z),u(lo,z,null),l(z,jr),l(z,Ho),l(z,$r),u(he,z,null),l(z,Ir),l(z,Xo),l(z,Cr),u(fe,z,null),i(e,Rt,o),u(co,e,o),i(e,Ft,o),i(e,Eo,o),Nt=!0},p(e,[o]){const X={};o&2&&(X.$$scope={dirty:o,ctx:e}),ne.$set(X);const E={};o&2&&(E.$$scope={dirty:o,ctx:e}),ae.$set(E);const q={};o&2&&(q.$$scope={dirty:o,ctx:e}),ie.$set(q);const te={};o&2&&(te.$$scope={dirty:o,ctx:e}),le.$set(te);const qo={};o&2&&(qo.$$scope={dirty:o,ctx:e}),de.$set(qo);const re={};o&2&&(re.$$scope={dirty:o,ctx:e}),ce.$set(re);const Qo={};o&2&&(Qo.$$scope={dirty:o,ctx:e}),me.$set(Qo);const Q={};o&2&&(Q.$$scope={dirty:o,ctx:e}),pe.$set(Q);const So={};o&2&&(So.$$scope={dirty:o,ctx:e}),ge.$set(So);const W={};o&2&&(W.$$scope={dirty:o,ctx:e}),he.$set(W);const V={};o&2&&(V.$$scope={dirty:o,ctx:e}),fe.$set(V)},i(e){Nt||(w(ue.$$.fragment,e),w(we.$$.fragment,e),w(Te.$$.fragment,e),w(Je.$$.fragment,e),w(je.$$.fragment,e),w(Ie.$$.fragment,e),w(Ze.$$.fragment,e),w(Fe.$$.fragment,e),w(Ne.$$.fragment,e),w(ne.$$.fragment,e),w(Le.$$.fragment,e),w(We.$$.fragment,e),w(ae.$$.fragment,e),w(Ve.$$.fragment,e),w(Pe.$$.fragment,e),w(ie.$$.fragment,e),w(Ge.$$.fragment,e),w(He.$$.fragment,e),w(Xe.$$.fragment,e),w(Ee.$$.fragment,e),w(qe.$$.fragment,e),w(Qe.$$.fragment,e),w(Se.$$.fragment,e),w(Ye.$$.fragment,e),w(Ae.$$.fragment,e),w(De.$$.fragment,e),w(Ke.$$.fragment,e),w(Oe.$$.fragment,e),w(le.$$.fragment,e),w(de.$$.fragment,e),w(eo.$$.fragment,e),w(oo.$$.fragment,e),w(to.$$.fragment,e),w(ce.$$.fragment,e),w(me.$$.fragment,e),w(ro.$$.fragment,e),w(so.$$.fragment,e),w(no.$$.fragment,e),w(pe.$$.fragment,e),w(ge.$$.fragment,e),w(ao.$$.fragment,e),w(io.$$.fragment,e),w(lo.$$.fragment,e),w(he.$$.fragment,e),w(fe.$$.fragment,e),w(co.$$.fragment,e),Nt=!0)},o(e){T(ue.$$.fragment,e),T(we.$$.fragment,e),T(Te.$$.fragment,e),T(Je.$$.fragment,e),T(je.$$.fragment,e),T(Ie.$$.fragment,e),T(Ze.$$.fragment,e),T(Fe.$$.fragment,e),T(Ne.$$.fragment,e),T(ne.$$.fragment,e),T(Le.$$.fragment,e),T(We.$$.fragment,e),T(ae.$$.fragment,e),T(Ve.$$.fragment,e),T(Pe.$$.fragment,e),T(ie.$$.fragment,e),T(Ge.$$.fragment,e),T(He.$$.fragment,e),T(Xe.$$.fragment,e),T(Ee.$$.fragment,e),T(qe.$$.fragment,e),T(Qe.$$.fragment,e),T(Se.$$.fragment,e),T(Ye.$$.fragment,e),T(Ae.$$.fragment,e),T(De.$$.fragment,e),T(Ke.$$.fragment,e),T(Oe.$$.fragment,e),T(le.$$.fragment,e),T(de.$$.fragment,e),T(eo.$$.fragment,e),T(oo.$$.fragment,e),T(to.$$.fragment,e),T(ce.$$.fragment,e),T(me.$$.fragment,e),T(ro.$$.fragment,e),T(so.$$.fragment,e),T(no.$$.fragment,e),T(pe.$$.fragment,e),T(ge.$$.fragment,e),T(ao.$$.fragment,e),T(io.$$.fragment,e),T(lo.$$.fragment,e),T(he.$$.fragment,e),T(fe.$$.fragment,e),T(co.$$.fragment,e),Nt=!1},d(e){e&&(t(b),t(p),t(m),t(y),t(M),t(Yo),t(Ao),t(Do),t(_e),t(Ko),t(ye),t(Oo),t(be),t(et),t(Me),t(ot),t(se),t(tt),t(ve),t(rt),t(Be),t(st),t(nt),t(ke),t(at),t(xe),t(it),t(Ue),t(lt),t(dt),t($e),t(ct),t(mt),t(Ce),t(pt),t(gt),t(ze),t(ht),t(Re),t(ft),t(ut),t(R),t(wt),t(Tt),t(F),t(_t),t(yt),t(N),t(bt),t(Mt),t(G),t(vt),t(Bt),t(H),t(Jt),t(kt),t(L),t(xt),t(Ut),t(x),t(jt),t($t),t(U),t(It),t(Ct),t(j),t(Zt),t(zt),t($),t(Rt),t(Ft),t(Eo)),t(a),_(ue,e),_(we,e),_(Te,e),_(Je,e),_(je,e),_(Ie,e),_(Ze,e),_(Fe,e),_(Ne),_(ne),_(Le,e),_(We),_(ae),_(Ve,e),_(Pe),_(ie),_(Ge,e),_(He),_(Xe),_(Ee,e),_(qe),_(Qe),_(Se,e),_(Ye),_(Ae),_(De,e),_(Ke),_(Oe),_(le),_(de),_(eo,e),_(oo),_(to),_(ce),_(me),_(ro,e),_(so),_(no),_(pe),_(ge),_(ao,e),_(io),_(lo),_(he),_(fe),_(co,e)}}}const Hs='{"title":"BridgeTower","local":"bridgetower","sections":[{"title":"Overview","local":"overview","sections":[],"depth":2},{"title":"Usage tips and examples","local":"usage-tips-and-examples","sections":[],"depth":2},{"title":"BridgeTowerConfig","local":"transformers.BridgeTowerConfig","sections":[],"depth":2},{"title":"BridgeTowerTextConfig","local":"transformers.BridgeTowerTextConfig","sections":[],"depth":2},{"title":"BridgeTowerVisionConfig","local":"transformers.BridgeTowerVisionConfig","sections":[],"depth":2},{"title":"BridgeTowerImageProcessor","local":"transformers.BridgeTowerImageProcessor","sections":[],"depth":2},{"title":"BridgeTowerImageProcessorPil","local":"transformers.BridgeTowerImageProcessorPil","sections":[],"depth":2},{"title":"BridgeTowerProcessor","local":"transformers.BridgeTowerProcessor","sections":[],"depth":2},{"title":"BridgeTowerModel","local":"transformers.BridgeTowerModel","sections":[],"depth":2},{"title":"BridgeTowerForContrastiveLearning","local":"transformers.BridgeTowerForContrastiveLearning","sections":[],"depth":2},{"title":"BridgeTowerForMaskedLM","local":"transformers.BridgeTowerForMaskedLM","sections":[],"depth":2},{"title":"BridgeTowerForImageAndTextRetrieval","local":"transformers.BridgeTowerForImageAndTextRetrieval","sections":[],"depth":2}],"depth":1}';function Xs(v){return Js(()=>{new URLSearchParams(window.location.search).get("fw")}),[]}class Os extends ks{constructor(a){super(),xs(this,a,Xs,Gs,vs,{})}}export{Os as component};

Xet Storage Details

Size:
133 kB
·
Xet hash:
3cffebbcd635436a3c0a96c141389505381c82f50ea142f1202464e7be294ba9

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.