Buckets:

download
raw
11.4 kB
import"../chunks/DsnmJJEf.js";import{i as M,h as P,C,H as n,D as t,E,s as H}from"../chunks/DdsaYIhL.js";import{p as S,o as q,s as a,f as B,a as z,b as O,c as e,d as T,n as o,r as i}from"../chunks/Cq6T2TQD.js";const R='{"title":"AdaGrad","local":"adagrad","sections":[{"title":"Adagrad","local":"api-class ][ bitsandbytes.optim.Adagrad","sections":[],"depth":2},{"title":"Adagrad8bit","local":"bitsandbytes.optim.Adagrad8bit","sections":[],"depth":2},{"title":"Adagrad32bit","local":"bitsandbytes.optim.Adagrad32bit","sections":[],"depth":2}],"depth":1}';var U=T('<meta name="hf:doc:metadata"/>'),k=T('<p></p> <!> <!> <p><a href="https://jmlr.org/papers/v12/duchi11a.html" rel="nofollow">AdaGrad (Adaptive Gradient)</a> is an adaptive learning rate optimizer. AdaGrad stores a sum of the squared past gradients for each parameter and uses it to scale their learning rate. This allows the learning rate to be automatically lower or higher depending on the magnitude of the gradient, eliminating the need to manually tune the learning rate.</p> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>Base Adagrad optimizer.</p></div></div> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>8-bit Adagrad optimizer.</p></div></div> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>32-bit Adagrad optimizer.</p></div></div> <!> <p></p>',1);function K(w,N){S(N,!1),q(()=>{new URLSearchParams(window.location.search).get("fw")}),M();var m=k();P("9avx3d",A=>{var x=U();H(x,"content",R),z(A,x)});var l=a(B(m),2);C(l,{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"});var _=a(l,2);n(_,{title:"AdaGrad",local:"adagrad",headingTag:"h1"});var c=a(_,4);n(c,{title:"Adagrad",local:"api-class ][ bitsandbytes.optim.Adagrad",headingTag:"h2"});var r=a(c,2),b=e(r);t(b,{name:"class bitsandbytes.optim.Adagrad",anchor:"bitsandbytes.optim.Adagrad",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2038/bitsandbytes/optim/adagrad.py#L8",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.01"},{name:"lr_decay",val:" = 0"},{name:"weight_decay",val:" = 0"},{name:"initial_accumulator_value",val:" = 0"},{name:"eps",val:" = 1e-10"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"}]});var p=a(b,2),L=e(p);t(L,{name:"__init__",anchor:"bitsandbytes.optim.Adagrad.__init__",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2038/bitsandbytes/optim/adagrad.py#L9",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.01"},{name:"lr_decay",val:" = 0"},{name:"weight_decay",val:" = 0"},{name:"initial_accumulator_value",val:" = 0"},{name:"eps",val:" = 1e-10"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"}],parametersDescription:[{anchor:"bitsandbytes.optim.Adagrad.__init__.params",description:`<strong>params</strong> (<code>torch.tensor</code>) &#x2014;
The input parameters to optimize.`,name:"params"},{anchor:"bitsandbytes.optim.Adagrad.__init__.lr",description:`<strong>lr</strong> (<code>float</code>, defaults to 1e-2) &#x2014;
The learning rate.`,name:"lr"},{anchor:"bitsandbytes.optim.Adagrad.__init__.lr_decay",description:`<strong>lr_decay</strong> (<code>int</code>, defaults to 0) &#x2014;
The learning rate decay.`,name:"lr_decay"},{anchor:"bitsandbytes.optim.Adagrad.__init__.weight_decay",description:`<strong>weight_decay</strong> (<code>float</code>, defaults to 0.0) &#x2014;
The weight decay value for the optimizer.`,name:"weight_decay"},{anchor:"bitsandbytes.optim.Adagrad.__init__.initial_accumulator_value",description:`<strong>initial_accumulator_value</strong> (<code>int</code>, defaults to 0) &#x2014;
The initial momemtum values.`,name:"initial_accumulator_value"},{anchor:"bitsandbytes.optim.Adagrad.__init__.eps",description:`<strong>eps</strong> (<code>float</code>, defaults to 1e-10) &#x2014;
The epsilon value prevents division by zero in the optimizer.`,name:"eps"},{anchor:"bitsandbytes.optim.Adagrad.__init__.optim_bits",description:`<strong>optim_bits</strong> (<code>int</code>, defaults to 32) &#x2014;
The number of bits of the optimizer state.`,name:"optim_bits"},{anchor:"bitsandbytes.optim.Adagrad.__init__.args",description:`<strong>args</strong> (<code>object</code>, defaults to <code>None</code>) &#x2014;
An object with additional arguments.`,name:"args"},{anchor:"bitsandbytes.optim.Adagrad.__init__.min_8bit_size",description:`<strong>min_8bit_size</strong> (<code>int</code>, defaults to 4096) &#x2014;
The minimum number of elements of the parameter tensors for 8-bit optimization.`,name:"min_8bit_size"}]}),o(2),i(p),i(r);var g=a(r,2);n(g,{title:"Adagrad8bit",local:"bitsandbytes.optim.Adagrad8bit",headingTag:"h2"});var s=a(g,2),h=e(s);t(h,{name:"class bitsandbytes.optim.Adagrad8bit",anchor:"bitsandbytes.optim.Adagrad8bit",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2038/bitsandbytes/optim/adagrad.py#L67",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.01"},{name:"lr_decay",val:" = 0"},{name:"weight_decay",val:" = 0"},{name:"initial_accumulator_value",val:" = 0"},{name:"eps",val:" = 1e-10"},{name:"optim_bits",val:" = 8"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"}]});var u=a(h,2),j=e(u);t(j,{name:"__init__",anchor:"bitsandbytes.optim.Adagrad8bit.__init__",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2038/bitsandbytes/optim/adagrad.py#L68",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.01"},{name:"lr_decay",val:" = 0"},{name:"weight_decay",val:" = 0"},{name:"initial_accumulator_value",val:" = 0"},{name:"eps",val:" = 1e-10"},{name:"optim_bits",val:" = 8"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"}],parametersDescription:[{anchor:"bitsandbytes.optim.Adagrad8bit.__init__.params",description:`<strong>params</strong> (<code>torch.tensor</code>) &#x2014;
The input parameters to optimize.`,name:"params"},{anchor:"bitsandbytes.optim.Adagrad8bit.__init__.lr",description:`<strong>lr</strong> (<code>float</code>, defaults to 1e-2) &#x2014;
The learning rate.`,name:"lr"},{anchor:"bitsandbytes.optim.Adagrad8bit.__init__.lr_decay",description:`<strong>lr_decay</strong> (<code>int</code>, defaults to 0) &#x2014;
The learning rate decay.`,name:"lr_decay"},{anchor:"bitsandbytes.optim.Adagrad8bit.__init__.weight_decay",description:`<strong>weight_decay</strong> (<code>float</code>, defaults to 0.0) &#x2014;
The weight decay value for the optimizer.`,name:"weight_decay"},{anchor:"bitsandbytes.optim.Adagrad8bit.__init__.initial_accumulator_value",description:`<strong>initial_accumulator_value</strong> (<code>int</code>, defaults to 0) &#x2014;
The initial momemtum values.`,name:"initial_accumulator_value"},{anchor:"bitsandbytes.optim.Adagrad8bit.__init__.eps",description:`<strong>eps</strong> (<code>float</code>, defaults to 1e-10) &#x2014;
The epsilon value prevents division by zero in the optimizer.`,name:"eps"},{anchor:"bitsandbytes.optim.Adagrad8bit.__init__.optim_bits",description:`<strong>optim_bits</strong> (<code>int</code>, defaults to 8) &#x2014;
The number of bits of the optimizer state.
Note: This parameter is not used in Adagrad8bit as it always uses 8-bit optimization.`,name:"optim_bits"},{anchor:"bitsandbytes.optim.Adagrad8bit.__init__.args",description:`<strong>args</strong> (<code>object</code>, defaults to <code>None</code>) &#x2014;
An object with additional arguments.`,name:"args"},{anchor:"bitsandbytes.optim.Adagrad8bit.__init__.min_8bit_size",description:`<strong>min_8bit_size</strong> (<code>int</code>, defaults to 4096) &#x2014;
The minimum number of elements of the parameter tensors for 8-bit optimization.`,name:"min_8bit_size"}]}),o(2),i(u),i(s);var v=a(s,2);n(v,{title:"Adagrad32bit",local:"bitsandbytes.optim.Adagrad32bit",headingTag:"h2"});var d=a(v,2),y=e(d);t(y,{name:"class bitsandbytes.optim.Adagrad32bit",anchor:"bitsandbytes.optim.Adagrad32bit",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2038/bitsandbytes/optim/adagrad.py#L131",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.01"},{name:"lr_decay",val:" = 0"},{name:"weight_decay",val:" = 0"},{name:"initial_accumulator_value",val:" = 0"},{name:"eps",val:" = 1e-10"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"}]});var f=a(y,2),G=e(f);t(G,{name:"__init__",anchor:"bitsandbytes.optim.Adagrad32bit.__init__",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2038/bitsandbytes/optim/adagrad.py#L132",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.01"},{name:"lr_decay",val:" = 0"},{name:"weight_decay",val:" = 0"},{name:"initial_accumulator_value",val:" = 0"},{name:"eps",val:" = 1e-10"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"}],parametersDescription:[{anchor:"bitsandbytes.optim.Adagrad32bit.__init__.params",description:`<strong>params</strong> (<code>torch.tensor</code>) &#x2014;
The input parameters to optimize.`,name:"params"},{anchor:"bitsandbytes.optim.Adagrad32bit.__init__.lr",description:`<strong>lr</strong> (<code>float</code>, defaults to 1e-2) &#x2014;
The learning rate.`,name:"lr"},{anchor:"bitsandbytes.optim.Adagrad32bit.__init__.lr_decay",description:`<strong>lr_decay</strong> (<code>int</code>, defaults to 0) &#x2014;
The learning rate decay.`,name:"lr_decay"},{anchor:"bitsandbytes.optim.Adagrad32bit.__init__.weight_decay",description:`<strong>weight_decay</strong> (<code>float</code>, defaults to 0.0) &#x2014;
The weight decay value for the optimizer.`,name:"weight_decay"},{anchor:"bitsandbytes.optim.Adagrad32bit.__init__.initial_accumulator_value",description:`<strong>initial_accumulator_value</strong> (<code>int</code>, defaults to 0) &#x2014;
The initial momemtum values.`,name:"initial_accumulator_value"},{anchor:"bitsandbytes.optim.Adagrad32bit.__init__.eps",description:`<strong>eps</strong> (<code>float</code>, defaults to 1e-10) &#x2014;
The epsilon value prevents division by zero in the optimizer.`,name:"eps"},{anchor:"bitsandbytes.optim.Adagrad32bit.__init__.optim_bits",description:`<strong>optim_bits</strong> (<code>int</code>, defaults to 32) &#x2014;
The number of bits of the optimizer state.`,name:"optim_bits"},{anchor:"bitsandbytes.optim.Adagrad32bit.__init__.args",description:`<strong>args</strong> (<code>object</code>, defaults to <code>None</code>) &#x2014;
An object with additional arguments.`,name:"args"},{anchor:"bitsandbytes.optim.Adagrad32bit.__init__.min_8bit_size",description:`<strong>min_8bit_size</strong> (<code>int</code>, defaults to 4096) &#x2014;
The minimum number of elements of the parameter tensors for 8-bit optimization.`,name:"min_8bit_size"}]}),o(2),i(f),i(d);var D=a(d,2);E(D,{source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/main/docs/source/reference/optim/adagrad.mdx"}),o(2),z(w,m),O()}export{K as component};

Xet Storage Details

Size:
11.4 kB
·
Xet hash:
00b506c34a6c3a65a419870cddee0441697284ed8dfb088f469d0750c7c7ec47

Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.