Buckets:
| import"../chunks/DsnmJJEf.js";import{i as J,h as K,C as Q,H as o,D as e,E as V,s as X}from"../chunks/DT0OpeMJ.js";import{p as Y,o as Z,s as t,f as $,a as S,b as tt,c as a,d as q,n as s,r as i}from"../chunks/Bb-LL0eD.js";const et='{"title":"Adam","local":"adam","sections":[{"title":"Adam","local":"api-class ][ bitsandbytes.optim.Adam","sections":[],"depth":2},{"title":"Adam8bit","local":"bitsandbytes.optim.Adam8bit","sections":[],"depth":2},{"title":"Adam32bit","local":"bitsandbytes.optim.Adam32bit","sections":[],"depth":2},{"title":"PagedAdam","local":"bitsandbytes.optim.PagedAdam","sections":[],"depth":2},{"title":"PagedAdam8bit","local":"bitsandbytes.optim.PagedAdam8bit","sections":[],"depth":2},{"title":"PagedAdam32bit","local":"bitsandbytes.optim.PagedAdam32bit","sections":[],"depth":2}],"depth":1}';var at=q('<meta name="hf:doc:metadata"/>'),it=q('<p></p> <!> <!> <p><a href="https://hf.co/papers/1412.6980" rel="nofollow">Adam (Adaptive moment estimation)</a> is an adaptive learning rate optimizer, combining ideas from <code>SGD</code> with momentum and <code>RMSprop</code> to automatically scale the learning rate:</p> <ul><li>a weighted average of the past gradients to provide direction (first-moment)</li> <li>a weighted average of the <em>squared</em> past gradients to adapt the learning rate to each parameter (second-moment)</li></ul> <p>bitsandbytes also supports paged optimizers which take advantage of CUDAs unified memory to transfer memory from the GPU to the CPU when GPU memory is exhausted.</p> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>Base Adam optimizer.</p></div></div> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>8-bit Adam optimizer.</p></div></div> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>32-bit Adam optimizer.</p></div></div> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>Paged Adam optimizer.</p></div></div> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>8-bit paged Adam optimizer.</p></div></div> <!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <div class="docstring border-l-2 border-t-2 pl-4 pt-3.5 border-gray-100 rounded-tl-xl mb-6 mt-8"><!> <p>Paged 32-bit Adam optimizer.</p></div></div> <!> <p></p>',1);function dt(U,C){Y(C,!1),Z(()=>{new URLSearchParams(window.location.search).get("fw")}),J();var l=it();K("10jb1rm",G=>{var M=at();X(M,"content",et),S(G,M)});var _=t($(l),2);Q(_,{containerStyle:"float: right; margin-left: 10px; display: inline-flex; position: relative; z-index: 10;"});var c=t(_,2);o(c,{title:"Adam",local:"adam",headingTag:"h1"});var g=t(c,8);o(g,{title:"Adam",local:"api-class ][ bitsandbytes.optim.Adam",headingTag:"h2"});var n=t(g,2),h=a(n);e(h,{name:"class bitsandbytes.optim.Adam",anchor:"bitsandbytes.optim.Adam",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L9",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}]});var v=t(h,2),E=a(v);e(E,{name:"__init__",anchor:"bitsandbytes.optim.Adam.__init__",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L10",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}],parametersDescription:[{anchor:"bitsandbytes.optim.Adam.__init__.params",description:`<strong>params</strong> (<code>torch.tensor</code>) — | |
| The input parameters to optimize.`,name:"params"},{anchor:"bitsandbytes.optim.Adam.__init__.lr",description:`<strong>lr</strong> (<code>float</code>, defaults to 1e-3) — | |
| The learning rate.`,name:"lr"},{anchor:"bitsandbytes.optim.Adam.__init__.betas",description:`<strong>betas</strong> (<code>tuple(float, float)</code>, defaults to (0.9, 0.999)) — | |
| The beta values are the decay rates of the first and second-order moment of the optimizer.`,name:"betas"},{anchor:"bitsandbytes.optim.Adam.__init__.eps",description:`<strong>eps</strong> (<code>float</code>, defaults to 1e-8) — | |
| The epsilon value prevents division by zero in the optimizer.`,name:"eps"},{anchor:"bitsandbytes.optim.Adam.__init__.weight_decay",description:`<strong>weight_decay</strong> (<code>float</code>, defaults to 0.0) — | |
| The weight decay value for the optimizer.`,name:"weight_decay"},{anchor:"bitsandbytes.optim.Adam.__init__.amsgrad",description:`<strong>amsgrad</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to use the <a href="https://hf.co/papers/1904.09237" rel="nofollow">AMSGrad</a> variant of Adam that uses the maximum of past squared gradients instead.`,name:"amsgrad"},{anchor:"bitsandbytes.optim.Adam.__init__.optim_bits",description:`<strong>optim_bits</strong> (<code>int</code>, defaults to 32) — | |
| The number of bits of the optimizer state.`,name:"optim_bits"},{anchor:"bitsandbytes.optim.Adam.__init__.args",description:`<strong>args</strong> (<code>object</code>, defaults to <code>None</code>) — | |
| An object with additional arguments.`,name:"args"},{anchor:"bitsandbytes.optim.Adam.__init__.min_8bit_size",description:`<strong>min_8bit_size</strong> (<code>int</code>, defaults to 4096) — | |
| The minimum number of elements of the parameter tensors for 8-bit optimization.`,name:"min_8bit_size"},{anchor:"bitsandbytes.optim.Adam.__init__.is_paged",description:`<strong>is_paged</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether the optimizer is a paged optimizer or not.`,name:"is_paged"}]}),s(2),i(v),i(n);var y=t(n,2);o(y,{title:"Adam8bit",local:"bitsandbytes.optim.Adam8bit",headingTag:"h2"});var d=t(y,2),u=a(d);e(u,{name:"class bitsandbytes.optim.Adam8bit",anchor:"bitsandbytes.optim.Adam8bit",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L62",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}]});var f=t(u,2),H=a(f);e(H,{name:"__init__",anchor:"bitsandbytes.optim.Adam8bit.__init__",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L63",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}],parametersDescription:[{anchor:"bitsandbytes.optim.Adam8bit.__init__.params",description:`<strong>params</strong> (<code>torch.tensor</code>) — | |
| The input parameters to optimize.`,name:"params"},{anchor:"bitsandbytes.optim.Adam8bit.__init__.lr",description:`<strong>lr</strong> (<code>float</code>, defaults to 1e-3) — | |
| The learning rate.`,name:"lr"},{anchor:"bitsandbytes.optim.Adam8bit.__init__.betas",description:`<strong>betas</strong> (<code>tuple(float, float)</code>, defaults to (0.9, 0.999)) — | |
| The beta values are the decay rates of the first and second-order moment of the optimizer.`,name:"betas"},{anchor:"bitsandbytes.optim.Adam8bit.__init__.eps",description:`<strong>eps</strong> (<code>float</code>, defaults to 1e-8) — | |
| The epsilon value prevents division by zero in the optimizer.`,name:"eps"},{anchor:"bitsandbytes.optim.Adam8bit.__init__.weight_decay",description:`<strong>weight_decay</strong> (<code>float</code>, defaults to 0.0) — | |
| The weight decay value for the optimizer.`,name:"weight_decay"},{anchor:"bitsandbytes.optim.Adam8bit.__init__.amsgrad",description:`<strong>amsgrad</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to use the <a href="https://hf.co/papers/1904.09237" rel="nofollow">AMSGrad</a> variant of Adam that uses the maximum of past squared gradients instead. | |
| Note: This parameter is not supported in Adam8bit and must be False.`,name:"amsgrad"},{anchor:"bitsandbytes.optim.Adam8bit.__init__.optim_bits",description:`<strong>optim_bits</strong> (<code>int</code>, defaults to 32) — | |
| The number of bits of the optimizer state. | |
| Note: This parameter is not used in Adam8bit as it always uses 8-bit optimization.`,name:"optim_bits"},{anchor:"bitsandbytes.optim.Adam8bit.__init__.args",description:`<strong>args</strong> (<code>object</code>, defaults to <code>None</code>) — | |
| An object with additional arguments.`,name:"args"},{anchor:"bitsandbytes.optim.Adam8bit.__init__.min_8bit_size",description:`<strong>min_8bit_size</strong> (<code>int</code>, defaults to 4096) — | |
| The minimum number of elements of the parameter tensors for 8-bit optimization.`,name:"min_8bit_size"},{anchor:"bitsandbytes.optim.Adam8bit.__init__.is_paged",description:`<strong>is_paged</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether the optimizer is a paged optimizer or not.`,name:"is_paged"}]}),s(2),i(f),i(d);var A=t(d,2);o(A,{title:"Adam32bit",local:"bitsandbytes.optim.Adam32bit",headingTag:"h2"});var r=t(A,2),z=a(r);e(z,{name:"class bitsandbytes.optim.Adam32bit",anchor:"bitsandbytes.optim.Adam32bit",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L126",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}]});var x=t(z,2),R=a(x);e(R,{name:"__init__",anchor:"bitsandbytes.optim.Adam32bit.__init__",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L127",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}],parametersDescription:[{anchor:"bitsandbytes.optim.Adam32bit.__init__.params",description:`<strong>params</strong> (<code>torch.tensor</code>) — | |
| The input parameters to optimize.`,name:"params"},{anchor:"bitsandbytes.optim.Adam32bit.__init__.lr",description:`<strong>lr</strong> (<code>float</code>, defaults to 1e-3) — | |
| The learning rate.`,name:"lr"},{anchor:"bitsandbytes.optim.Adam32bit.__init__.betas",description:`<strong>betas</strong> (<code>tuple(float, float)</code>, defaults to (0.9, 0.999)) — | |
| The beta values are the decay rates of the first and second-order moment of the optimizer.`,name:"betas"},{anchor:"bitsandbytes.optim.Adam32bit.__init__.eps",description:`<strong>eps</strong> (<code>float</code>, defaults to 1e-8) — | |
| The epsilon value prevents division by zero in the optimizer.`,name:"eps"},{anchor:"bitsandbytes.optim.Adam32bit.__init__.weight_decay",description:`<strong>weight_decay</strong> (<code>float</code>, defaults to 0.0) — | |
| The weight decay value for the optimizer.`,name:"weight_decay"},{anchor:"bitsandbytes.optim.Adam32bit.__init__.amsgrad",description:`<strong>amsgrad</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to use the <a href="https://hf.co/papers/1904.09237" rel="nofollow">AMSGrad</a> variant of Adam that uses the maximum of past squared gradients instead.`,name:"amsgrad"},{anchor:"bitsandbytes.optim.Adam32bit.__init__.optim_bits",description:`<strong>optim_bits</strong> (<code>int</code>, defaults to 32) — | |
| The number of bits of the optimizer state.`,name:"optim_bits"},{anchor:"bitsandbytes.optim.Adam32bit.__init__.args",description:`<strong>args</strong> (<code>object</code>, defaults to <code>None</code>) — | |
| An object with additional arguments.`,name:"args"},{anchor:"bitsandbytes.optim.Adam32bit.__init__.min_8bit_size",description:`<strong>min_8bit_size</strong> (<code>int</code>, defaults to 4096) — | |
| The minimum number of elements of the parameter tensors for 8-bit optimization.`,name:"min_8bit_size"},{anchor:"bitsandbytes.optim.Adam32bit.__init__.is_paged",description:`<strong>is_paged</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether the optimizer is a paged optimizer or not.`,name:"is_paged"}]}),s(2),i(x),i(r);var P=t(r,2);o(P,{title:"PagedAdam",local:"bitsandbytes.optim.PagedAdam",headingTag:"h2"});var m=t(P,2),w=a(m);e(w,{name:"class bitsandbytes.optim.PagedAdam",anchor:"bitsandbytes.optim.PagedAdam",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L179",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}]});var T=t(w,2),k=a(T);e(k,{name:"__init__",anchor:"bitsandbytes.optim.PagedAdam.__init__",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L180",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}],parametersDescription:[{anchor:"bitsandbytes.optim.PagedAdam.__init__.params",description:`<strong>params</strong> (<code>torch.tensor</code>) — | |
| The input parameters to optimize.`,name:"params"},{anchor:"bitsandbytes.optim.PagedAdam.__init__.lr",description:`<strong>lr</strong> (<code>float</code>, defaults to 1e-3) — | |
| The learning rate.`,name:"lr"},{anchor:"bitsandbytes.optim.PagedAdam.__init__.betas",description:`<strong>betas</strong> (<code>tuple(float, float)</code>, defaults to (0.9, 0.999)) — | |
| The beta values are the decay rates of the first and second-order moment of the optimizer.`,name:"betas"},{anchor:"bitsandbytes.optim.PagedAdam.__init__.eps",description:`<strong>eps</strong> (<code>float</code>, defaults to 1e-8) — | |
| The epsilon value prevents division by zero in the optimizer.`,name:"eps"},{anchor:"bitsandbytes.optim.PagedAdam.__init__.weight_decay",description:`<strong>weight_decay</strong> (<code>float</code>, defaults to 0.0) — | |
| The weight decay value for the optimizer.`,name:"weight_decay"},{anchor:"bitsandbytes.optim.PagedAdam.__init__.amsgrad",description:`<strong>amsgrad</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to use the <a href="https://hf.co/papers/1904.09237" rel="nofollow">AMSGrad</a> variant of Adam that uses the maximum of past squared gradients instead.`,name:"amsgrad"},{anchor:"bitsandbytes.optim.PagedAdam.__init__.optim_bits",description:`<strong>optim_bits</strong> (<code>int</code>, defaults to 32) — | |
| The number of bits of the optimizer state.`,name:"optim_bits"},{anchor:"bitsandbytes.optim.PagedAdam.__init__.args",description:`<strong>args</strong> (<code>object</code>, defaults to <code>None</code>) — | |
| An object with additional arguments.`,name:"args"},{anchor:"bitsandbytes.optim.PagedAdam.__init__.min_8bit_size",description:`<strong>min_8bit_size</strong> (<code>int</code>, defaults to 4096) — | |
| The minimum number of elements of the parameter tensors for 8-bit optimization.`,name:"min_8bit_size"},{anchor:"bitsandbytes.optim.PagedAdam.__init__.is_paged",description:`<strong>is_paged</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether the optimizer is a paged optimizer or not.`,name:"is_paged"}]}),s(2),i(T),i(m);var F=t(m,2);o(F,{title:"PagedAdam8bit",local:"bitsandbytes.optim.PagedAdam8bit",headingTag:"h2"});var b=t(F,2),N=a(b);e(N,{name:"class bitsandbytes.optim.PagedAdam8bit",anchor:"bitsandbytes.optim.PagedAdam8bit",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L232",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}]});var L=t(N,2),B=a(L);e(B,{name:"__init__",anchor:"bitsandbytes.optim.PagedAdam8bit.__init__",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L233",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}],parametersDescription:[{anchor:"bitsandbytes.optim.PagedAdam8bit.__init__.params",description:`<strong>params</strong> (<code>torch.tensor</code>) — | |
| The input parameters to optimize.`,name:"params"},{anchor:"bitsandbytes.optim.PagedAdam8bit.__init__.lr",description:`<strong>lr</strong> (<code>float</code>, defaults to 1e-3) — | |
| The learning rate.`,name:"lr"},{anchor:"bitsandbytes.optim.PagedAdam8bit.__init__.betas",description:`<strong>betas</strong> (<code>tuple(float, float)</code>, defaults to (0.9, 0.999)) — | |
| The beta values are the decay rates of the first and second-order moment of the optimizer.`,name:"betas"},{anchor:"bitsandbytes.optim.PagedAdam8bit.__init__.eps",description:`<strong>eps</strong> (<code>float</code>, defaults to 1e-8) — | |
| The epsilon value prevents division by zero in the optimizer.`,name:"eps"},{anchor:"bitsandbytes.optim.PagedAdam8bit.__init__.weight_decay",description:`<strong>weight_decay</strong> (<code>float</code>, defaults to 0.0) — | |
| The weight decay value for the optimizer.`,name:"weight_decay"},{anchor:"bitsandbytes.optim.PagedAdam8bit.__init__.amsgrad",description:`<strong>amsgrad</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to use the <a href="https://hf.co/papers/1904.09237" rel="nofollow">AMSGrad</a> variant of Adam that uses the maximum of past squared gradients instead. | |
| Note: This parameter is not supported in PagedAdam8bit and must be False.`,name:"amsgrad"},{anchor:"bitsandbytes.optim.PagedAdam8bit.__init__.optim_bits",description:`<strong>optim_bits</strong> (<code>int</code>, defaults to 32) — | |
| The number of bits of the optimizer state. | |
| Note: This parameter is not used in PagedAdam8bit as it always uses 8-bit optimization.`,name:"optim_bits"},{anchor:"bitsandbytes.optim.PagedAdam8bit.__init__.args",description:`<strong>args</strong> (<code>object</code>, defaults to <code>None</code>) — | |
| An object with additional arguments.`,name:"args"},{anchor:"bitsandbytes.optim.PagedAdam8bit.__init__.min_8bit_size",description:`<strong>min_8bit_size</strong> (<code>int</code>, defaults to 4096) — | |
| The minimum number of elements of the parameter tensors for 8-bit optimization.`,name:"min_8bit_size"},{anchor:"bitsandbytes.optim.PagedAdam8bit.__init__.is_paged",description:`<strong>is_paged</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether the optimizer is a paged optimizer or not.`,name:"is_paged"}]}),s(2),i(L),i(b);var j=t(b,2);o(j,{title:"PagedAdam32bit",local:"bitsandbytes.optim.PagedAdam32bit",headingTag:"h2"});var p=t(j,2),W=a(p);e(W,{name:"class bitsandbytes.optim.PagedAdam32bit",anchor:"bitsandbytes.optim.PagedAdam32bit",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L296",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}]});var D=t(W,2),O=a(D);e(O,{name:"__init__",anchor:"bitsandbytes.optim.PagedAdam32bit.__init__",source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/vr_2030/bitsandbytes/optim/adam.py#L297",parameters:[{name:"params",val:""},{name:"lr",val:" = 0.001"},{name:"betas",val:" = (0.9, 0.999)"},{name:"eps",val:" = 1e-08"},{name:"weight_decay",val:" = 0"},{name:"amsgrad",val:" = False"},{name:"optim_bits",val:" = 32"},{name:"args",val:" = None"},{name:"min_8bit_size",val:" = 4096"},{name:"is_paged",val:" = False"}],parametersDescription:[{anchor:"bitsandbytes.optim.PagedAdam32bit.__init__.params",description:`<strong>params</strong> (<code>torch.tensor</code>) — | |
| The input parameters to optimize.`,name:"params"},{anchor:"bitsandbytes.optim.PagedAdam32bit.__init__.lr",description:`<strong>lr</strong> (<code>float</code>, defaults to 1e-3) — | |
| The learning rate.`,name:"lr"},{anchor:"bitsandbytes.optim.PagedAdam32bit.__init__.betas",description:`<strong>betas</strong> (<code>tuple(float, float)</code>, defaults to (0.9, 0.999)) — | |
| The beta values are the decay rates of the first and second-order moment of the optimizer.`,name:"betas"},{anchor:"bitsandbytes.optim.PagedAdam32bit.__init__.eps",description:`<strong>eps</strong> (<code>float</code>, defaults to 1e-8) — | |
| The epsilon value prevents division by zero in the optimizer.`,name:"eps"},{anchor:"bitsandbytes.optim.PagedAdam32bit.__init__.weight_decay",description:`<strong>weight_decay</strong> (<code>float</code>, defaults to 0.0) — | |
| The weight decay value for the optimizer.`,name:"weight_decay"},{anchor:"bitsandbytes.optim.PagedAdam32bit.__init__.amsgrad",description:`<strong>amsgrad</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether to use the <a href="https://hf.co/papers/1904.09237" rel="nofollow">AMSGrad</a> variant of Adam that uses the maximum of past squared gradients instead.`,name:"amsgrad"},{anchor:"bitsandbytes.optim.PagedAdam32bit.__init__.optim_bits",description:`<strong>optim_bits</strong> (<code>int</code>, defaults to 32) — | |
| The number of bits of the optimizer state.`,name:"optim_bits"},{anchor:"bitsandbytes.optim.PagedAdam32bit.__init__.args",description:`<strong>args</strong> (<code>object</code>, defaults to <code>None</code>) — | |
| An object with additional arguments.`,name:"args"},{anchor:"bitsandbytes.optim.PagedAdam32bit.__init__.min_8bit_size",description:`<strong>min_8bit_size</strong> (<code>int</code>, defaults to 4096) — | |
| The minimum number of elements of the parameter tensors for 8-bit optimization.`,name:"min_8bit_size"},{anchor:"bitsandbytes.optim.PagedAdam32bit.__init__.is_paged",description:`<strong>is_paged</strong> (<code>bool</code>, defaults to <code>False</code>) — | |
| Whether the optimizer is a paged optimizer or not.`,name:"is_paged"}]}),s(2),i(D),i(p);var I=t(p,2);V(I,{source:"https://github.com/bitsandbytes-foundation/bitsandbytes/blob/main/docs/source/reference/optim/adam.mdx"}),s(2),S(U,l),tt()}export{dt as component}; | |
Xet Storage Details
- Size:
- 24.6 kB
- Xet hash:
- e30ede35d311bbc363088bf8fb9c0505a39ad7aeb8637e27c119105cca11cfe2
·
Xet efficiently stores files, intelligently splitting them into unique chunks and accelerating uploads and downloads. More info.