File size: 3,201 Bytes
eafbe80 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 |
from fla.layers import (
ABCAttention,
Attention,
BasedLinearAttention,
BitAttention,
Comba,
DeltaFormerAttention,
DeltaNet,
GatedDeltaNet,
GatedDeltaProduct,
GatedLinearAttention,
GatedSlotAttention,
HGRN2Attention,
HGRNAttention,
LightNetAttention,
LinearAttention,
LogLinearMamba2,
MesaNet,
MomAttention,
MultiheadLatentAttention,
MultiScaleRetention,
NativeSparseAttention,
PaTHAttention,
ReBasedLinearAttention,
RodimusAttention,
RWKV6Attention,
RWKV7Attention,
)
from fla.models import (
ABCForCausalLM,
ABCModel,
BitNetForCausalLM,
BitNetModel,
CombaForCausalLM,
CombaModel,
DeltaFormerForCausalLM,
DeltaFormerModel,
DeltaNetForCausalLM,
DeltaNetModel,
GatedDeltaNetForCausalLM,
GatedDeltaNetModel,
GatedDeltaProductForCausalLM,
GatedDeltaProductModel,
GLAForCausalLM,
GLAModel,
GSAForCausalLM,
GSAModel,
HGRN2ForCausalLM,
HGRN2Model,
HGRNForCausalLM,
HGRNModel,
LightNetForCausalLM,
LightNetModel,
LinearAttentionForCausalLM,
LinearAttentionModel,
LogLinearMamba2ForCausalLM,
LogLinearMamba2Model,
MesaNetForCausalLM,
MesaNetModel,
MLAForCausalLM,
MLAModel,
MomForCausalLM,
MomModel,
NSAForCausalLM,
NSAModel,
PaTHAttentionForCausalLM,
PaTHAttentionModel,
RetNetForCausalLM,
RetNetModel,
RodimusForCausalLM,
RodimusModel,
RWKV6ForCausalLM,
RWKV6Model,
RWKV7ForCausalLM,
RWKV7Model,
TransformerForCausalLM,
TransformerModel,
)
__all__ = [
'ABCAttention', 'ABCForCausalLM', 'ABCModel',
'Attention', 'TransformerForCausalLM', 'TransformerModel',
'BasedLinearAttention',
'BitAttention', 'BitNetForCausalLM', 'BitNetModel',
'Comba', 'CombaForCausalLM', 'CombaModel',
'DeltaNet', 'DeltaNetForCausalLM', 'DeltaNetModel',
'DeltaFormerAttention', 'DeltaFormerForCausalLM', 'DeltaFormerModel',
'GatedDeltaNet', 'GatedDeltaNetForCausalLM', 'GatedDeltaNetModel',
'GatedDeltaProduct', 'GatedDeltaProductForCausalLM', 'GatedDeltaProductModel',
'GatedLinearAttention', 'GLAForCausalLM', 'GLAModel',
'GatedSlotAttention', 'GSAForCausalLM', 'GSAModel',
'HGRNAttention', 'HGRNForCausalLM', 'HGRNModel',
'HGRN2Attention', 'HGRN2ForCausalLM', 'HGRN2Model',
'LightNetAttention', 'LightNetForCausalLM', 'LightNetModel',
'LinearAttention', 'LinearAttentionForCausalLM', 'LinearAttentionModel',
'LogLinearMamba2', 'LogLinearMamba2ForCausalLM', 'LogLinearMamba2Model',
'MesaNet', 'MesaNetForCausalLM', 'MesaNetModel',
'MomAttention', 'MomForCausalLM', 'MomModel',
'MultiheadLatentAttention', 'MLAForCausalLM', 'MLAModel',
'MultiScaleRetention', 'RetNetForCausalLM', 'RetNetModel',
'NativeSparseAttention', 'NSAForCausalLM', 'NSAModel',
'PaTHAttention', 'PaTHAttentionForCausalLM', 'PaTHAttentionModel',
'ReBasedLinearAttention',
'RodimusAttention', 'RodimusForCausalLM', 'RodimusModel',
'RWKV6Attention', 'RWKV6ForCausalLM', 'RWKV6Model',
'RWKV7Attention', 'RWKV7ForCausalLM', 'RWKV7Model',
]
__version__ = '0.4.0'
|