File size: 3,201 Bytes
eafbe80
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111

from fla.layers import (
    ABCAttention,
    Attention,
    BasedLinearAttention,
    BitAttention,
    Comba,
    DeltaFormerAttention,
    DeltaNet,
    GatedDeltaNet,
    GatedDeltaProduct,
    GatedLinearAttention,
    GatedSlotAttention,
    HGRN2Attention,
    HGRNAttention,
    LightNetAttention,
    LinearAttention,
    LogLinearMamba2,
    MesaNet,
    MomAttention,
    MultiheadLatentAttention,
    MultiScaleRetention,
    NativeSparseAttention,
    PaTHAttention,
    ReBasedLinearAttention,
    RodimusAttention,
    RWKV6Attention,
    RWKV7Attention,
)
from fla.models import (
    ABCForCausalLM,
    ABCModel,
    BitNetForCausalLM,
    BitNetModel,
    CombaForCausalLM,
    CombaModel,
    DeltaFormerForCausalLM,
    DeltaFormerModel,
    DeltaNetForCausalLM,
    DeltaNetModel,
    GatedDeltaNetForCausalLM,
    GatedDeltaNetModel,
    GatedDeltaProductForCausalLM,
    GatedDeltaProductModel,
    GLAForCausalLM,
    GLAModel,
    GSAForCausalLM,
    GSAModel,
    HGRN2ForCausalLM,
    HGRN2Model,
    HGRNForCausalLM,
    HGRNModel,
    LightNetForCausalLM,
    LightNetModel,
    LinearAttentionForCausalLM,
    LinearAttentionModel,
    LogLinearMamba2ForCausalLM,
    LogLinearMamba2Model,
    MesaNetForCausalLM,
    MesaNetModel,
    MLAForCausalLM,
    MLAModel,
    MomForCausalLM,
    MomModel,
    NSAForCausalLM,
    NSAModel,
    PaTHAttentionForCausalLM,
    PaTHAttentionModel,
    RetNetForCausalLM,
    RetNetModel,
    RodimusForCausalLM,
    RodimusModel,
    RWKV6ForCausalLM,
    RWKV6Model,
    RWKV7ForCausalLM,
    RWKV7Model,
    TransformerForCausalLM,
    TransformerModel,
)

__all__ = [
    'ABCAttention', 'ABCForCausalLM', 'ABCModel',
    'Attention', 'TransformerForCausalLM', 'TransformerModel',
    'BasedLinearAttention',
    'BitAttention', 'BitNetForCausalLM', 'BitNetModel',
    'Comba', 'CombaForCausalLM', 'CombaModel',
    'DeltaNet', 'DeltaNetForCausalLM', 'DeltaNetModel',
    'DeltaFormerAttention', 'DeltaFormerForCausalLM', 'DeltaFormerModel',
    'GatedDeltaNet', 'GatedDeltaNetForCausalLM', 'GatedDeltaNetModel',
    'GatedDeltaProduct', 'GatedDeltaProductForCausalLM', 'GatedDeltaProductModel',
    'GatedLinearAttention', 'GLAForCausalLM', 'GLAModel',
    'GatedSlotAttention', 'GSAForCausalLM', 'GSAModel',
    'HGRNAttention', 'HGRNForCausalLM', 'HGRNModel',
    'HGRN2Attention', 'HGRN2ForCausalLM', 'HGRN2Model',
    'LightNetAttention', 'LightNetForCausalLM', 'LightNetModel',
    'LinearAttention', 'LinearAttentionForCausalLM', 'LinearAttentionModel',
    'LogLinearMamba2', 'LogLinearMamba2ForCausalLM', 'LogLinearMamba2Model',
    'MesaNet', 'MesaNetForCausalLM', 'MesaNetModel',
    'MomAttention', 'MomForCausalLM', 'MomModel',
    'MultiheadLatentAttention', 'MLAForCausalLM', 'MLAModel',
    'MultiScaleRetention', 'RetNetForCausalLM', 'RetNetModel',
    'NativeSparseAttention', 'NSAForCausalLM', 'NSAModel',
    'PaTHAttention', 'PaTHAttentionForCausalLM', 'PaTHAttentionModel',
    'ReBasedLinearAttention',
    'RodimusAttention', 'RodimusForCausalLM', 'RodimusModel',
    'RWKV6Attention', 'RWKV6ForCausalLM', 'RWKV6Model',
    'RWKV7Attention', 'RWKV7ForCausalLM', 'RWKV7Model',
]

__version__ = '0.4.0'