<
   ir_version: 10,
   opset_import: ["" : 23],
   producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,1152] text_embedding) 
   <
      float[batch,77,1024] add_1011
      float[batch,77,1024] add_1084
      float[batch,77,1024] add_1113
      float[batch,77,1024] add_1186
      float[batch,77,1024] add_1215
      float[batch,77,1024] add_1288
      float[batch,77,1024] add_1317
      float[batch,77,1024] add_1390
      float[batch,77,1024] add_1419
      float[batch,77,1024] add_1492
      float[batch,77,1024] add_1521
      float[batch,77,1024] add_1594
      float[batch,77,1024] add_1623
      float[batch,77,1024] add_166
      float[batch,77,1024] add_1696
      float[batch,77,1024] add_1725
      float[batch,77,1024] add_1798
      float[batch,77,1024] add_1827
      float[batch,77,1024] add_1900
      float[batch,77,1024] add_1929
      float[batch,77,1024] add_195
      float[batch,77,1024] add_2002
      float[batch,77,1024] add_2031
      float[batch,77,1024] add_2104
      float[batch,77,1024] add_2133
      float[batch,77,1024] add_2206
      float[batch,77,1024] add_2235
      float[batch,77,1024] add_2308
      float[batch,77,1024] add_2337
      float[batch,77,1024] add_2410
      float[batch,77,1024] add_2439
      float[batch,1,1024] add_2439_pooled
      float[batch,1,1024] add_2512
      float[batch,1,1024] add_2541
      float[batch,77,1024] add_268
      float[batch,77,1024] add_297
      float[batch,77,1024] add_370
      float[batch,77,1024] add_399
      float[batch,77,1024] add_472
      float[batch,77,1024] add_501
      float[batch,77,1024] add_53
      float[batch,77,1024] add_574
      float[batch,77,1024] add_603
      float[batch,77,1024] add_676
      float[batch,77,1024] add_705
      float[batch,77,1024] add_778
      float[batch,77,1024] add_807
      float[batch,77,1024] add_880
      float[batch,77,1024] add_909
      float[batch,77,1024] add_982
      float[batch,1,1,77] bitwise_and_1_f
      float[batch,1] clamp_min
      float[batch,77,1024] layer_norm
      float[batch,77,1024] layer_norm_1
      float[batch,77,1024] layer_norm_10
      float[batch,77,1024] layer_norm_11
      float[batch,77,1024] layer_norm_12
      float[batch,77,1024] layer_norm_13
      float[batch,77,1024] layer_norm_14
      float[batch,77,1024] layer_norm_15
      float[batch,77,1024] layer_norm_16
      float[batch,77,1024] layer_norm_17
      float[batch,77,1024] layer_norm_18
      float[batch,77,1024] layer_norm_19
      float[batch,77,1024] layer_norm_2
      float[batch,77,1024] layer_norm_20
      float[batch,77,1024] layer_norm_21
      float[batch,77,1024] layer_norm_22
      float[batch,77,1024] layer_norm_23
      float[batch,77,1024] layer_norm_24
      float[batch,77,1024] layer_norm_25
      float[batch,77,1024] layer_norm_26
      float[batch,77,1024] layer_norm_27
      float[batch,77,1024] layer_norm_28
      float[batch,77,1024] layer_norm_29
      float[batch,77,1024] layer_norm_3
      float[batch,77,1024] layer_norm_30
      float[batch,77,1024] layer_norm_31
      float[batch,77,1024] layer_norm_32
      float[batch,77,1024] layer_norm_33
      float[batch,77,1024] layer_norm_34
      float[batch,77,1024] layer_norm_35
      float[batch,77,1024] layer_norm_36
      float[batch,77,1024] layer_norm_37
      float[batch,77,1024] layer_norm_38
      float[batch,77,1024] layer_norm_39
      float[batch,77,1024] layer_norm_4
      float[batch,77,1024] layer_norm_40
      float[batch,77,1024] layer_norm_41
      float[batch,77,1024] layer_norm_42
      float[batch,77,1024] layer_norm_43
      float[batch,77,1024] layer_norm_44
      float[batch,77,1024] layer_norm_45
      float[batch,77,1024] layer_norm_46
      float[batch,1,1024] layer_norm_47
      float[batch,77,1024] layer_norm_5
      float[batch,77,1024] layer_norm_6
      float[batch,77,1024] layer_norm_7
      float[batch,77,1024] layer_norm_8
      float[batch,77,1024] layer_norm_9
      float[batch,1] linalg_vector_norm
      float[batch,77,1024] linear
      float[batch,77,1024] linear_1
      float[batch,77,8192] linear_10
      float[batch,77,8192] linear_100
      float[batch,77,1024] linear_101
      float[batch,77,1024] linear_102
      float[batch,77,1024] linear_103
      float[batch,77,1024] linear_105
      float[batch,77,8192] linear_106
      float[batch,77,1024] linear_107
      float[batch,77,1024] linear_108
      float[batch,77,1024] linear_109
      float[batch,77,1024] linear_11
      float[batch,77,1024] linear_111
      float[batch,77,8192] linear_112
      float[batch,77,1024] linear_113
      float[batch,77,1024] linear_114
      float[batch,77,1024] linear_115
      float[batch,77,1024] linear_117
      float[batch,77,8192] linear_118
      float[batch,77,1024] linear_119
      float[batch,77,1024] linear_12
      float[batch,77,1024] linear_120
      float[batch,77,1024] linear_121
      float[batch,77,1024] linear_123
      float[batch,77,8192] linear_124
      float[batch,77,1024] linear_125
      float[batch,77,1024] linear_126
      float[batch,77,1024] linear_127
      float[batch,77,1024] linear_129
      float[batch,77,1024] linear_13
      float[batch,77,8192] linear_130
      float[batch,77,1024] linear_131
      float[batch,77,1024] linear_132
      float[batch,77,1024] linear_133
      float[batch,77,1024] linear_135
      float[batch,77,8192] linear_136
      float[batch,77,1024] linear_137
      float[batch,77,1024] linear_138
      float[batch,77,1024] linear_139
      float[batch,1,1024] linear_141
      float[batch,1,8192] linear_142
      float[batch,1,1024] linear_143
      float[batch,1152] linear_144
      float[batch,77,1024] linear_15
      float[batch,77,8192] linear_16
      float[batch,77,1024] linear_17
      float[batch,77,1024] linear_18
      float[batch,77,1024] linear_19
      float[batch,77,1024] linear_21
      float[batch,77,8192] linear_22
      float[batch,77,1024] linear_23
      float[batch,77,1024] linear_24
      float[batch,77,1024] linear_25
      float[batch,77,1024] linear_27
      float[batch,77,8192] linear_28
      float[batch,77,1024] linear_29
      float[batch,77,1024] linear_3
      float[batch,77,1024] linear_30
      float[batch,77,1024] linear_31
      float[batch,77,1024] linear_33
      float[batch,77,8192] linear_34
      float[batch,77,1024] linear_35
      float[batch,77,1024] linear_36
      float[batch,77,1024] linear_37
      float[batch,77,1024] linear_39
      float[batch,77,8192] linear_4
      float[batch,77,8192] linear_40
      float[batch,77,1024] linear_41
      float[batch,77,1024] linear_42
      float[batch,77,1024] linear_43
      float[batch,77,1024] linear_45
      float[batch,77,8192] linear_46
      float[batch,77,1024] linear_47
      float[batch,77,1024] linear_48
      float[batch,77,1024] linear_49
      float[batch,77,1024] linear_5
      float[batch,77,1024] linear_51
      float[batch,77,8192] linear_52
      float[batch,77,1024] linear_53
      float[batch,77,1024] linear_54
      float[batch,77,1024] linear_55
      float[batch,77,1024] linear_57
      float[batch,77,8192] linear_58
      float[batch,77,1024] linear_59
      float[batch,77,1024] linear_6
      float[batch,77,1024] linear_60
      float[batch,77,1024] linear_61
      float[batch,77,1024] linear_63
      float[batch,77,8192] linear_64
      float[batch,77,1024] linear_65
      float[batch,77,1024] linear_66
      float[batch,77,1024] linear_67
      float[batch,77,1024] linear_69
      float[batch,77,1024] linear_7
      float[batch,77,8192] linear_70
      float[batch,77,1024] linear_71
      float[batch,77,1024] linear_72
      float[batch,77,1024] linear_73
      float[batch,77,1024] linear_75
      float[batch,77,8192] linear_76
      float[batch,77,1024] linear_77
      float[batch,77,1024] linear_78
      float[batch,77,1024] linear_79
      float[batch,77,1024] linear_81
      float[batch,77,8192] linear_82
      float[batch,77,1024] linear_83
      float[batch,77,1024] linear_84
      float[batch,77,1024] linear_85
      float[batch,77,1024] linear_87
      float[batch,77,8192] linear_88
      float[batch,77,1024] linear_89
      float[batch,77,1024] linear_9
      float[batch,77,1024] linear_90
      float[batch,77,1024] linear_91
      float[batch,77,1024] linear_93
      float[batch,77,8192] linear_94
      float[batch,77,1024] linear_95
      float[batch,77,1024] linear_96
      float[batch,77,1024] linear_97
      float[batch,77,1024] linear_99
      float[batch,77,1024] mul_5
      float[batch,77,8192] relu
      float[batch,77,8192] relu_1
      float[batch,77,8192] relu_10
      float[batch,77,8192] relu_11
      float[batch,77,8192] relu_12
      float[batch,77,8192] relu_13
      float[batch,77,8192] relu_14
      float[batch,77,8192] relu_15
      float[batch,77,8192] relu_16
      float[batch,77,8192] relu_17
      float[batch,77,8192] relu_18
      float[batch,77,8192] relu_19
      float[batch,77,8192] relu_2
      float[batch,77,8192] relu_20
      float[batch,77,8192] relu_21
      float[batch,77,8192] relu_22
      float[batch,1,8192] relu_23
      float[batch,77,8192] relu_3
      float[batch,77,8192] relu_4
      float[batch,77,8192] relu_5
      float[batch,77,8192] relu_6
      float[batch,77,8192] relu_7
      float[batch,77,8192] relu_8
      float[batch,77,8192] relu_9
      float[batch,77,1024] scaled_dot_product_attention
      float[batch,77,1024] scaled_dot_product_attention_1
      float[batch,77,1024] scaled_dot_product_attention_10
      float[batch,77,1024] scaled_dot_product_attention_11
      float[batch,77,1024] scaled_dot_product_attention_12
      float[batch,77,1024] scaled_dot_product_attention_13
      float[batch,77,1024] scaled_dot_product_attention_14
      float[batch,77,1024] scaled_dot_product_attention_15
      float[batch,77,1024] scaled_dot_product_attention_16
      float[batch,77,1024] scaled_dot_product_attention_17
      float[batch,77,1024] scaled_dot_product_attention_18
      float[batch,77,1024] scaled_dot_product_attention_19
      float[batch,77,1024] scaled_dot_product_attention_2
      float[batch,77,1024] scaled_dot_product_attention_20
      float[batch,77,1024] scaled_dot_product_attention_21
      float[batch,77,1024] scaled_dot_product_attention_22
      float[batch,77,1024] scaled_dot_product_attention_23
      float[batch,1,1024] scaled_dot_product_attention_23_pooled
      float[batch,77,1024] scaled_dot_product_attention_3
      float[batch,77,1024] scaled_dot_product_attention_4
      float[batch,77,1024] scaled_dot_product_attention_5
      float[batch,77,1024] scaled_dot_product_attention_6
      float[batch,77,1024] scaled_dot_product_attention_7
      float[batch,77,1024] scaled_dot_product_attention_8
      float[batch,77,1024] scaled_dot_product_attention_9
      float[batch,1024] select
      float[batch,77] text_keep
      float[batch,77,1024] val_150
      float[batch,77,1024] val_151
      float[batch,77,1024] val_152
      float[batch,77,1024] val_153
      float[batch,77,8192] val_154
      float[batch,77,1024] val_155
      float[batch,77,1024] val_156
      float[batch,77,1024] val_157
      float[batch,77,1024] val_158
      float[batch,77,1024] val_159
      float[batch,77,8192] val_160
      float[batch,77,1024] val_161
      float[batch,77,1024] val_162
      float[batch,77,1024] val_163
      float[batch,77,1024] val_164
      float[batch,77,1024] val_165
      float[batch,77,8192] val_166
      float[batch,77,1024] val_167
      float[batch,77,1024] val_168
      float[batch,77,1024] val_169
      float[batch,77,1024] val_170
      float[batch,77,1024] val_171
      float[batch,77,8192] val_172
      float[batch,77,1024] val_173
      float[batch,77,1024] val_174
      float[batch,77,1024] val_175
      float[batch,77,1024] val_176
      float[batch,77,1024] val_177
      float[batch,77,8192] val_178
      float[batch,77,1024] val_179
      float[batch,77,1024] val_180
      float[batch,77,1024] val_181
      float[batch,77,1024] val_182
      float[batch,77,1024] val_183
      float[batch,77,8192] val_184
      float[batch,77,1024] val_185
      float[batch,77,1024] val_186
      float[batch,77,1024] val_187
      float[batch,77,1024] val_188
      float[batch,77,1024] val_189
      float[batch,77,8192] val_190
      float[batch,77,1024] val_191
      float[batch,77,1024] val_192
      float[batch,77,1024] val_193
      float[batch,77,1024] val_194
      float[batch,77,1024] val_195
      float[batch,77,8192] val_196
      float[batch,77,1024] val_197
      float[batch,77,1024] val_198
      float[batch,77,1024] val_199
      float[batch,77,1024] val_200
      float[batch,77,1024] val_201
      float[batch,77,8192] val_202
      float[batch,77,1024] val_203
      float[batch,77,1024] val_204
      float[batch,77,1024] val_205
      float[batch,77,1024] val_206
      float[batch,77,1024] val_207
      float[batch,77,8192] val_208
      float[batch,77,1024] val_209
      float[batch,77,1024] val_210
      float[batch,77,1024] val_211
      float[batch,77,1024] val_212
      float[batch,77,1024] val_213
      float[batch,77,8192] val_214
      float[batch,77,1024] val_215
      float[batch,77,1024] val_216
      float[batch,77,1024] val_217
      float[batch,77,1024] val_218
      float[batch,77,1024] val_219
      float[batch,77,8192] val_220
      float[batch,77,1024] val_221
      float[batch,77,1024] val_222
      float[batch,77,1024] val_223
      float[batch,77,1024] val_224
      float[batch,77,1024] val_225
      float[batch,77,8192] val_226
      float[batch,77,1024] val_227
      float[batch,77,1024] val_228
      float[batch,77,1024] val_229
      float[batch,77,1024] val_230
      float[batch,77,1024] val_231
      float[batch,77,8192] val_232
      float[batch,77,1024] val_233
      float[batch,77,1024] val_234
      float[batch,77,1024] val_235
      float[batch,77,1024] val_236
      float[batch,77,1024] val_237
      float[batch,77,8192] val_238
      float[batch,77,1024] val_239
      float[batch,77,1024] val_240
      float[batch,77,1024] val_241
      float[batch,77,1024] val_242
      float[batch,77,1024] val_243
      float[batch,77,8192] val_244
      float[batch,77,1024] val_245
      float[batch,77,1024] val_246
      float[batch,77,1024] val_247
      float[batch,77,1024] val_248
      float[batch,77,1024] val_249
      float[batch,77,8192] val_250
      float[batch,77,1024] val_251
      float[batch,77,1024] val_252
      float[batch,77,1024] val_253
      float[batch,77,1024] val_254
      float[batch,77,1024] val_255
      float[batch,77,8192] val_256
      float[batch,77,1024] val_257
      float[batch,77,1024] val_258
      float[batch,77,1024] val_259
      float[batch,77,1024] val_260
      float[batch,77,1024] val_261
      float[batch,77,8192] val_262
      float[batch,77,1024] val_263
      float[batch,77,1024] val_264
      float[batch,77,1024] val_265
      float[batch,77,1024] val_266
      float[batch,77,1024] val_267
      float[batch,77,8192] val_268
      float[batch,77,1024] val_269
      float[batch,77,1024] val_270
      float[batch,77,1024] val_271
      float[batch,77,1024] val_272
      float[batch,77,1024] val_273
      float[batch,77,8192] val_274
      float[batch,77,1024] val_275
      float[batch,77,1024] val_276
      float[batch,77,1024] val_277
      float[batch,77,1024] val_278
      float[batch,77,1024] val_279
      float[batch,77,8192] val_280
      float[batch,77,1024] val_281
      float[batch,77,1024] val_282
      float[batch,77,1024] val_283
      float[batch,77,1024] val_284
      float[batch,77,1024] val_285
      float[batch,77,8192] val_286
      float[batch,77,1024] val_287
      float[batch,77,1024] val_288
      float[batch,77,1024] val_289
      float[batch,77,1024] val_290
      float[batch,1,1024] val_291
      float[batch,1,8192] val_292
      float[batch,1,1024] val_293
      float[batch,1024] val_294
      float[batch,1,1,77] val_53_f
      float[batch,1,1,77] val_53_f_bias
      float[batch,1,77,77] val_53_f_mask
      float[1,77,1024] view_1
   >
{
   val_149 = Gather <axis: int = 0> ("text.transformer.embed_tokens.weight_fp16", text)
   mul_5 = Cast <to: int = 1> (val_149)
   view_1 = Reshape <allowzero: int = 1> (index_select, view_1_target)
   add_53 = Add (mul_5, view_1)
   [node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_53, "text.transformer.layers.0.self_attn_layer_norm.weight", "text.transformer.layers.0.self_attn_layer_norm.bias")
   val_150 = MatMul (layer_norm, val_5)
   [node_linear] linear = Add (val_150, "text.transformer.layers.0.self_attn.q_proj.bias")
   val_151 = MatMul (layer_norm, val_6)
   linear_1 = Add (val_151, "text.transformer.layers.0.self_attn.k_proj.bias")
   val_152 = MatMul (layer_norm, val_7)
   [pad_keep] text_keep = Gather <axis: int = 0> (text_pad_keep, text)
   [val_53_f] val_53_f = Unsqueeze (text_keep, text_row_axes)
   [bitwise_and_1_f] bitwise_and_1_f = Sub (val_53_f, text_one)
   val_53_f_bias = Mul (bitwise_and_1_f, text_scale)
   val_53_f_mask = Add (val_53_f_bias, text_q_axis)
   [node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear, linear_1, val_152, val_53_f_mask)
   val_153 = MatMul (scaled_dot_product_attention, val_8)
   linear_3 = Add (val_153, "text.transformer.layers.0.self_attn.out_proj.bias")
   add_166 = Add (add_53, linear_3)
   layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_166, "text.transformer.layers.0.final_layer_norm.weight", "text.transformer.layers.0.final_layer_norm.bias")
   val_154 = MatMul (layer_norm_1, val_9)
   linear_4 = Add (val_154, "text.transformer.layers.0.fc1.bias")
   [node_relu] relu = Relu (linear_4)
   val_155 = MatMul (relu, val_10)
   linear_5 = Add (val_155, "text.transformer.layers.0.fc2.bias")
   add_195 = Add (add_166, linear_5)
   layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_195, "text.transformer.layers.1.self_attn_layer_norm.weight", "text.transformer.layers.1.self_attn_layer_norm.bias")
   val_156 = MatMul (layer_norm_2, val_11)
   linear_6 = Add (val_156, "text.transformer.layers.1.self_attn.q_proj.bias")
   val_157 = MatMul (layer_norm_2, val_12)
   linear_7 = Add (val_157, "text.transformer.layers.1.self_attn.k_proj.bias")
   val_158 = MatMul (layer_norm_2, val_13)
   scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_6, linear_7, val_158, val_53_f_mask)
   val_159 = MatMul (scaled_dot_product_attention_1, val_14)
   linear_9 = Add (val_159, "text.transformer.layers.1.self_attn.out_proj.bias")
   add_268 = Add (add_195, linear_9)
   layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_268, "text.transformer.layers.1.final_layer_norm.weight", "text.transformer.layers.1.final_layer_norm.bias")
   val_160 = MatMul (layer_norm_3, val_15)
   linear_10 = Add (val_160, "text.transformer.layers.1.fc1.bias")
   relu_1 = Relu (linear_10)
   val_161 = MatMul (relu_1, val_16)
   linear_11 = Add (val_161, "text.transformer.layers.1.fc2.bias")
   add_297 = Add (add_268, linear_11)
   layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_297, "text.transformer.layers.2.self_attn_layer_norm.weight", "text.transformer.layers.2.self_attn_layer_norm.bias")
   val_162 = MatMul (layer_norm_4, val_17)
   linear_12 = Add (val_162, "text.transformer.layers.2.self_attn.q_proj.bias")
   val_163 = MatMul (layer_norm_4, val_18)
   linear_13 = Add (val_163, "text.transformer.layers.2.self_attn.k_proj.bias")
   val_164 = MatMul (layer_norm_4, val_19)
   scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_12, linear_13, val_164, val_53_f_mask)
   val_165 = MatMul (scaled_dot_product_attention_2, val_20)
   linear_15 = Add (val_165, "text.transformer.layers.2.self_attn.out_proj.bias")
   add_370 = Add (add_297, linear_15)
   layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_370, "text.transformer.layers.2.final_layer_norm.weight", "text.transformer.layers.2.final_layer_norm.bias")
   val_166 = MatMul (layer_norm_5, val_21)
   linear_16 = Add (val_166, "text.transformer.layers.2.fc1.bias")
   relu_2 = Relu (linear_16)
   val_167 = MatMul (relu_2, val_22)
   linear_17 = Add (val_167, "text.transformer.layers.2.fc2.bias")
   add_399 = Add (add_370, linear_17)
   layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_399, "text.transformer.layers.3.self_attn_layer_norm.weight", "text.transformer.layers.3.self_attn_layer_norm.bias")
   val_168 = MatMul (layer_norm_6, val_23)
   linear_18 = Add (val_168, "text.transformer.layers.3.self_attn.q_proj.bias")
   val_169 = MatMul (layer_norm_6, val_24)
   linear_19 = Add (val_169, "text.transformer.layers.3.self_attn.k_proj.bias")
   val_170 = MatMul (layer_norm_6, val_25)
   scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_18, linear_19, val_170, val_53_f_mask)
   val_171 = MatMul (scaled_dot_product_attention_3, val_26)
   linear_21 = Add (val_171, "text.transformer.layers.3.self_attn.out_proj.bias")
   add_472 = Add (add_399, linear_21)
   layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_472, "text.transformer.layers.3.final_layer_norm.weight", "text.transformer.layers.3.final_layer_norm.bias")
   val_172 = MatMul (layer_norm_7, val_27)
   linear_22 = Add (val_172, "text.transformer.layers.3.fc1.bias")
   relu_3 = Relu (linear_22)
   val_173 = MatMul (relu_3, val_28)
   linear_23 = Add (val_173, "text.transformer.layers.3.fc2.bias")
   add_501 = Add (add_472, linear_23)
   layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_501, "text.transformer.layers.4.self_attn_layer_norm.weight", "text.transformer.layers.4.self_attn_layer_norm.bias")
   val_174 = MatMul (layer_norm_8, val_29)
   linear_24 = Add (val_174, "text.transformer.layers.4.self_attn.q_proj.bias")
   val_175 = MatMul (layer_norm_8, val_30)
   linear_25 = Add (val_175, "text.transformer.layers.4.self_attn.k_proj.bias")
   val_176 = MatMul (layer_norm_8, val_31)
   scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_24, linear_25, val_176, val_53_f_mask)
   val_177 = MatMul (scaled_dot_product_attention_4, val_32)
   linear_27 = Add (val_177, "text.transformer.layers.4.self_attn.out_proj.bias")
   add_574 = Add (add_501, linear_27)
   layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_574, "text.transformer.layers.4.final_layer_norm.weight", "text.transformer.layers.4.final_layer_norm.bias")
   val_178 = MatMul (layer_norm_9, val_33)
   linear_28 = Add (val_178, "text.transformer.layers.4.fc1.bias")
   relu_4 = Relu (linear_28)
   val_179 = MatMul (relu_4, val_34)
   linear_29 = Add (val_179, "text.transformer.layers.4.fc2.bias")
   add_603 = Add (add_574, linear_29)
   layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_603, "text.transformer.layers.5.self_attn_layer_norm.weight", "text.transformer.layers.5.self_attn_layer_norm.bias")
   val_180 = MatMul (layer_norm_10, val_35)
   linear_30 = Add (val_180, "text.transformer.layers.5.self_attn.q_proj.bias")
   val_181 = MatMul (layer_norm_10, val_36)
   linear_31 = Add (val_181, "text.transformer.layers.5.self_attn.k_proj.bias")
   val_182 = MatMul (layer_norm_10, val_37)
   scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_30, linear_31, val_182, val_53_f_mask)
   val_183 = MatMul (scaled_dot_product_attention_5, val_38)
   linear_33 = Add (val_183, "text.transformer.layers.5.self_attn.out_proj.bias")
   add_676 = Add (add_603, linear_33)
   layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_676, "text.transformer.layers.5.final_layer_norm.weight", "text.transformer.layers.5.final_layer_norm.bias")
   val_184 = MatMul (layer_norm_11, val_39)
   linear_34 = Add (val_184, "text.transformer.layers.5.fc1.bias")
   relu_5 = Relu (linear_34)
   val_185 = MatMul (relu_5, val_40)
   linear_35 = Add (val_185, "text.transformer.layers.5.fc2.bias")
   add_705 = Add (add_676, linear_35)
   layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_705, "text.transformer.layers.6.self_attn_layer_norm.weight", "text.transformer.layers.6.self_attn_layer_norm.bias")
   val_186 = MatMul (layer_norm_12, val_41)
   linear_36 = Add (val_186, "text.transformer.layers.6.self_attn.q_proj.bias")
   val_187 = MatMul (layer_norm_12, val_42)
   linear_37 = Add (val_187, "text.transformer.layers.6.self_attn.k_proj.bias")
   val_188 = MatMul (layer_norm_12, val_43)
   scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_36, linear_37, val_188, val_53_f_mask)
   val_189 = MatMul (scaled_dot_product_attention_6, val_44)
   linear_39 = Add (val_189, "text.transformer.layers.6.self_attn.out_proj.bias")
   add_778 = Add (add_705, linear_39)
   layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_778, "text.transformer.layers.6.final_layer_norm.weight", "text.transformer.layers.6.final_layer_norm.bias")
   val_190 = MatMul (layer_norm_13, val_45)
   linear_40 = Add (val_190, "text.transformer.layers.6.fc1.bias")
   relu_6 = Relu (linear_40)
   val_191 = MatMul (relu_6, val_46)
   linear_41 = Add (val_191, "text.transformer.layers.6.fc2.bias")
   add_807 = Add (add_778, linear_41)
   layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_807, "text.transformer.layers.7.self_attn_layer_norm.weight", "text.transformer.layers.7.self_attn_layer_norm.bias")
   val_192 = MatMul (layer_norm_14, val_47)
   linear_42 = Add (val_192, "text.transformer.layers.7.self_attn.q_proj.bias")
   val_193 = MatMul (layer_norm_14, val_48)
   linear_43 = Add (val_193, "text.transformer.layers.7.self_attn.k_proj.bias")
   val_194 = MatMul (layer_norm_14, val_49)
   scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_42, linear_43, val_194, val_53_f_mask)
   val_195 = MatMul (scaled_dot_product_attention_7, val_50)
   linear_45 = Add (val_195, "text.transformer.layers.7.self_attn.out_proj.bias")
   add_880 = Add (add_807, linear_45)
   layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_880, "text.transformer.layers.7.final_layer_norm.weight", "text.transformer.layers.7.final_layer_norm.bias")
   val_196 = MatMul (layer_norm_15, val_51)
   linear_46 = Add (val_196, "text.transformer.layers.7.fc1.bias")
   relu_7 = Relu (linear_46)
   val_197 = MatMul (relu_7, val_52)
   linear_47 = Add (val_197, "text.transformer.layers.7.fc2.bias")
   add_909 = Add (add_880, linear_47)
   layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_909, "text.transformer.layers.8.self_attn_layer_norm.weight", "text.transformer.layers.8.self_attn_layer_norm.bias")
   val_198 = MatMul (layer_norm_16, val_53)
   linear_48 = Add (val_198, "text.transformer.layers.8.self_attn.q_proj.bias")
   val_199 = MatMul (layer_norm_16, val_54)
   linear_49 = Add (val_199, "text.transformer.layers.8.self_attn.k_proj.bias")
   val_200 = MatMul (layer_norm_16, val_55)
   scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_48, linear_49, val_200, val_53_f_mask)
   val_201 = MatMul (scaled_dot_product_attention_8, val_56)
   linear_51 = Add (val_201, "text.transformer.layers.8.self_attn.out_proj.bias")
   add_982 = Add (add_909, linear_51)
   layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_982, "text.transformer.layers.8.final_layer_norm.weight", "text.transformer.layers.8.final_layer_norm.bias")
   val_202 = MatMul (layer_norm_17, val_57)
   linear_52 = Add (val_202, "text.transformer.layers.8.fc1.bias")
   relu_8 = Relu (linear_52)
   val_203 = MatMul (relu_8, val_58)
   linear_53 = Add (val_203, "text.transformer.layers.8.fc2.bias")
   add_1011 = Add (add_982, linear_53)
   layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1011, "text.transformer.layers.9.self_attn_layer_norm.weight", "text.transformer.layers.9.self_attn_layer_norm.bias")
   val_204 = MatMul (layer_norm_18, val_59)
   linear_54 = Add (val_204, "text.transformer.layers.9.self_attn.q_proj.bias")
   val_205 = MatMul (layer_norm_18, val_60)
   linear_55 = Add (val_205, "text.transformer.layers.9.self_attn.k_proj.bias")
   val_206 = MatMul (layer_norm_18, val_61)
   scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_54, linear_55, val_206, val_53_f_mask)
   val_207 = MatMul (scaled_dot_product_attention_9, val_62)
   linear_57 = Add (val_207, "text.transformer.layers.9.self_attn.out_proj.bias")
   add_1084 = Add (add_1011, linear_57)
   layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1084, "text.transformer.layers.9.final_layer_norm.weight", "text.transformer.layers.9.final_layer_norm.bias")
   val_208 = MatMul (layer_norm_19, val_63)
   linear_58 = Add (val_208, "text.transformer.layers.9.fc1.bias")
   relu_9 = Relu (linear_58)
   val_209 = MatMul (relu_9, val_64)
   linear_59 = Add (val_209, "text.transformer.layers.9.fc2.bias")
   add_1113 = Add (add_1084, linear_59)
   layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1113, "text.transformer.layers.10.self_attn_layer_norm.weight", "text.transformer.layers.10.self_attn_layer_norm.bias")
   val_210 = MatMul (layer_norm_20, val_65)
   linear_60 = Add (val_210, "text.transformer.layers.10.self_attn.q_proj.bias")
   val_211 = MatMul (layer_norm_20, val_66)
   linear_61 = Add (val_211, "text.transformer.layers.10.self_attn.k_proj.bias")
   val_212 = MatMul (layer_norm_20, val_67)
   scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_60, linear_61, val_212, val_53_f_mask)
   val_213 = MatMul (scaled_dot_product_attention_10, val_68)
   linear_63 = Add (val_213, "text.transformer.layers.10.self_attn.out_proj.bias")
   add_1186 = Add (add_1113, linear_63)
   layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1186, "text.transformer.layers.10.final_layer_norm.weight", "text.transformer.layers.10.final_layer_norm.bias")
   val_214 = MatMul (layer_norm_21, val_69)
   linear_64 = Add (val_214, "text.transformer.layers.10.fc1.bias")
   relu_10 = Relu (linear_64)
   val_215 = MatMul (relu_10, val_70)
   linear_65 = Add (val_215, "text.transformer.layers.10.fc2.bias")
   add_1215 = Add (add_1186, linear_65)
   layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1215, "text.transformer.layers.11.self_attn_layer_norm.weight", "text.transformer.layers.11.self_attn_layer_norm.bias")
   val_216 = MatMul (layer_norm_22, val_71)
   linear_66 = Add (val_216, "text.transformer.layers.11.self_attn.q_proj.bias")
   val_217 = MatMul (layer_norm_22, val_72)
   linear_67 = Add (val_217, "text.transformer.layers.11.self_attn.k_proj.bias")
   val_218 = MatMul (layer_norm_22, val_73)
   scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_66, linear_67, val_218, val_53_f_mask)
   val_219 = MatMul (scaled_dot_product_attention_11, val_74)
   linear_69 = Add (val_219, "text.transformer.layers.11.self_attn.out_proj.bias")
   add_1288 = Add (add_1215, linear_69)
   layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1288, "text.transformer.layers.11.final_layer_norm.weight", "text.transformer.layers.11.final_layer_norm.bias")
   val_220 = MatMul (layer_norm_23, val_75)
   linear_70 = Add (val_220, "text.transformer.layers.11.fc1.bias")
   relu_11 = Relu (linear_70)
   val_221 = MatMul (relu_11, val_76)
   linear_71 = Add (val_221, "text.transformer.layers.11.fc2.bias")
   add_1317 = Add (add_1288, linear_71)
   layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1317, "text.transformer.layers.12.self_attn_layer_norm.weight", "text.transformer.layers.12.self_attn_layer_norm.bias")
   val_222 = MatMul (layer_norm_24, val_77)
   linear_72 = Add (val_222, "text.transformer.layers.12.self_attn.q_proj.bias")
   val_223 = MatMul (layer_norm_24, val_78)
   linear_73 = Add (val_223, "text.transformer.layers.12.self_attn.k_proj.bias")
   val_224 = MatMul (layer_norm_24, val_79)
   scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_72, linear_73, val_224, val_53_f_mask)
   val_225 = MatMul (scaled_dot_product_attention_12, val_80)
   linear_75 = Add (val_225, "text.transformer.layers.12.self_attn.out_proj.bias")
   add_1390 = Add (add_1317, linear_75)
   layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1390, "text.transformer.layers.12.final_layer_norm.weight", "text.transformer.layers.12.final_layer_norm.bias")
   val_226 = MatMul (layer_norm_25, val_81)
   linear_76 = Add (val_226, "text.transformer.layers.12.fc1.bias")
   relu_12 = Relu (linear_76)
   val_227 = MatMul (relu_12, val_82)
   linear_77 = Add (val_227, "text.transformer.layers.12.fc2.bias")
   add_1419 = Add (add_1390, linear_77)
   layer_norm_26 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1419, "text.transformer.layers.13.self_attn_layer_norm.weight", "text.transformer.layers.13.self_attn_layer_norm.bias")
   val_228 = MatMul (layer_norm_26, val_83)
   linear_78 = Add (val_228, "text.transformer.layers.13.self_attn.q_proj.bias")
   val_229 = MatMul (layer_norm_26, val_84)
   linear_79 = Add (val_229, "text.transformer.layers.13.self_attn.k_proj.bias")
   val_230 = MatMul (layer_norm_26, val_85)
   scaled_dot_product_attention_13 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_78, linear_79, val_230, val_53_f_mask)
   val_231 = MatMul (scaled_dot_product_attention_13, val_86)
   linear_81 = Add (val_231, "text.transformer.layers.13.self_attn.out_proj.bias")
   add_1492 = Add (add_1419, linear_81)
   layer_norm_27 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1492, "text.transformer.layers.13.final_layer_norm.weight", "text.transformer.layers.13.final_layer_norm.bias")
   val_232 = MatMul (layer_norm_27, val_87)
   linear_82 = Add (val_232, "text.transformer.layers.13.fc1.bias")
   relu_13 = Relu (linear_82)
   val_233 = MatMul (relu_13, val_88)
   linear_83 = Add (val_233, "text.transformer.layers.13.fc2.bias")
   add_1521 = Add (add_1492, linear_83)
   layer_norm_28 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1521, "text.transformer.layers.14.self_attn_layer_norm.weight", "text.transformer.layers.14.self_attn_layer_norm.bias")
   val_234 = MatMul (layer_norm_28, val_89)
   linear_84 = Add (val_234, "text.transformer.layers.14.self_attn.q_proj.bias")
   val_235 = MatMul (layer_norm_28, val_90)
   linear_85 = Add (val_235, "text.transformer.layers.14.self_attn.k_proj.bias")
   val_236 = MatMul (layer_norm_28, val_91)
   scaled_dot_product_attention_14 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_84, linear_85, val_236, val_53_f_mask)
   val_237 = MatMul (scaled_dot_product_attention_14, val_92)
   linear_87 = Add (val_237, "text.transformer.layers.14.self_attn.out_proj.bias")
   add_1594 = Add (add_1521, linear_87)
   layer_norm_29 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1594, "text.transformer.layers.14.final_layer_norm.weight", "text.transformer.layers.14.final_layer_norm.bias")
   val_238 = MatMul (layer_norm_29, val_93)
   linear_88 = Add (val_238, "text.transformer.layers.14.fc1.bias")
   relu_14 = Relu (linear_88)
   val_239 = MatMul (relu_14, val_94)
   linear_89 = Add (val_239, "text.transformer.layers.14.fc2.bias")
   add_1623 = Add (add_1594, linear_89)
   layer_norm_30 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1623, "text.transformer.layers.15.self_attn_layer_norm.weight", "text.transformer.layers.15.self_attn_layer_norm.bias")
   val_240 = MatMul (layer_norm_30, val_95)
   linear_90 = Add (val_240, "text.transformer.layers.15.self_attn.q_proj.bias")
   val_241 = MatMul (layer_norm_30, val_96)
   linear_91 = Add (val_241, "text.transformer.layers.15.self_attn.k_proj.bias")
   val_242 = MatMul (layer_norm_30, val_97)
   scaled_dot_product_attention_15 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_90, linear_91, val_242, val_53_f_mask)
   val_243 = MatMul (scaled_dot_product_attention_15, val_98)
   linear_93 = Add (val_243, "text.transformer.layers.15.self_attn.out_proj.bias")
   add_1696 = Add (add_1623, linear_93)
   layer_norm_31 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1696, "text.transformer.layers.15.final_layer_norm.weight", "text.transformer.layers.15.final_layer_norm.bias")
   val_244 = MatMul (layer_norm_31, val_99)
   linear_94 = Add (val_244, "text.transformer.layers.15.fc1.bias")
   relu_15 = Relu (linear_94)
   val_245 = MatMul (relu_15, val_100)
   linear_95 = Add (val_245, "text.transformer.layers.15.fc2.bias")
   add_1725 = Add (add_1696, linear_95)
   layer_norm_32 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1725, "text.transformer.layers.16.self_attn_layer_norm.weight", "text.transformer.layers.16.self_attn_layer_norm.bias")
   val_246 = MatMul (layer_norm_32, val_101)
   linear_96 = Add (val_246, "text.transformer.layers.16.self_attn.q_proj.bias")
   val_247 = MatMul (layer_norm_32, val_102)
   linear_97 = Add (val_247, "text.transformer.layers.16.self_attn.k_proj.bias")
   val_248 = MatMul (layer_norm_32, val_103)
   scaled_dot_product_attention_16 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_96, linear_97, val_248, val_53_f_mask)
   val_249 = MatMul (scaled_dot_product_attention_16, val_104)
   linear_99 = Add (val_249, "text.transformer.layers.16.self_attn.out_proj.bias")
   add_1798 = Add (add_1725, linear_99)
   layer_norm_33 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1798, "text.transformer.layers.16.final_layer_norm.weight", "text.transformer.layers.16.final_layer_norm.bias")
   val_250 = MatMul (layer_norm_33, val_105)
   linear_100 = Add (val_250, "text.transformer.layers.16.fc1.bias")
   relu_16 = Relu (linear_100)
   val_251 = MatMul (relu_16, val_106)
   linear_101 = Add (val_251, "text.transformer.layers.16.fc2.bias")
   add_1827 = Add (add_1798, linear_101)
   layer_norm_34 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1827, "text.transformer.layers.17.self_attn_layer_norm.weight", "text.transformer.layers.17.self_attn_layer_norm.bias")
   val_252 = MatMul (layer_norm_34, val_107)
   linear_102 = Add (val_252, "text.transformer.layers.17.self_attn.q_proj.bias")
   val_253 = MatMul (layer_norm_34, val_108)
   linear_103 = Add (val_253, "text.transformer.layers.17.self_attn.k_proj.bias")
   val_254 = MatMul (layer_norm_34, val_109)
   scaled_dot_product_attention_17 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_102, linear_103, val_254, val_53_f_mask)
   val_255 = MatMul (scaled_dot_product_attention_17, val_110)
   linear_105 = Add (val_255, "text.transformer.layers.17.self_attn.out_proj.bias")
   add_1900 = Add (add_1827, linear_105)
   layer_norm_35 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1900, "text.transformer.layers.17.final_layer_norm.weight", "text.transformer.layers.17.final_layer_norm.bias")
   val_256 = MatMul (layer_norm_35, val_111)
   linear_106 = Add (val_256, "text.transformer.layers.17.fc1.bias")
   relu_17 = Relu (linear_106)
   val_257 = MatMul (relu_17, val_112)
   linear_107 = Add (val_257, "text.transformer.layers.17.fc2.bias")
   add_1929 = Add (add_1900, linear_107)
   layer_norm_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1929, "text.transformer.layers.18.self_attn_layer_norm.weight", "text.transformer.layers.18.self_attn_layer_norm.bias")
   val_258 = MatMul (layer_norm_36, val_113)
   linear_108 = Add (val_258, "text.transformer.layers.18.self_attn.q_proj.bias")
   val_259 = MatMul (layer_norm_36, val_114)
   linear_109 = Add (val_259, "text.transformer.layers.18.self_attn.k_proj.bias")
   val_260 = MatMul (layer_norm_36, val_115)
   scaled_dot_product_attention_18 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_108, linear_109, val_260, val_53_f_mask)
   val_261 = MatMul (scaled_dot_product_attention_18, val_116)
   linear_111 = Add (val_261, "text.transformer.layers.18.self_attn.out_proj.bias")
   add_2002 = Add (add_1929, linear_111)
   layer_norm_37 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2002, "text.transformer.layers.18.final_layer_norm.weight", "text.transformer.layers.18.final_layer_norm.bias")
   val_262 = MatMul (layer_norm_37, val_117)
   linear_112 = Add (val_262, "text.transformer.layers.18.fc1.bias")
   relu_18 = Relu (linear_112)
   val_263 = MatMul (relu_18, val_118)
   linear_113 = Add (val_263, "text.transformer.layers.18.fc2.bias")
   add_2031 = Add (add_2002, linear_113)
   layer_norm_38 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2031, "text.transformer.layers.19.self_attn_layer_norm.weight", "text.transformer.layers.19.self_attn_layer_norm.bias")
   val_264 = MatMul (layer_norm_38, val_119)
   linear_114 = Add (val_264, "text.transformer.layers.19.self_attn.q_proj.bias")
   val_265 = MatMul (layer_norm_38, val_120)
   linear_115 = Add (val_265, "text.transformer.layers.19.self_attn.k_proj.bias")
   val_266 = MatMul (layer_norm_38, val_121)
   scaled_dot_product_attention_19 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_114, linear_115, val_266, val_53_f_mask)
   val_267 = MatMul (scaled_dot_product_attention_19, val_122)
   linear_117 = Add (val_267, "text.transformer.layers.19.self_attn.out_proj.bias")
   add_2104 = Add (add_2031, linear_117)
   layer_norm_39 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2104, "text.transformer.layers.19.final_layer_norm.weight", "text.transformer.layers.19.final_layer_norm.bias")
   val_268 = MatMul (layer_norm_39, val_123)
   linear_118 = Add (val_268, "text.transformer.layers.19.fc1.bias")
   relu_19 = Relu (linear_118)
   val_269 = MatMul (relu_19, val_124)
   linear_119 = Add (val_269, "text.transformer.layers.19.fc2.bias")
   add_2133 = Add (add_2104, linear_119)
   layer_norm_40 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2133, "text.transformer.layers.20.self_attn_layer_norm.weight", "text.transformer.layers.20.self_attn_layer_norm.bias")
   val_270 = MatMul (layer_norm_40, val_125)
   linear_120 = Add (val_270, "text.transformer.layers.20.self_attn.q_proj.bias")
   val_271 = MatMul (layer_norm_40, val_126)
   linear_121 = Add (val_271, "text.transformer.layers.20.self_attn.k_proj.bias")
   val_272 = MatMul (layer_norm_40, val_127)
   scaled_dot_product_attention_20 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_120, linear_121, val_272, val_53_f_mask)
   val_273 = MatMul (scaled_dot_product_attention_20, val_128)
   linear_123 = Add (val_273, "text.transformer.layers.20.self_attn.out_proj.bias")
   add_2206 = Add (add_2133, linear_123)
   layer_norm_41 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2206, "text.transformer.layers.20.final_layer_norm.weight", "text.transformer.layers.20.final_layer_norm.bias")
   val_274 = MatMul (layer_norm_41, val_129)
   linear_124 = Add (val_274, "text.transformer.layers.20.fc1.bias")
   relu_20 = Relu (linear_124)
   val_275 = MatMul (relu_20, val_130)
   linear_125 = Add (val_275, "text.transformer.layers.20.fc2.bias")
   add_2235 = Add (add_2206, linear_125)
   layer_norm_42 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2235, "text.transformer.layers.21.self_attn_layer_norm.weight", "text.transformer.layers.21.self_attn_layer_norm.bias")
   val_276 = MatMul (layer_norm_42, val_131)
   linear_126 = Add (val_276, "text.transformer.layers.21.self_attn.q_proj.bias")
   val_277 = MatMul (layer_norm_42, val_132)
   linear_127 = Add (val_277, "text.transformer.layers.21.self_attn.k_proj.bias")
   val_278 = MatMul (layer_norm_42, val_133)
   scaled_dot_product_attention_21 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_126, linear_127, val_278, val_53_f_mask)
   val_279 = MatMul (scaled_dot_product_attention_21, val_134)
   linear_129 = Add (val_279, "text.transformer.layers.21.self_attn.out_proj.bias")
   add_2308 = Add (add_2235, linear_129)
   layer_norm_43 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2308, "text.transformer.layers.21.final_layer_norm.weight", "text.transformer.layers.21.final_layer_norm.bias")
   val_280 = MatMul (layer_norm_43, val_135)
   linear_130 = Add (val_280, "text.transformer.layers.21.fc1.bias")
   relu_21 = Relu (linear_130)
   val_281 = MatMul (relu_21, val_136)
   linear_131 = Add (val_281, "text.transformer.layers.21.fc2.bias")
   add_2337 = Add (add_2308, linear_131)
   layer_norm_44 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2337, "text.transformer.layers.22.self_attn_layer_norm.weight", "text.transformer.layers.22.self_attn_layer_norm.bias")
   val_282 = MatMul (layer_norm_44, val_137)
   linear_132 = Add (val_282, "text.transformer.layers.22.self_attn.q_proj.bias")
   val_283 = MatMul (layer_norm_44, val_138)
   linear_133 = Add (val_283, "text.transformer.layers.22.self_attn.k_proj.bias")
   val_284 = MatMul (layer_norm_44, val_139)
   scaled_dot_product_attention_22 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_132, linear_133, val_284, val_53_f_mask)
   val_285 = MatMul (scaled_dot_product_attention_22, val_140)
   linear_135 = Add (val_285, "text.transformer.layers.22.self_attn.out_proj.bias")
   add_2410 = Add (add_2337, linear_135)
   layer_norm_45 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2410, "text.transformer.layers.22.final_layer_norm.weight", "text.transformer.layers.22.final_layer_norm.bias")
   val_286 = MatMul (layer_norm_45, val_141)
   linear_136 = Add (val_286, "text.transformer.layers.22.fc1.bias")
   relu_22 = Relu (linear_136)
   val_287 = MatMul (relu_22, val_142)
   linear_137 = Add (val_287, "text.transformer.layers.22.fc2.bias")
   add_2439 = Add (add_2410, linear_137)
   layer_norm_46 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2439, "text.transformer.layers.23.self_attn_layer_norm.weight", "text.transformer.layers.23.self_attn_layer_norm.bias")
   val_288 = MatMul (layer_norm_46, val_143)
   linear_138 = Add (val_288, "text.transformer.layers.23.self_attn.q_proj.bias")
   val_289 = MatMul (layer_norm_46, val_144)
   linear_139 = Add (val_289, "text.transformer.layers.23.self_attn.k_proj.bias")
   val_290 = MatMul (layer_norm_46, val_145)
   scaled_dot_product_attention_23 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_138, linear_139, val_290, val_53_f_mask)
   [pool_hoist_scaled_dot_product_attention_23] scaled_dot_product_attention_23_pooled = Slice (scaled_dot_product_attention_23, val_4, val_3, val_3)
   val_291 = MatMul (scaled_dot_product_attention_23_pooled, val_146)
   linear_141 = Add (val_291, "text.transformer.layers.23.self_attn.out_proj.bias")
   [pool_hoist_add_2439] add_2439_pooled = Slice (add_2439, val_4, val_3, val_3)
   add_2512 = Add (add_2439_pooled, linear_141)
   layer_norm_47 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2512, "text.transformer.layers.23.final_layer_norm.weight", "text.transformer.layers.23.final_layer_norm.bias")
   val_292 = MatMul (layer_norm_47, val_147)
   linear_142 = Add (val_292, "text.transformer.layers.23.fc1.bias")
   relu_23 = Relu (linear_142)
   val_293 = MatMul (relu_23, val_148)
   linear_143 = Add (val_293, "text.transformer.layers.23.fc2.bias")
   add_2541 = Add (add_2512, linear_143)
   val_294 = Squeeze (add_2541, val_3)
   select = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_294, "text.transformer.layer_norm.weight", "text.transformer.layer_norm.bias")
   linear_144 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select, "text.proj.weight")
   [node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_144, val_0)
   [node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
   [node_div] text_embedding = Div (linear_144, clamp_min)
}

weights:
index_select FLOAT[77,1024] 5557f9a2e312
text.proj.weight FLOAT[1152,1024] 55e048680822
text.transformer.embed_tokens.weight_fp16 FLOAT16[256206,1024] 42c86760f25a
text.transformer.layer_norm.bias FLOAT[1024] 60755fd3978c
text.transformer.layer_norm.weight FLOAT[1024] ec72df13affb
text.transformer.layers.0.fc1.bias FLOAT[8192] da581ac11d40
text.transformer.layers.0.fc2.bias FLOAT[1024] 3d8a64baa055
text.transformer.layers.0.final_layer_norm.bias FLOAT[1024] 5f9bc3b4b230
text.transformer.layers.0.final_layer_norm.weight FLOAT[1024] 2fc708873f31
text.transformer.layers.0.self_attn.k_proj.bias FLOAT[1024] a332005c88d9
text.transformer.layers.0.self_attn.out_proj.bias FLOAT[1024] bb928f48bef7
text.transformer.layers.0.self_attn.q_proj.bias FLOAT[1024] c70a73083894
text.transformer.layers.0.self_attn_layer_norm.bias FLOAT[1024] 1ba71a8f571f
text.transformer.layers.0.self_attn_layer_norm.weight FLOAT[1024] abee2e87a65e
text.transformer.layers.1.fc1.bias FLOAT[8192] a5c004a9b518
text.transformer.layers.1.fc2.bias FLOAT[1024] 176e9c837bb5
text.transformer.layers.1.final_layer_norm.bias FLOAT[1024] 6fc5eae0b8aa
text.transformer.layers.1.final_layer_norm.weight FLOAT[1024] 9c4fdfb68bac
text.transformer.layers.1.self_attn.k_proj.bias FLOAT[1024] 19ef10502c75
text.transformer.layers.1.self_attn.out_proj.bias FLOAT[1024] 6cdccb5e1dd7
text.transformer.layers.1.self_attn.q_proj.bias FLOAT[1024] cc8ac68cb2da
text.transformer.layers.1.self_attn_layer_norm.bias FLOAT[1024] b87c002f950a
text.transformer.layers.1.self_attn_layer_norm.weight FLOAT[1024] c833f878d357
text.transformer.layers.10.fc1.bias FLOAT[8192] d86255e1ae42
text.transformer.layers.10.fc2.bias FLOAT[1024] 90c1526d37f1
text.transformer.layers.10.final_layer_norm.bias FLOAT[1024] 69380449e986
text.transformer.layers.10.final_layer_norm.weight FLOAT[1024] 3e135bc4db17
text.transformer.layers.10.self_attn.k_proj.bias FLOAT[1024] 0a2db193d758
text.transformer.layers.10.self_attn.out_proj.bias FLOAT[1024] 5cf6c3832913
text.transformer.layers.10.self_attn.q_proj.bias FLOAT[1024] d8990c64ca30
text.transformer.layers.10.self_attn_layer_norm.bias FLOAT[1024] 6e378511aa64
text.transformer.layers.10.self_attn_layer_norm.weight FLOAT[1024] d3b0ffbb9c76
text.transformer.layers.11.fc1.bias FLOAT[8192] b3b75a225c3a
text.transformer.layers.11.fc2.bias FLOAT[1024] 580165f03781
text.transformer.layers.11.final_layer_norm.bias FLOAT[1024] cdec57d2e767
text.transformer.layers.11.final_layer_norm.weight FLOAT[1024] 455a43df535f
text.transformer.layers.11.self_attn.k_proj.bias FLOAT[1024] 1f8e0f4492aa
text.transformer.layers.11.self_attn.out_proj.bias FLOAT[1024] d51276b674f2
text.transformer.layers.11.self_attn.q_proj.bias FLOAT[1024] e4f1901f0885
text.transformer.layers.11.self_attn_layer_norm.bias FLOAT[1024] 0ee5d439b9e1
text.transformer.layers.11.self_attn_layer_norm.weight FLOAT[1024] 76b3ac35271c
text.transformer.layers.12.fc1.bias FLOAT[8192] 3314dcbafa47
text.transformer.layers.12.fc2.bias FLOAT[1024] ff2e2ff984ec
text.transformer.layers.12.final_layer_norm.bias FLOAT[1024] bf4ee84548e4
text.transformer.layers.12.final_layer_norm.weight FLOAT[1024] bf5464f4e89f
text.transformer.layers.12.self_attn.k_proj.bias FLOAT[1024] dba6d3a66250
text.transformer.layers.12.self_attn.out_proj.bias FLOAT[1024] c2cec1fd4ad9
text.transformer.layers.12.self_attn.q_proj.bias FLOAT[1024] ac591e74a22a
text.transformer.layers.12.self_attn_layer_norm.bias FLOAT[1024] 8f804764d9b9
text.transformer.layers.12.self_attn_layer_norm.weight FLOAT[1024] 0bd073902825
text.transformer.layers.13.fc1.bias FLOAT[8192] 5ddf0300148c
text.transformer.layers.13.fc2.bias FLOAT[1024] 7c968655b713
text.transformer.layers.13.final_layer_norm.bias FLOAT[1024] d960eb7a2b0a
text.transformer.layers.13.final_layer_norm.weight FLOAT[1024] 68dbd11784c4
text.transformer.layers.13.self_attn.k_proj.bias FLOAT[1024] 2e685d310acb
text.transformer.layers.13.self_attn.out_proj.bias FLOAT[1024] 4ed7af90ba8b
text.transformer.layers.13.self_attn.q_proj.bias FLOAT[1024] e3549638ecb9
text.transformer.layers.13.self_attn_layer_norm.bias FLOAT[1024] a9b9d16efc14
text.transformer.layers.13.self_attn_layer_norm.weight FLOAT[1024] ca95182844cd
text.transformer.layers.14.fc1.bias FLOAT[8192] 203c7e5eafc6
text.transformer.layers.14.fc2.bias FLOAT[1024] 673cc89aeb64
text.transformer.layers.14.final_layer_norm.bias FLOAT[1024] 476a7478e3d8
text.transformer.layers.14.final_layer_norm.weight FLOAT[1024] 7e193ba8c869
text.transformer.layers.14.self_attn.k_proj.bias FLOAT[1024] 814d5fcafaa3
text.transformer.layers.14.self_attn.out_proj.bias FLOAT[1024] 977146fac7e6
text.transformer.layers.14.self_attn.q_proj.bias FLOAT[1024] 9ffdfb056c0f
text.transformer.layers.14.self_attn_layer_norm.bias FLOAT[1024] 1d4332956a3b
text.transformer.layers.14.self_attn_layer_norm.weight FLOAT[1024] e11f540e4087
text.transformer.layers.15.fc1.bias FLOAT[8192] 76d46dfb7933
text.transformer.layers.15.fc2.bias FLOAT[1024] 4b4619feffd4
text.transformer.layers.15.final_layer_norm.bias FLOAT[1024] 9da7e2d50fe1
text.transformer.layers.15.final_layer_norm.weight FLOAT[1024] 728046e67c07
text.transformer.layers.15.self_attn.k_proj.bias FLOAT[1024] 531a1ba87ca8
text.transformer.layers.15.self_attn.out_proj.bias FLOAT[1024] f83294099a6c
text.transformer.layers.15.self_attn.q_proj.bias FLOAT[1024] 53b34b11ca16
text.transformer.layers.15.self_attn_layer_norm.bias FLOAT[1024] 6ac25f840dc4
text.transformer.layers.15.self_attn_layer_norm.weight FLOAT[1024] df4791fdebc1
text.transformer.layers.16.fc1.bias FLOAT[8192] 6e13e9161340
text.transformer.layers.16.fc2.bias FLOAT[1024] 3d0e16a29c30
text.transformer.layers.16.final_layer_norm.bias FLOAT[1024] d550a20eb919
text.transformer.layers.16.final_layer_norm.weight FLOAT[1024] 7e93461b621f
text.transformer.layers.16.self_attn.k_proj.bias FLOAT[1024] e494aa72f244
text.transformer.layers.16.self_attn.out_proj.bias FLOAT[1024] 2e280a8d540c
text.transformer.layers.16.self_attn.q_proj.bias FLOAT[1024] 21a556d1d2bc
text.transformer.layers.16.self_attn_layer_norm.bias FLOAT[1024] 47db553ec7c3
text.transformer.layers.16.self_attn_layer_norm.weight FLOAT[1024] e1a29521105a
text.transformer.layers.17.fc1.bias FLOAT[8192] d722efe123c0
text.transformer.layers.17.fc2.bias FLOAT[1024] e65845d98333
text.transformer.layers.17.final_layer_norm.bias FLOAT[1024] 80f731fd3e16
text.transformer.layers.17.final_layer_norm.weight FLOAT[1024] c8b1be803d8e
text.transformer.layers.17.self_attn.k_proj.bias FLOAT[1024] 7ca793d76483
text.transformer.layers.17.self_attn.out_proj.bias FLOAT[1024] 2a255379da45
text.transformer.layers.17.self_attn.q_proj.bias FLOAT[1024] ac1405bddedf
text.transformer.layers.17.self_attn_layer_norm.bias FLOAT[1024] c1a19f3ba21e
text.transformer.layers.17.self_attn_layer_norm.weight FLOAT[1024] fe980773122a
text.transformer.layers.18.fc1.bias FLOAT[8192] 55b526916a57
text.transformer.layers.18.fc2.bias FLOAT[1024] 38c81e79d8c8
text.transformer.layers.18.final_layer_norm.bias FLOAT[1024] 94a9d5516560
text.transformer.layers.18.final_layer_norm.weight FLOAT[1024] dec10756ce1a
text.transformer.layers.18.self_attn.k_proj.bias FLOAT[1024] 35864a9a83e3
text.transformer.layers.18.self_attn.out_proj.bias FLOAT[1024] eae259017271
text.transformer.layers.18.self_attn.q_proj.bias FLOAT[1024] b202622af30d
text.transformer.layers.18.self_attn_layer_norm.bias FLOAT[1024] 7b6800cda7ec
text.transformer.layers.18.self_attn_layer_norm.weight FLOAT[1024] 9ba4f6863fc4
text.transformer.layers.19.fc1.bias FLOAT[8192] 92f93b5af23f
text.transformer.layers.19.fc2.bias FLOAT[1024] 27b083ecc331
text.transformer.layers.19.final_layer_norm.bias FLOAT[1024] 16ec9240949a
text.transformer.layers.19.final_layer_norm.weight FLOAT[1024] fb1d03b1c3cd
text.transformer.layers.19.self_attn.k_proj.bias FLOAT[1024] 62713f992a24
text.transformer.layers.19.self_attn.out_proj.bias FLOAT[1024] 4b2c2fb06900
text.transformer.layers.19.self_attn.q_proj.bias FLOAT[1024] 3c49358db3c0
text.transformer.layers.19.self_attn_layer_norm.bias FLOAT[1024] e484a3f228f0
text.transformer.layers.19.self_attn_layer_norm.weight FLOAT[1024] 12ec0e5414e8
text.transformer.layers.2.fc1.bias FLOAT[8192] 619e0cf0a6ca
text.transformer.layers.2.fc2.bias FLOAT[1024] 2a2ef8e1decc
text.transformer.layers.2.final_layer_norm.bias FLOAT[1024] bc03953e34dd
text.transformer.layers.2.final_layer_norm.weight FLOAT[1024] a17c81724a93
text.transformer.layers.2.self_attn.k_proj.bias FLOAT[1024] 0d5e985908a8
text.transformer.layers.2.self_attn.out_proj.bias FLOAT[1024] a4e7960c427c
text.transformer.layers.2.self_attn.q_proj.bias FLOAT[1024] d316aebf01ba
text.transformer.layers.2.self_attn_layer_norm.bias FLOAT[1024] dea8c0208952
text.transformer.layers.2.self_attn_layer_norm.weight FLOAT[1024] f395444740fa
text.transformer.layers.20.fc1.bias FLOAT[8192] 44863400c53e
text.transformer.layers.20.fc2.bias FLOAT[1024] cf138aa9816a
text.transformer.layers.20.final_layer_norm.bias FLOAT[1024] 41548761803d
text.transformer.layers.20.final_layer_norm.weight FLOAT[1024] 12f8d7a1cf0e
text.transformer.layers.20.self_attn.k_proj.bias FLOAT[1024] 5eceeef7170e
text.transformer.layers.20.self_attn.out_proj.bias FLOAT[1024] de7558c53b43
text.transformer.layers.20.self_attn.q_proj.bias FLOAT[1024] 99fb01cfbc88
text.transformer.layers.20.self_attn_layer_norm.bias FLOAT[1024] 220352f43d14
text.transformer.layers.20.self_attn_layer_norm.weight FLOAT[1024] 1183cb83fcb6
text.transformer.layers.21.fc1.bias FLOAT[8192] 1b69f7dedc8b
text.transformer.layers.21.fc2.bias FLOAT[1024] cd951ef5a39a
text.transformer.layers.21.final_layer_norm.bias FLOAT[1024] 4fe10b51710f
text.transformer.layers.21.final_layer_norm.weight FLOAT[1024] 44953e9466a3
text.transformer.layers.21.self_attn.k_proj.bias FLOAT[1024] 3ce8420d7257
text.transformer.layers.21.self_attn.out_proj.bias FLOAT[1024] 2750f0129fdc
text.transformer.layers.21.self_attn.q_proj.bias FLOAT[1024] 9fa6502bf061
text.transformer.layers.21.self_attn_layer_norm.bias FLOAT[1024] 594846039623
text.transformer.layers.21.self_attn_layer_norm.weight FLOAT[1024] 8efa999208a1
text.transformer.layers.22.fc1.bias FLOAT[8192] bae8df4e3c8b
text.transformer.layers.22.fc2.bias FLOAT[1024] 74e76d7b8f70
text.transformer.layers.22.final_layer_norm.bias FLOAT[1024] dae05e7f6998
text.transformer.layers.22.final_layer_norm.weight FLOAT[1024] d88cf385d03b
text.transformer.layers.22.self_attn.k_proj.bias FLOAT[1024] ebdbe156848f
text.transformer.layers.22.self_attn.out_proj.bias FLOAT[1024] e47fee48fc86
text.transformer.layers.22.self_attn.q_proj.bias FLOAT[1024] f7f5f9ea36b8
text.transformer.layers.22.self_attn_layer_norm.bias FLOAT[1024] 4afd40d50b9e
text.transformer.layers.22.self_attn_layer_norm.weight FLOAT[1024] 17b651d2c711
text.transformer.layers.23.fc1.bias FLOAT[8192] fcfca29a3931
text.transformer.layers.23.fc2.bias FLOAT[1024] 73ab474a3d12
text.transformer.layers.23.final_layer_norm.bias FLOAT[1024] 18ee64bad88a
text.transformer.layers.23.final_layer_norm.weight FLOAT[1024] a8ec270b11b7
text.transformer.layers.23.self_attn.k_proj.bias FLOAT[1024] 868d24d8cc89
text.transformer.layers.23.self_attn.out_proj.bias FLOAT[1024] 372dc80558e1
text.transformer.layers.23.self_attn.q_proj.bias FLOAT[1024] 5e1d65f169f7
text.transformer.layers.23.self_attn_layer_norm.bias FLOAT[1024] fd25bea2aad8
text.transformer.layers.23.self_attn_layer_norm.weight FLOAT[1024] 65e43ec8c830
text.transformer.layers.3.fc1.bias FLOAT[8192] 65aff83bd22a
text.transformer.layers.3.fc2.bias FLOAT[1024] c3e675f311f9
text.transformer.layers.3.final_layer_norm.bias FLOAT[1024] 9d47bcd4ea3c
text.transformer.layers.3.final_layer_norm.weight FLOAT[1024] 8fe04a2e9d8d
text.transformer.layers.3.self_attn.k_proj.bias FLOAT[1024] 680e68527cc0
text.transformer.layers.3.self_attn.out_proj.bias FLOAT[1024] 1b6aaf7dbb56
text.transformer.layers.3.self_attn.q_proj.bias FLOAT[1024] 7c3bfe5fe2b4
text.transformer.layers.3.self_attn_layer_norm.bias FLOAT[1024] 7c355161013e
text.transformer.layers.3.self_attn_layer_norm.weight FLOAT[1024] e750579ec949
text.transformer.layers.4.fc1.bias FLOAT[8192] c28e7f7078fb
text.transformer.layers.4.fc2.bias FLOAT[1024] 54d8854e0aed
text.transformer.layers.4.final_layer_norm.bias FLOAT[1024] c550e9a69463
text.transformer.layers.4.final_layer_norm.weight FLOAT[1024] 2294cd2854d9
text.transformer.layers.4.self_attn.k_proj.bias FLOAT[1024] ce7d61aa3cb0
text.transformer.layers.4.self_attn.out_proj.bias FLOAT[1024] 2c7b0ea833b6
text.transformer.layers.4.self_attn.q_proj.bias FLOAT[1024] 2944745df9e2
text.transformer.layers.4.self_attn_layer_norm.bias FLOAT[1024] bb4d693fafc1
text.transformer.layers.4.self_attn_layer_norm.weight FLOAT[1024] 234c8d6f0669
text.transformer.layers.5.fc1.bias FLOAT[8192] 35b5ec574ede
text.transformer.layers.5.fc2.bias FLOAT[1024] f119bebb05dd
text.transformer.layers.5.final_layer_norm.bias FLOAT[1024] ef2d4f453615
text.transformer.layers.5.final_layer_norm.weight FLOAT[1024] 40b43b01786f
text.transformer.layers.5.self_attn.k_proj.bias FLOAT[1024] 7963a37c6c41
text.transformer.layers.5.self_attn.out_proj.bias FLOAT[1024] 2e7c4e82126b
text.transformer.layers.5.self_attn.q_proj.bias FLOAT[1024] 51a0c3946293
text.transformer.layers.5.self_attn_layer_norm.bias FLOAT[1024] 9cf11e6d9770
text.transformer.layers.5.self_attn_layer_norm.weight FLOAT[1024] a0279ca6944c
text.transformer.layers.6.fc1.bias FLOAT[8192] 26c7098d5891
text.transformer.layers.6.fc2.bias FLOAT[1024] 2f68121265a3
text.transformer.layers.6.final_layer_norm.bias FLOAT[1024] 8fb6b15206d1
text.transformer.layers.6.final_layer_norm.weight FLOAT[1024] 96aedb821979
text.transformer.layers.6.self_attn.k_proj.bias FLOAT[1024] 9dffd99686fe
text.transformer.layers.6.self_attn.out_proj.bias FLOAT[1024] e60932a4775c
text.transformer.layers.6.self_attn.q_proj.bias FLOAT[1024] 6f4f1af3449e
text.transformer.layers.6.self_attn_layer_norm.bias FLOAT[1024] 52f3d2c7d930
text.transformer.layers.6.self_attn_layer_norm.weight FLOAT[1024] 56b5bb0dd83c
text.transformer.layers.7.fc1.bias FLOAT[8192] a7576f61efbf
text.transformer.layers.7.fc2.bias FLOAT[1024] b8f059f2fa9d
text.transformer.layers.7.final_layer_norm.bias FLOAT[1024] d358a338b165
text.transformer.layers.7.final_layer_norm.weight FLOAT[1024] 692c65913676
text.transformer.layers.7.self_attn.k_proj.bias FLOAT[1024] f00bea0637f8
text.transformer.layers.7.self_attn.out_proj.bias FLOAT[1024] 86c6a15e81b8
text.transformer.layers.7.self_attn.q_proj.bias FLOAT[1024] bac66214e5eb
text.transformer.layers.7.self_attn_layer_norm.bias FLOAT[1024] bc5299879837
text.transformer.layers.7.self_attn_layer_norm.weight FLOAT[1024] 697282f60749
text.transformer.layers.8.fc1.bias FLOAT[8192] fcfba13ce2cb
text.transformer.layers.8.fc2.bias FLOAT[1024] f97e3b439fda
text.transformer.layers.8.final_layer_norm.bias FLOAT[1024] 9bfe28e7ac8f
text.transformer.layers.8.final_layer_norm.weight FLOAT[1024] e5954e089aa6
text.transformer.layers.8.self_attn.k_proj.bias FLOAT[1024] c9dc27f74e28
text.transformer.layers.8.self_attn.out_proj.bias FLOAT[1024] 9befde289fe3
text.transformer.layers.8.self_attn.q_proj.bias FLOAT[1024] bb8bb491a198
text.transformer.layers.8.self_attn_layer_norm.bias FLOAT[1024] 2032a318b3ba
text.transformer.layers.8.self_attn_layer_norm.weight FLOAT[1024] d41411c984fb
text.transformer.layers.9.fc1.bias FLOAT[8192] c88dff26ea62
text.transformer.layers.9.fc2.bias FLOAT[1024] 5d0b97cb9c48
text.transformer.layers.9.final_layer_norm.bias FLOAT[1024] b7334874d541
text.transformer.layers.9.final_layer_norm.weight FLOAT[1024] e3c38fc690f2
text.transformer.layers.9.self_attn.k_proj.bias FLOAT[1024] 4100dff6e607
text.transformer.layers.9.self_attn.out_proj.bias FLOAT[1024] 84cf93c9c257
text.transformer.layers.9.self_attn.q_proj.bias FLOAT[1024] 974733395b27
text.transformer.layers.9.self_attn_layer_norm.bias FLOAT[1024] 98da55059b5b
text.transformer.layers.9.self_attn_layer_norm.weight FLOAT[1024] fca93ac42d7a
text_one FLOAT[] e00e5eb94441
text_pad_keep FLOAT[256206] 47daba355159
text_q_axis FLOAT[77,1] 9575b2125169
text_row_axes INT64[2] 0c730b69905c
text_scale FLOAT[] e401200e5808
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[8192,1024] 830dab86676d
val_100 FLOAT[8192,1024] 9c67c144471d
val_101 FLOAT[1024,1024] a5a8c97edcb2
val_102 FLOAT[1024,1024] f86f3aca9357
val_103 FLOAT[1024,1024] 860eaaf91dc2
val_104 FLOAT[1024,1024] f0d856637cc0
val_105 FLOAT[1024,8192] 3bb103a6cfbf
val_106 FLOAT[8192,1024] 5703235daaf0
val_107 FLOAT[1024,1024] 9ede4c04b202
val_108 FLOAT[1024,1024] c9a0540ad7ac
val_109 FLOAT[1024,1024] d145b7a23b36
val_11 FLOAT[1024,1024] 9ae6a23f1837
val_110 FLOAT[1024,1024] 621eb9943572
val_111 FLOAT[1024,8192] 6c7dfa0356c1
val_112 FLOAT[8192,1024] be49bb770a49
val_113 FLOAT[1024,1024] ca96d48eedcf
val_114 FLOAT[1024,1024] b38a9b3a8346
val_115 FLOAT[1024,1024] 881766d9f6ff
val_116 FLOAT[1024,1024] f911b6771bb2
val_117 FLOAT[1024,8192] dd1f0b953bad
val_118 FLOAT[8192,1024] 995ae23befd4
val_119 FLOAT[1024,1024] 18e5f77a8a2c
val_12 FLOAT[1024,1024] fbb4a71c9f3c
val_120 FLOAT[1024,1024] 43504047fc74
val_121 FLOAT[1024,1024] b24d3eaaf6b8
val_122 FLOAT[1024,1024] c922a9677a24
val_123 FLOAT[1024,8192] 4c880f9d0093
val_124 FLOAT[8192,1024] 3135551b369d
val_125 FLOAT[1024,1024] ffdcd4306871
val_126 FLOAT[1024,1024] 5ec143bbb657
val_127 FLOAT[1024,1024] ebe26a637678
val_128 FLOAT[1024,1024] 261e00f2b1c3
val_129 FLOAT[1024,8192] c8814374a5ef
val_13 FLOAT[1024,1024] 811273850dd4
val_130 FLOAT[8192,1024] 7fecaeb6b44e
val_131 FLOAT[1024,1024] 6dc1d71eca92
val_132 FLOAT[1024,1024] 35dabfce8699
val_133 FLOAT[1024,1024] dbd71a4dedbf
val_134 FLOAT[1024,1024] 9d3bf7cc69bf
val_135 FLOAT[1024,8192] 414a66be57b0
val_136 FLOAT[8192,1024] c845af2d352f
val_137 FLOAT[1024,1024] 1f8a90e41680
val_138 FLOAT[1024,1024] b271b491710f
val_139 FLOAT[1024,1024] 3e5bf38985bf
val_14 FLOAT[1024,1024] 187bbc970a88
val_140 FLOAT[1024,1024] 98de0337b1d5
val_141 FLOAT[1024,8192] 008f5b7347fb
val_142 FLOAT[8192,1024] 3e3752c07bde
val_143 FLOAT[1024,1024] d20a1d2b75f1
val_144 FLOAT[1024,1024] 85368c0795ed
val_145 FLOAT[1024,1024] 4cd28dc958bb
val_146 FLOAT[1024,1024] ffe846de541e
val_147 FLOAT[1024,8192] f1fea448f5be
val_148 FLOAT[8192,1024] d0f49a048c5b
val_15 FLOAT[1024,8192] 04454173db1f
val_16 FLOAT[8192,1024] 9a219bc7187b
val_17 FLOAT[1024,1024] d6648d65c1b8
val_18 FLOAT[1024,1024] 9e0d42e4298b
val_19 FLOAT[1024,1024] 3e935ca306f0
val_2 FLOAT[] 825ac1bb838d
val_20 FLOAT[1024,1024] 11704b34d0b4
val_21 FLOAT[1024,8192] a9548bf17a42
val_22 FLOAT[8192,1024] 1ebe9edb93d0
val_23 FLOAT[1024,1024] a86df384e69a
val_24 FLOAT[1024,1024] 7b479e49e6bb
val_25 FLOAT[1024,1024] 140d45aae57a
val_26 FLOAT[1024,1024] ba8c13d89aa4
val_27 FLOAT[1024,8192] f4facc06a5d4
val_28 FLOAT[8192,1024] dc2f6e3dde62
val_29 FLOAT[1024,1024] 2031041828f7
val_3 INT64[1] 7c9fa136d441
val_30 FLOAT[1024,1024] 01cedb3a1142
val_31 FLOAT[1024,1024] 15fef794306b
val_32 FLOAT[1024,1024] 74ed6a73d267
val_33 FLOAT[1024,8192] c3fca948802a
val_34 FLOAT[8192,1024] ccd91e20e74c
val_35 FLOAT[1024,1024] 8bc7fa767528
val_36 FLOAT[1024,1024] de6bd8797922
val_37 FLOAT[1024,1024] 499a7cbca1f0
val_38 FLOAT[1024,1024] ad9c7b1979fb
val_39 FLOAT[1024,8192] 019549140538
val_4 INT64[1] af5570f5a181
val_40 FLOAT[8192,1024] be5f96985868
val_41 FLOAT[1024,1024] 8dea840c0c63
val_42 FLOAT[1024,1024] f567a428c00a
val_43 FLOAT[1024,1024] 74eea72a6ec8
val_44 FLOAT[1024,1024] 89883a9cf253
val_45 FLOAT[1024,8192] 5092c0055830
val_46 FLOAT[8192,1024] 2fdb85d11322
val_47 FLOAT[1024,1024] c2a924ea05c2
val_48 FLOAT[1024,1024] 85b17ee0d5dd
val_49 FLOAT[1024,1024] c599799f5c0b
val_5 FLOAT[1024,1024] 6af956b556b1
val_50 FLOAT[1024,1024] c2fd1a3b62fc
val_51 FLOAT[1024,8192] c349bc4740ee
val_52 FLOAT[8192,1024] 9860cce8d284
val_53 FLOAT[1024,1024] e8d45a9e0e8f
val_54 FLOAT[1024,1024] 9a2eef62f3af
val_55 FLOAT[1024,1024] e2037420bbef
val_56 FLOAT[1024,1024] 47628b6c2966
val_57 FLOAT[1024,8192] a9b854222339
val_58 FLOAT[8192,1024] 3ff6b3132936
val_59 FLOAT[1024,1024] 304d90c1656e
val_6 FLOAT[1024,1024] 7e10b344bb71
val_60 FLOAT[1024,1024] 4f40c03114c3
val_61 FLOAT[1024,1024] f2b46b65ef6e
val_62 FLOAT[1024,1024] c6eea0af5a29
val_63 FLOAT[1024,8192] c2b1abc4a0fa
val_64 FLOAT[8192,1024] 5f8df5b80829
val_65 FLOAT[1024,1024] 50570fade673
val_66 FLOAT[1024,1024] d23c0bdb67d3
val_67 FLOAT[1024,1024] 640d8817bbb1
val_68 FLOAT[1024,1024] 953c67258b9c
val_69 FLOAT[1024,8192] 3bc4cb950e1a
val_7 FLOAT[1024,1024] 35021e3cefa8
val_70 FLOAT[8192,1024] 80667506baad
val_71 FLOAT[1024,1024] 73c1eb4eac00
val_72 FLOAT[1024,1024] f123d4e68452
val_73 FLOAT[1024,1024] c9bc70d5e3d2
val_74 FLOAT[1024,1024] 4ff8abf51dbb
val_75 FLOAT[1024,8192] ba7c38aee610
val_76 FLOAT[8192,1024] 2b5e4ffb086c
val_77 FLOAT[1024,1024] 778dd2a59082
val_78 FLOAT[1024,1024] 5ed3fa44262f
val_79 FLOAT[1024,1024] 698fda600208
val_8 FLOAT[1024,1024] 70f32798c076
val_80 FLOAT[1024,1024] 7783e16a9d9f
val_81 FLOAT[1024,8192] 28d5dabd19ed
val_82 FLOAT[8192,1024] 4aac11ab7a83
val_83 FLOAT[1024,1024] 92896e7b8c85
val_84 FLOAT[1024,1024] bb58ac24a4e9
val_85 FLOAT[1024,1024] fb1971b24348
val_86 FLOAT[1024,1024] d7b0b3c5e83c
val_87 FLOAT[1024,8192] 4753a5deece4
val_88 FLOAT[8192,1024] 800a6fac4d24
val_89 FLOAT[1024,1024] 69bfb77ecf81
val_9 FLOAT[1024,8192] 7fb33bbb525c
val_90 FLOAT[1024,1024] 9404e17037e2
val_91 FLOAT[1024,1024] e40331a30261
val_92 FLOAT[1024,1024] adb99410e42c
val_93 FLOAT[1024,8192] 0d9a34cce693
val_94 FLOAT[8192,1024] dd9b1da678d4
val_95 FLOAT[1024,1024] b984aa15bb9b
val_96 FLOAT[1024,1024] 89597484c6b7
val_97 FLOAT[1024,1024] a7b171fc6185
val_98 FLOAT[1024,1024] 2c681246adec
val_99 FLOAT[1024,8192] 4c03b5aa3f52
view_1_target INT64[3] 6091ae349ac5
