<
   ir_version: 10,
   opset_import: ["" : 23],
   producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding) 
   <
      float[batch,77,1024] add_1050
      float[batch,77,1024] add_1075
      float[batch,77,1024] add_1148
      float[batch,77,1024] add_1173
      float[batch,77,1024] add_1246
      float[batch,77,1024] add_1271
      float[batch,77,1024] add_1344
      float[batch,77,1024] add_1369
      float[batch,77,1024] add_1442
      float[batch,77,1024] add_1467
      float[batch,77,1024] add_1540
      float[batch,77,1024] add_1565
      float[batch,77,1024] add_1638
      float[batch,77,1024] add_1663
      float[batch,77,1024] add_168
      float[batch,77,1024] add_1736
      float[batch,77,1024] add_1761
      float[batch,77,1024] add_1834
      float[batch,77,1024] add_1859
      float[batch,77,1024] add_193
      float[batch,77,1024] add_1932
      float[batch,77,1024] add_1957
      float[batch,77,1024] add_2030
      float[batch,77,1024] add_2055
      float[batch,77,1024] add_2128
      float[batch,77,1024] add_2153
      float[batch,77,1024] add_2226
      float[batch,77,1024] add_2251
      float[batch,77,1024] add_2324
      float[batch,77,1024] add_2349
      float[batch,77,1024] add_2422
      float[batch,77,1024] add_2447
      float[batch,77,1024] add_266
      float[batch,77,1024] add_291
      float[batch,77,1024] add_364
      float[batch,77,1024] add_389
      float[batch,77,1024] add_46
      float[batch,77,1024] add_462
      float[batch,77,1024] add_487
      float[batch,77,1024] add_55
      float[batch,77,1024] add_560
      float[batch,77,1024] add_585
      float[batch,77,1024] add_658
      float[batch,77,1024] add_683
      float[batch,77,1024] add_756
      float[batch,77,1024] add_781
      float[batch,77,1024] add_854
      float[batch,77,1024] add_879
      float[batch,77,1024] add_952
      float[batch,77,1024] add_977
      float[batch,1,1,77] bitwise_and_1_f
      float[batch,1] clamp_min
      float[batch,1024] div
      float[batch,77,1024] embedding
      float[batch,77,4096] gelu
      float[batch,77,4096] gelu_1
      float[batch,77,4096] gelu_10
      float[batch,77,4096] gelu_11
      float[batch,77,4096] gelu_12
      float[batch,77,4096] gelu_13
      float[batch,77,4096] gelu_14
      float[batch,77,4096] gelu_15
      float[batch,77,4096] gelu_16
      float[batch,77,4096] gelu_17
      float[batch,77,4096] gelu_18
      float[batch,77,4096] gelu_19
      float[batch,77,4096] gelu_2
      float[batch,77,4096] gelu_20
      float[batch,77,4096] gelu_21
      float[batch,77,4096] gelu_22
      float[batch,77,4096] gelu_23
      float[batch,1024] gelu_24
      float[batch,77,4096] gelu_3
      float[batch,77,4096] gelu_4
      float[batch,77,4096] gelu_5
      float[batch,77,4096] gelu_6
      float[batch,77,4096] gelu_7
      float[batch,77,4096] gelu_8
      float[batch,77,4096] gelu_9
      float[batch,77,1024] layer_norm
      float[batch,77,1024] layer_norm_1
      float[batch,77,1024] layer_norm_10
      float[batch,77,1024] layer_norm_11
      float[batch,77,1024] layer_norm_12
      float[batch,77,1024] layer_norm_13
      float[batch,77,1024] layer_norm_14
      float[batch,77,1024] layer_norm_15
      float[batch,77,1024] layer_norm_16
      float[batch,77,1024] layer_norm_17
      float[batch,77,1024] layer_norm_18
      float[batch,77,1024] layer_norm_19
      float[batch,77,1024] layer_norm_2
      float[batch,77,1024] layer_norm_20
      float[batch,77,1024] layer_norm_21
      float[batch,77,1024] layer_norm_22
      float[batch,77,1024] layer_norm_23
      float[batch,77,1024] layer_norm_24
      float[batch,77,1024] layer_norm_25
      float[batch,77,1024] layer_norm_26
      float[batch,77,1024] layer_norm_27
      float[batch,77,1024] layer_norm_28
      float[batch,77,1024] layer_norm_29
      float[batch,77,1024] layer_norm_3
      float[batch,77,1024] layer_norm_30
      float[batch,77,1024] layer_norm_31
      float[batch,77,1024] layer_norm_32
      float[batch,77,1024] layer_norm_33
      float[batch,77,1024] layer_norm_34
      float[batch,77,1024] layer_norm_35
      float[batch,77,1024] layer_norm_36
      float[batch,77,1024] layer_norm_37
      float[batch,77,1024] layer_norm_38
      float[batch,77,1024] layer_norm_39
      float[batch,77,1024] layer_norm_4
      float[batch,77,1024] layer_norm_40
      float[batch,77,1024] layer_norm_41
      float[batch,77,1024] layer_norm_42
      float[batch,77,1024] layer_norm_43
      float[batch,77,1024] layer_norm_44
      float[batch,77,1024] layer_norm_45
      float[batch,77,1024] layer_norm_46
      float[batch,77,1024] layer_norm_47
      float[batch,77,1024] layer_norm_48
      float[batch,77,1024] layer_norm_5
      float[batch,77,1024] layer_norm_6
      float[batch,77,1024] layer_norm_7
      float[batch,77,1024] layer_norm_8
      float[batch,77,1024] layer_norm_9
      float[batch,1] linalg_vector_norm
      float[batch,77,1024] linear
      float[batch,77,1024] linear_1
      float[batch,77,4096] linear_10
      float[batch,77,4096] linear_100
      float[batch,77,1024] linear_101
      float[batch,77,1024] linear_102
      float[batch,77,1024] linear_103
      float[batch,77,1024] linear_105
      float[batch,77,4096] linear_106
      float[batch,77,1024] linear_107
      float[batch,77,1024] linear_108
      float[batch,77,1024] linear_109
      float[batch,77,1024] linear_11
      float[batch,77,1024] linear_111
      float[batch,77,4096] linear_112
      float[batch,77,1024] linear_113
      float[batch,77,1024] linear_114
      float[batch,77,1024] linear_115
      float[batch,77,1024] linear_117
      float[batch,77,4096] linear_118
      float[batch,77,1024] linear_119
      float[batch,77,1024] linear_12
      float[batch,77,1024] linear_120
      float[batch,77,1024] linear_121
      float[batch,77,1024] linear_123
      float[batch,77,4096] linear_124
      float[batch,77,1024] linear_125
      float[batch,77,1024] linear_126
      float[batch,77,1024] linear_127
      float[batch,77,1024] linear_129
      float[batch,77,1024] linear_13
      float[batch,77,4096] linear_130
      float[batch,77,1024] linear_131
      float[batch,77,1024] linear_132
      float[batch,77,1024] linear_133
      float[batch,77,1024] linear_135
      float[batch,77,4096] linear_136
      float[batch,77,1024] linear_137
      float[batch,77,1024] linear_138
      float[batch,77,1024] linear_139
      float[batch,77,1024] linear_141
      float[batch,77,4096] linear_142
      float[batch,77,1024] linear_143
      float[batch,1024] linear_144
      float[batch,1024] linear_145
      float[batch,77,1024] linear_15
      float[batch,77,4096] linear_16
      float[batch,77,1024] linear_17
      float[batch,77,1024] linear_18
      float[batch,77,1024] linear_19
      float[batch,77,1024] linear_21
      float[batch,77,4096] linear_22
      float[batch,77,1024] linear_23
      float[batch,77,1024] linear_24
      float[batch,77,1024] linear_25
      float[batch,77,1024] linear_27
      float[batch,77,4096] linear_28
      float[batch,77,1024] linear_29
      float[batch,77,1024] linear_3
      float[batch,77,1024] linear_30
      float[batch,77,1024] linear_31
      float[batch,77,1024] linear_33
      float[batch,77,4096] linear_34
      float[batch,77,1024] linear_35
      float[batch,77,1024] linear_36
      float[batch,77,1024] linear_37
      float[batch,77,1024] linear_39
      float[batch,77,4096] linear_4
      float[batch,77,4096] linear_40
      float[batch,77,1024] linear_41
      float[batch,77,1024] linear_42
      float[batch,77,1024] linear_43
      float[batch,77,1024] linear_45
      float[batch,77,4096] linear_46
      float[batch,77,1024] linear_47
      float[batch,77,1024] linear_48
      float[batch,77,1024] linear_49
      float[batch,77,1024] linear_5
      float[batch,77,1024] linear_51
      float[batch,77,4096] linear_52
      float[batch,77,1024] linear_53
      float[batch,77,1024] linear_54
      float[batch,77,1024] linear_55
      float[batch,77,1024] linear_57
      float[batch,77,4096] linear_58
      float[batch,77,1024] linear_59
      float[batch,77,1024] linear_6
      float[batch,77,1024] linear_60
      float[batch,77,1024] linear_61
      float[batch,77,1024] linear_63
      float[batch,77,4096] linear_64
      float[batch,77,1024] linear_65
      float[batch,77,1024] linear_66
      float[batch,77,1024] linear_67
      float[batch,77,1024] linear_69
      float[batch,77,1024] linear_7
      float[batch,77,4096] linear_70
      float[batch,77,1024] linear_71
      float[batch,77,1024] linear_72
      float[batch,77,1024] linear_73
      float[batch,77,1024] linear_75
      float[batch,77,4096] linear_76
      float[batch,77,1024] linear_77
      float[batch,77,1024] linear_78
      float[batch,77,1024] linear_79
      float[batch,77,1024] linear_81
      float[batch,77,4096] linear_82
      float[batch,77,1024] linear_83
      float[batch,77,1024] linear_84
      float[batch,77,1024] linear_85
      float[batch,77,1024] linear_87
      float[batch,77,4096] linear_88
      float[batch,77,1024] linear_89
      float[batch,77,1024] linear_9
      float[batch,77,1024] linear_90
      float[batch,77,1024] linear_91
      float[batch,77,1024] linear_93
      float[batch,77,4096] linear_94
      float[batch,77,1024] linear_95
      float[batch,77,1024] linear_96
      float[batch,77,1024] linear_97
      float[batch,77,1024] linear_99
      float[batch,77,1024] mul_1225
      float[batch,77,1024] scaled_dot_product_attention
      float[batch,77,1024] scaled_dot_product_attention_1
      float[batch,77,1024] scaled_dot_product_attention_10
      float[batch,77,1024] scaled_dot_product_attention_11
      float[batch,77,1024] scaled_dot_product_attention_12
      float[batch,77,1024] scaled_dot_product_attention_13
      float[batch,77,1024] scaled_dot_product_attention_14
      float[batch,77,1024] scaled_dot_product_attention_15
      float[batch,77,1024] scaled_dot_product_attention_16
      float[batch,77,1024] scaled_dot_product_attention_17
      float[batch,77,1024] scaled_dot_product_attention_18
      float[batch,77,1024] scaled_dot_product_attention_19
      float[batch,77,1024] scaled_dot_product_attention_2
      float[batch,77,1024] scaled_dot_product_attention_20
      float[batch,77,1024] scaled_dot_product_attention_21
      float[batch,77,1024] scaled_dot_product_attention_22
      float[batch,77,1024] scaled_dot_product_attention_23
      float[batch,77,1024] scaled_dot_product_attention_3
      float[batch,77,1024] scaled_dot_product_attention_4
      float[batch,77,1024] scaled_dot_product_attention_5
      float[batch,77,1024] scaled_dot_product_attention_6
      float[batch,77,1024] scaled_dot_product_attention_7
      float[batch,77,1024] scaled_dot_product_attention_8
      float[batch,77,1024] scaled_dot_product_attention_9
      float[batch,1024] sum_1
      float[batch,1] sum_2_f
      float[batch,77] text_keep
      float[batch,77,1] unsqueeze_12_f
      float[batch,77,1024] val_148
      float[batch,77,1024] val_149
      float[batch,77,1024] val_150
      float[batch,77,1024] val_151
      float[batch,77,4096] val_152
      float[batch,77,1024] val_153
      float[batch,77,1024] val_154
      float[batch,77,1024] val_155
      float[batch,77,1024] val_156
      float[batch,77,1024] val_157
      float[batch,77,4096] val_158
      float[batch,77,1024] val_159
      float[batch,77,1024] val_160
      float[batch,77,1024] val_161
      float[batch,77,1024] val_162
      float[batch,77,1024] val_163
      float[batch,77,4096] val_164
      float[batch,77,1024] val_165
      float[batch,77,1024] val_166
      float[batch,77,1024] val_167
      float[batch,77,1024] val_168
      float[batch,77,1024] val_169
      float[batch,77,4096] val_170
      float[batch,77,1024] val_171
      float[batch,77,1024] val_172
      float[batch,77,1024] val_173
      float[batch,77,1024] val_174
      float[batch,77,1024] val_175
      float[batch,77,4096] val_176
      float[batch,77,1024] val_177
      float[batch,77,1024] val_178
      float[batch,77,1024] val_179
      float[batch,77,1024] val_180
      float[batch,77,1024] val_181
      float[batch,77,4096] val_182
      float[batch,77,1024] val_183
      float[batch,77,1024] val_184
      float[batch,77,1024] val_185
      float[batch,77,1024] val_186
      float[batch,77,1024] val_187
      float[batch,77,4096] val_188
      float[batch,77,1024] val_189
      float[batch,77,1024] val_190
      float[batch,77,1024] val_191
      float[batch,77,1024] val_192
      float[batch,77,1024] val_193
      float[batch,77,4096] val_194
      float[batch,77,1024] val_195
      float[batch,77,1024] val_196
      float[batch,77,1024] val_197
      float[batch,77,1024] val_198
      float[batch,77,1024] val_199
      float[batch,77,4096] val_200
      float[batch,77,1024] val_201
      float[batch,77,1024] val_202
      float[batch,77,1024] val_203
      float[batch,77,1024] val_204
      float[batch,77,1024] val_205
      float[batch,77,4096] val_206
      float[batch,77,1024] val_207
      float[batch,77,1024] val_208
      float[batch,77,1024] val_209
      float[batch,77,1024] val_210
      float[batch,77,1024] val_211
      float[batch,77,4096] val_212
      float[batch,77,1024] val_213
      float[batch,77,1024] val_214
      float[batch,77,1024] val_215
      float[batch,77,1024] val_216
      float[batch,77,1024] val_217
      float[batch,77,4096] val_218
      float[batch,77,1024] val_219
      float[batch,77,1024] val_220
      float[batch,77,1024] val_221
      float[batch,77,1024] val_222
      float[batch,77,1024] val_223
      float[batch,77,4096] val_224
      float[batch,77,1024] val_225
      float[batch,77,1024] val_226
      float[batch,77,1024] val_227
      float[batch,77,1024] val_228
      float[batch,77,1024] val_229
      float[batch,77,4096] val_230
      float[batch,77,1024] val_231
      float[batch,77,1024] val_232
      float[batch,77,1024] val_233
      float[batch,77,1024] val_234
      float[batch,77,1024] val_235
      float[batch,77,4096] val_236
      float[batch,77,1024] val_237
      float[batch,77,1024] val_238
      float[batch,77,1024] val_239
      float[batch,77,1024] val_240
      float[batch,77,1024] val_241
      float[batch,77,4096] val_242
      float[batch,77,1024] val_243
      float[batch,77,1024] val_244
      float[batch,77,1024] val_245
      float[batch,77,1024] val_246
      float[batch,77,1024] val_247
      float[batch,77,4096] val_248
      float[batch,77,1024] val_249
      float[batch,77,1024] val_250
      float[batch,77,1024] val_251
      float[batch,77,1024] val_252
      float[batch,77,1024] val_253
      float[batch,77,4096] val_254
      float[batch,77,1024] val_255
      float[batch,77,1024] val_256
      float[batch,77,1024] val_257
      float[batch,77,1024] val_258
      float[batch,77,1024] val_259
      float[batch,77,4096] val_260
      float[batch,77,1024] val_261
      float[batch,77,1024] val_262
      float[batch,77,1024] val_263
      float[batch,77,1024] val_264
      float[batch,77,1024] val_265
      float[batch,77,4096] val_266
      float[batch,77,1024] val_267
      float[batch,77,1024] val_268
      float[batch,77,1024] val_269
      float[batch,77,1024] val_270
      float[batch,77,1024] val_271
      float[batch,77,4096] val_272
      float[batch,77,1024] val_273
      float[batch,77,1024] val_274
      float[batch,77,1024] val_275
      float[batch,77,1024] val_276
      float[batch,77,1024] val_277
      float[batch,77,4096] val_278
      float[batch,77,1024] val_279
      float[batch,77,1024] val_280
      float[batch,77,1024] val_281
      float[batch,77,1024] val_282
      float[batch,77,1024] val_283
      float[batch,77,4096] val_284
      float[batch,77,1024] val_285
      float[batch,77,1024] val_286
      float[batch,77,1024] val_287
      float[batch,77,1024] val_288
      float[batch,77,1024] val_289
      float[batch,77,4096] val_290
      float[batch,77,1024] val_291
      float[batch,1,1,77] val_52_f
      float[batch,1,1,77] val_52_f_bias
      float[batch,1,77,77] val_52_f_mask
   >
{
   val_147 = Gather <axis: int = 0> ("text.transformer.embeddings.word_embeddings.weight_fp16", text)
   embedding = Cast <to: int = 1> (val_147)
   add_46 = Add (embedding, embedding_1)
   add_55 = Add (add_46, embedding_2)
   [node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_55, "text.transformer.embeddings.LayerNorm.weight", "text.transformer.embeddings.LayerNorm.bias")
   val_148 = MatMul (layer_norm, val_3)
   [node_linear] linear = Add (val_148, "text.transformer.encoder.layer.0.attention.self.query.bias")
   val_149 = MatMul (layer_norm, val_4)
   linear_1 = Add (val_149, "text.transformer.encoder.layer.0.attention.self.key.bias")
   val_150 = MatMul (layer_norm, val_5)
   [pad_keep] text_keep = Gather <axis: int = 0> (text_pad_keep, text)
   [val_52_f] val_52_f = Unsqueeze (text_keep, text_row_axes)
   [bitwise_and_1_f] bitwise_and_1_f = Sub (val_52_f, text_one)
   val_52_f_bias = Mul (bitwise_and_1_f, text_scale)
   val_52_f_mask = Add (val_52_f_bias, text_q_axis)
   [node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear, linear_1, val_150, val_52_f_mask)
   val_151 = MatMul (scaled_dot_product_attention, val_6)
   linear_3 = Add (val_151, "text.transformer.encoder.layer.0.attention.output.dense.bias")
   add_168 = Add (linear_3, layer_norm)
   layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_168, "text.transformer.encoder.layer.0.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.0.attention.output.LayerNorm.bias")
   val_152 = MatMul (layer_norm_1, val_7)
   linear_4 = Add (val_152, "text.transformer.encoder.layer.0.intermediate.dense.bias")
   [node_gelu] gelu = Gelu <approximate: string = "none"> (linear_4)
   val_153 = MatMul (gelu, val_8)
   linear_5 = Add (val_153, "text.transformer.encoder.layer.0.output.dense.bias")
   add_193 = Add (linear_5, layer_norm_1)
   layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_193, "text.transformer.encoder.layer.0.output.LayerNorm.weight", "text.transformer.encoder.layer.0.output.LayerNorm.bias")
   val_154 = MatMul (layer_norm_2, val_9)
   linear_6 = Add (val_154, "text.transformer.encoder.layer.1.attention.self.query.bias")
   val_155 = MatMul (layer_norm_2, val_10)
   linear_7 = Add (val_155, "text.transformer.encoder.layer.1.attention.self.key.bias")
   val_156 = MatMul (layer_norm_2, val_11)
   scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_6, linear_7, val_156, val_52_f_mask)
   val_157 = MatMul (scaled_dot_product_attention_1, val_12)
   linear_9 = Add (val_157, "text.transformer.encoder.layer.1.attention.output.dense.bias")
   add_266 = Add (linear_9, layer_norm_2)
   layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_266, "text.transformer.encoder.layer.1.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.1.attention.output.LayerNorm.bias")
   val_158 = MatMul (layer_norm_3, val_13)
   linear_10 = Add (val_158, "text.transformer.encoder.layer.1.intermediate.dense.bias")
   gelu_1 = Gelu <approximate: string = "none"> (linear_10)
   val_159 = MatMul (gelu_1, val_14)
   linear_11 = Add (val_159, "text.transformer.encoder.layer.1.output.dense.bias")
   add_291 = Add (linear_11, layer_norm_3)
   layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_291, "text.transformer.encoder.layer.1.output.LayerNorm.weight", "text.transformer.encoder.layer.1.output.LayerNorm.bias")
   val_160 = MatMul (layer_norm_4, val_15)
   linear_12 = Add (val_160, "text.transformer.encoder.layer.2.attention.self.query.bias")
   val_161 = MatMul (layer_norm_4, val_16)
   linear_13 = Add (val_161, "text.transformer.encoder.layer.2.attention.self.key.bias")
   val_162 = MatMul (layer_norm_4, val_17)
   scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_12, linear_13, val_162, val_52_f_mask)
   val_163 = MatMul (scaled_dot_product_attention_2, val_18)
   linear_15 = Add (val_163, "text.transformer.encoder.layer.2.attention.output.dense.bias")
   add_364 = Add (linear_15, layer_norm_4)
   layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_364, "text.transformer.encoder.layer.2.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.2.attention.output.LayerNorm.bias")
   val_164 = MatMul (layer_norm_5, val_19)
   linear_16 = Add (val_164, "text.transformer.encoder.layer.2.intermediate.dense.bias")
   gelu_2 = Gelu <approximate: string = "none"> (linear_16)
   val_165 = MatMul (gelu_2, val_20)
   linear_17 = Add (val_165, "text.transformer.encoder.layer.2.output.dense.bias")
   add_389 = Add (linear_17, layer_norm_5)
   layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_389, "text.transformer.encoder.layer.2.output.LayerNorm.weight", "text.transformer.encoder.layer.2.output.LayerNorm.bias")
   val_166 = MatMul (layer_norm_6, val_21)
   linear_18 = Add (val_166, "text.transformer.encoder.layer.3.attention.self.query.bias")
   val_167 = MatMul (layer_norm_6, val_22)
   linear_19 = Add (val_167, "text.transformer.encoder.layer.3.attention.self.key.bias")
   val_168 = MatMul (layer_norm_6, val_23)
   scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_18, linear_19, val_168, val_52_f_mask)
   val_169 = MatMul (scaled_dot_product_attention_3, val_24)
   linear_21 = Add (val_169, "text.transformer.encoder.layer.3.attention.output.dense.bias")
   add_462 = Add (linear_21, layer_norm_6)
   layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_462, "text.transformer.encoder.layer.3.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.3.attention.output.LayerNorm.bias")
   val_170 = MatMul (layer_norm_7, val_25)
   linear_22 = Add (val_170, "text.transformer.encoder.layer.3.intermediate.dense.bias")
   gelu_3 = Gelu <approximate: string = "none"> (linear_22)
   val_171 = MatMul (gelu_3, val_26)
   linear_23 = Add (val_171, "text.transformer.encoder.layer.3.output.dense.bias")
   add_487 = Add (linear_23, layer_norm_7)
   layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_487, "text.transformer.encoder.layer.3.output.LayerNorm.weight", "text.transformer.encoder.layer.3.output.LayerNorm.bias")
   val_172 = MatMul (layer_norm_8, val_27)
   linear_24 = Add (val_172, "text.transformer.encoder.layer.4.attention.self.query.bias")
   val_173 = MatMul (layer_norm_8, val_28)
   linear_25 = Add (val_173, "text.transformer.encoder.layer.4.attention.self.key.bias")
   val_174 = MatMul (layer_norm_8, val_29)
   scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_24, linear_25, val_174, val_52_f_mask)
   val_175 = MatMul (scaled_dot_product_attention_4, val_30)
   linear_27 = Add (val_175, "text.transformer.encoder.layer.4.attention.output.dense.bias")
   add_560 = Add (linear_27, layer_norm_8)
   layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_560, "text.transformer.encoder.layer.4.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.4.attention.output.LayerNorm.bias")
   val_176 = MatMul (layer_norm_9, val_31)
   linear_28 = Add (val_176, "text.transformer.encoder.layer.4.intermediate.dense.bias")
   gelu_4 = Gelu <approximate: string = "none"> (linear_28)
   val_177 = MatMul (gelu_4, val_32)
   linear_29 = Add (val_177, "text.transformer.encoder.layer.4.output.dense.bias")
   add_585 = Add (linear_29, layer_norm_9)
   layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_585, "text.transformer.encoder.layer.4.output.LayerNorm.weight", "text.transformer.encoder.layer.4.output.LayerNorm.bias")
   val_178 = MatMul (layer_norm_10, val_33)
   linear_30 = Add (val_178, "text.transformer.encoder.layer.5.attention.self.query.bias")
   val_179 = MatMul (layer_norm_10, val_34)
   linear_31 = Add (val_179, "text.transformer.encoder.layer.5.attention.self.key.bias")
   val_180 = MatMul (layer_norm_10, val_35)
   scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_30, linear_31, val_180, val_52_f_mask)
   val_181 = MatMul (scaled_dot_product_attention_5, val_36)
   linear_33 = Add (val_181, "text.transformer.encoder.layer.5.attention.output.dense.bias")
   add_658 = Add (linear_33, layer_norm_10)
   layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_658, "text.transformer.encoder.layer.5.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.5.attention.output.LayerNorm.bias")
   val_182 = MatMul (layer_norm_11, val_37)
   linear_34 = Add (val_182, "text.transformer.encoder.layer.5.intermediate.dense.bias")
   gelu_5 = Gelu <approximate: string = "none"> (linear_34)
   val_183 = MatMul (gelu_5, val_38)
   linear_35 = Add (val_183, "text.transformer.encoder.layer.5.output.dense.bias")
   add_683 = Add (linear_35, layer_norm_11)
   layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_683, "text.transformer.encoder.layer.5.output.LayerNorm.weight", "text.transformer.encoder.layer.5.output.LayerNorm.bias")
   val_184 = MatMul (layer_norm_12, val_39)
   linear_36 = Add (val_184, "text.transformer.encoder.layer.6.attention.self.query.bias")
   val_185 = MatMul (layer_norm_12, val_40)
   linear_37 = Add (val_185, "text.transformer.encoder.layer.6.attention.self.key.bias")
   val_186 = MatMul (layer_norm_12, val_41)
   scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_36, linear_37, val_186, val_52_f_mask)
   val_187 = MatMul (scaled_dot_product_attention_6, val_42)
   linear_39 = Add (val_187, "text.transformer.encoder.layer.6.attention.output.dense.bias")
   add_756 = Add (linear_39, layer_norm_12)
   layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_756, "text.transformer.encoder.layer.6.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.6.attention.output.LayerNorm.bias")
   val_188 = MatMul (layer_norm_13, val_43)
   linear_40 = Add (val_188, "text.transformer.encoder.layer.6.intermediate.dense.bias")
   gelu_6 = Gelu <approximate: string = "none"> (linear_40)
   val_189 = MatMul (gelu_6, val_44)
   linear_41 = Add (val_189, "text.transformer.encoder.layer.6.output.dense.bias")
   add_781 = Add (linear_41, layer_norm_13)
   layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_781, "text.transformer.encoder.layer.6.output.LayerNorm.weight", "text.transformer.encoder.layer.6.output.LayerNorm.bias")
   val_190 = MatMul (layer_norm_14, val_45)
   linear_42 = Add (val_190, "text.transformer.encoder.layer.7.attention.self.query.bias")
   val_191 = MatMul (layer_norm_14, val_46)
   linear_43 = Add (val_191, "text.transformer.encoder.layer.7.attention.self.key.bias")
   val_192 = MatMul (layer_norm_14, val_47)
   scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_42, linear_43, val_192, val_52_f_mask)
   val_193 = MatMul (scaled_dot_product_attention_7, val_48)
   linear_45 = Add (val_193, "text.transformer.encoder.layer.7.attention.output.dense.bias")
   add_854 = Add (linear_45, layer_norm_14)
   layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_854, "text.transformer.encoder.layer.7.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.7.attention.output.LayerNorm.bias")
   val_194 = MatMul (layer_norm_15, val_49)
   linear_46 = Add (val_194, "text.transformer.encoder.layer.7.intermediate.dense.bias")
   gelu_7 = Gelu <approximate: string = "none"> (linear_46)
   val_195 = MatMul (gelu_7, val_50)
   linear_47 = Add (val_195, "text.transformer.encoder.layer.7.output.dense.bias")
   add_879 = Add (linear_47, layer_norm_15)
   layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_879, "text.transformer.encoder.layer.7.output.LayerNorm.weight", "text.transformer.encoder.layer.7.output.LayerNorm.bias")
   val_196 = MatMul (layer_norm_16, val_51)
   linear_48 = Add (val_196, "text.transformer.encoder.layer.8.attention.self.query.bias")
   val_197 = MatMul (layer_norm_16, val_52)
   linear_49 = Add (val_197, "text.transformer.encoder.layer.8.attention.self.key.bias")
   val_198 = MatMul (layer_norm_16, val_53)
   scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_48, linear_49, val_198, val_52_f_mask)
   val_199 = MatMul (scaled_dot_product_attention_8, val_54)
   linear_51 = Add (val_199, "text.transformer.encoder.layer.8.attention.output.dense.bias")
   add_952 = Add (linear_51, layer_norm_16)
   layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "text.transformer.encoder.layer.8.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.8.attention.output.LayerNorm.bias")
   val_200 = MatMul (layer_norm_17, val_55)
   linear_52 = Add (val_200, "text.transformer.encoder.layer.8.intermediate.dense.bias")
   gelu_8 = Gelu <approximate: string = "none"> (linear_52)
   val_201 = MatMul (gelu_8, val_56)
   linear_53 = Add (val_201, "text.transformer.encoder.layer.8.output.dense.bias")
   add_977 = Add (linear_53, layer_norm_17)
   layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_977, "text.transformer.encoder.layer.8.output.LayerNorm.weight", "text.transformer.encoder.layer.8.output.LayerNorm.bias")
   val_202 = MatMul (layer_norm_18, val_57)
   linear_54 = Add (val_202, "text.transformer.encoder.layer.9.attention.self.query.bias")
   val_203 = MatMul (layer_norm_18, val_58)
   linear_55 = Add (val_203, "text.transformer.encoder.layer.9.attention.self.key.bias")
   val_204 = MatMul (layer_norm_18, val_59)
   scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_54, linear_55, val_204, val_52_f_mask)
   val_205 = MatMul (scaled_dot_product_attention_9, val_60)
   linear_57 = Add (val_205, "text.transformer.encoder.layer.9.attention.output.dense.bias")
   add_1050 = Add (linear_57, layer_norm_18)
   layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1050, "text.transformer.encoder.layer.9.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.9.attention.output.LayerNorm.bias")
   val_206 = MatMul (layer_norm_19, val_61)
   linear_58 = Add (val_206, "text.transformer.encoder.layer.9.intermediate.dense.bias")
   gelu_9 = Gelu <approximate: string = "none"> (linear_58)
   val_207 = MatMul (gelu_9, val_62)
   linear_59 = Add (val_207, "text.transformer.encoder.layer.9.output.dense.bias")
   add_1075 = Add (linear_59, layer_norm_19)
   layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1075, "text.transformer.encoder.layer.9.output.LayerNorm.weight", "text.transformer.encoder.layer.9.output.LayerNorm.bias")
   val_208 = MatMul (layer_norm_20, val_63)
   linear_60 = Add (val_208, "text.transformer.encoder.layer.10.attention.self.query.bias")
   val_209 = MatMul (layer_norm_20, val_64)
   linear_61 = Add (val_209, "text.transformer.encoder.layer.10.attention.self.key.bias")
   val_210 = MatMul (layer_norm_20, val_65)
   scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_60, linear_61, val_210, val_52_f_mask)
   val_211 = MatMul (scaled_dot_product_attention_10, val_66)
   linear_63 = Add (val_211, "text.transformer.encoder.layer.10.attention.output.dense.bias")
   add_1148 = Add (linear_63, layer_norm_20)
   layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1148, "text.transformer.encoder.layer.10.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.10.attention.output.LayerNorm.bias")
   val_212 = MatMul (layer_norm_21, val_67)
   linear_64 = Add (val_212, "text.transformer.encoder.layer.10.intermediate.dense.bias")
   gelu_10 = Gelu <approximate: string = "none"> (linear_64)
   val_213 = MatMul (gelu_10, val_68)
   linear_65 = Add (val_213, "text.transformer.encoder.layer.10.output.dense.bias")
   add_1173 = Add (linear_65, layer_norm_21)
   layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1173, "text.transformer.encoder.layer.10.output.LayerNorm.weight", "text.transformer.encoder.layer.10.output.LayerNorm.bias")
   val_214 = MatMul (layer_norm_22, val_69)
   linear_66 = Add (val_214, "text.transformer.encoder.layer.11.attention.self.query.bias")
   val_215 = MatMul (layer_norm_22, val_70)
   linear_67 = Add (val_215, "text.transformer.encoder.layer.11.attention.self.key.bias")
   val_216 = MatMul (layer_norm_22, val_71)
   scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_66, linear_67, val_216, val_52_f_mask)
   val_217 = MatMul (scaled_dot_product_attention_11, val_72)
   linear_69 = Add (val_217, "text.transformer.encoder.layer.11.attention.output.dense.bias")
   add_1246 = Add (linear_69, layer_norm_22)
   layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1246, "text.transformer.encoder.layer.11.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.11.attention.output.LayerNorm.bias")
   val_218 = MatMul (layer_norm_23, val_73)
   linear_70 = Add (val_218, "text.transformer.encoder.layer.11.intermediate.dense.bias")
   gelu_11 = Gelu <approximate: string = "none"> (linear_70)
   val_219 = MatMul (gelu_11, val_74)
   linear_71 = Add (val_219, "text.transformer.encoder.layer.11.output.dense.bias")
   add_1271 = Add (linear_71, layer_norm_23)
   layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "text.transformer.encoder.layer.11.output.LayerNorm.weight", "text.transformer.encoder.layer.11.output.LayerNorm.bias")
   val_220 = MatMul (layer_norm_24, val_75)
   linear_72 = Add (val_220, "text.transformer.encoder.layer.12.attention.self.query.bias")
   val_221 = MatMul (layer_norm_24, val_76)
   linear_73 = Add (val_221, "text.transformer.encoder.layer.12.attention.self.key.bias")
   val_222 = MatMul (layer_norm_24, val_77)
   scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_72, linear_73, val_222, val_52_f_mask)
   val_223 = MatMul (scaled_dot_product_attention_12, val_78)
   linear_75 = Add (val_223, "text.transformer.encoder.layer.12.attention.output.dense.bias")
   add_1344 = Add (linear_75, layer_norm_24)
   layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1344, "text.transformer.encoder.layer.12.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.12.attention.output.LayerNorm.bias")
   val_224 = MatMul (layer_norm_25, val_79)
   linear_76 = Add (val_224, "text.transformer.encoder.layer.12.intermediate.dense.bias")
   gelu_12 = Gelu <approximate: string = "none"> (linear_76)
   val_225 = MatMul (gelu_12, val_80)
   linear_77 = Add (val_225, "text.transformer.encoder.layer.12.output.dense.bias")
   add_1369 = Add (linear_77, layer_norm_25)
   layer_norm_26 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1369, "text.transformer.encoder.layer.12.output.LayerNorm.weight", "text.transformer.encoder.layer.12.output.LayerNorm.bias")
   val_226 = MatMul (layer_norm_26, val_81)
   linear_78 = Add (val_226, "text.transformer.encoder.layer.13.attention.self.query.bias")
   val_227 = MatMul (layer_norm_26, val_82)
   linear_79 = Add (val_227, "text.transformer.encoder.layer.13.attention.self.key.bias")
   val_228 = MatMul (layer_norm_26, val_83)
   scaled_dot_product_attention_13 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_78, linear_79, val_228, val_52_f_mask)
   val_229 = MatMul (scaled_dot_product_attention_13, val_84)
   linear_81 = Add (val_229, "text.transformer.encoder.layer.13.attention.output.dense.bias")
   add_1442 = Add (linear_81, layer_norm_26)
   layer_norm_27 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1442, "text.transformer.encoder.layer.13.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.13.attention.output.LayerNorm.bias")
   val_230 = MatMul (layer_norm_27, val_85)
   linear_82 = Add (val_230, "text.transformer.encoder.layer.13.intermediate.dense.bias")
   gelu_13 = Gelu <approximate: string = "none"> (linear_82)
   val_231 = MatMul (gelu_13, val_86)
   linear_83 = Add (val_231, "text.transformer.encoder.layer.13.output.dense.bias")
   add_1467 = Add (linear_83, layer_norm_27)
   layer_norm_28 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1467, "text.transformer.encoder.layer.13.output.LayerNorm.weight", "text.transformer.encoder.layer.13.output.LayerNorm.bias")
   val_232 = MatMul (layer_norm_28, val_87)
   linear_84 = Add (val_232, "text.transformer.encoder.layer.14.attention.self.query.bias")
   val_233 = MatMul (layer_norm_28, val_88)
   linear_85 = Add (val_233, "text.transformer.encoder.layer.14.attention.self.key.bias")
   val_234 = MatMul (layer_norm_28, val_89)
   scaled_dot_product_attention_14 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_84, linear_85, val_234, val_52_f_mask)
   val_235 = MatMul (scaled_dot_product_attention_14, val_90)
   linear_87 = Add (val_235, "text.transformer.encoder.layer.14.attention.output.dense.bias")
   add_1540 = Add (linear_87, layer_norm_28)
   layer_norm_29 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1540, "text.transformer.encoder.layer.14.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.14.attention.output.LayerNorm.bias")
   val_236 = MatMul (layer_norm_29, val_91)
   linear_88 = Add (val_236, "text.transformer.encoder.layer.14.intermediate.dense.bias")
   gelu_14 = Gelu <approximate: string = "none"> (linear_88)
   val_237 = MatMul (gelu_14, val_92)
   linear_89 = Add (val_237, "text.transformer.encoder.layer.14.output.dense.bias")
   add_1565 = Add (linear_89, layer_norm_29)
   layer_norm_30 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1565, "text.transformer.encoder.layer.14.output.LayerNorm.weight", "text.transformer.encoder.layer.14.output.LayerNorm.bias")
   val_238 = MatMul (layer_norm_30, val_93)
   linear_90 = Add (val_238, "text.transformer.encoder.layer.15.attention.self.query.bias")
   val_239 = MatMul (layer_norm_30, val_94)
   linear_91 = Add (val_239, "text.transformer.encoder.layer.15.attention.self.key.bias")
   val_240 = MatMul (layer_norm_30, val_95)
   scaled_dot_product_attention_15 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_90, linear_91, val_240, val_52_f_mask)
   val_241 = MatMul (scaled_dot_product_attention_15, val_96)
   linear_93 = Add (val_241, "text.transformer.encoder.layer.15.attention.output.dense.bias")
   add_1638 = Add (linear_93, layer_norm_30)
   layer_norm_31 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1638, "text.transformer.encoder.layer.15.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.15.attention.output.LayerNorm.bias")
   val_242 = MatMul (layer_norm_31, val_97)
   linear_94 = Add (val_242, "text.transformer.encoder.layer.15.intermediate.dense.bias")
   gelu_15 = Gelu <approximate: string = "none"> (linear_94)
   val_243 = MatMul (gelu_15, val_98)
   linear_95 = Add (val_243, "text.transformer.encoder.layer.15.output.dense.bias")
   add_1663 = Add (linear_95, layer_norm_31)
   layer_norm_32 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1663, "text.transformer.encoder.layer.15.output.LayerNorm.weight", "text.transformer.encoder.layer.15.output.LayerNorm.bias")
   val_244 = MatMul (layer_norm_32, val_99)
   linear_96 = Add (val_244, "text.transformer.encoder.layer.16.attention.self.query.bias")
   val_245 = MatMul (layer_norm_32, val_100)
   linear_97 = Add (val_245, "text.transformer.encoder.layer.16.attention.self.key.bias")
   val_246 = MatMul (layer_norm_32, val_101)
   scaled_dot_product_attention_16 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_96, linear_97, val_246, val_52_f_mask)
   val_247 = MatMul (scaled_dot_product_attention_16, val_102)
   linear_99 = Add (val_247, "text.transformer.encoder.layer.16.attention.output.dense.bias")
   add_1736 = Add (linear_99, layer_norm_32)
   layer_norm_33 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1736, "text.transformer.encoder.layer.16.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.16.attention.output.LayerNorm.bias")
   val_248 = MatMul (layer_norm_33, val_103)
   linear_100 = Add (val_248, "text.transformer.encoder.layer.16.intermediate.dense.bias")
   gelu_16 = Gelu <approximate: string = "none"> (linear_100)
   val_249 = MatMul (gelu_16, val_104)
   linear_101 = Add (val_249, "text.transformer.encoder.layer.16.output.dense.bias")
   add_1761 = Add (linear_101, layer_norm_33)
   layer_norm_34 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1761, "text.transformer.encoder.layer.16.output.LayerNorm.weight", "text.transformer.encoder.layer.16.output.LayerNorm.bias")
   val_250 = MatMul (layer_norm_34, val_105)
   linear_102 = Add (val_250, "text.transformer.encoder.layer.17.attention.self.query.bias")
   val_251 = MatMul (layer_norm_34, val_106)
   linear_103 = Add (val_251, "text.transformer.encoder.layer.17.attention.self.key.bias")
   val_252 = MatMul (layer_norm_34, val_107)
   scaled_dot_product_attention_17 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_102, linear_103, val_252, val_52_f_mask)
   val_253 = MatMul (scaled_dot_product_attention_17, val_108)
   linear_105 = Add (val_253, "text.transformer.encoder.layer.17.attention.output.dense.bias")
   add_1834 = Add (linear_105, layer_norm_34)
   layer_norm_35 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1834, "text.transformer.encoder.layer.17.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.17.attention.output.LayerNorm.bias")
   val_254 = MatMul (layer_norm_35, val_109)
   linear_106 = Add (val_254, "text.transformer.encoder.layer.17.intermediate.dense.bias")
   gelu_17 = Gelu <approximate: string = "none"> (linear_106)
   val_255 = MatMul (gelu_17, val_110)
   linear_107 = Add (val_255, "text.transformer.encoder.layer.17.output.dense.bias")
   add_1859 = Add (linear_107, layer_norm_35)
   layer_norm_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1859, "text.transformer.encoder.layer.17.output.LayerNorm.weight", "text.transformer.encoder.layer.17.output.LayerNorm.bias")
   val_256 = MatMul (layer_norm_36, val_111)
   linear_108 = Add (val_256, "text.transformer.encoder.layer.18.attention.self.query.bias")
   val_257 = MatMul (layer_norm_36, val_112)
   linear_109 = Add (val_257, "text.transformer.encoder.layer.18.attention.self.key.bias")
   val_258 = MatMul (layer_norm_36, val_113)
   scaled_dot_product_attention_18 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_108, linear_109, val_258, val_52_f_mask)
   val_259 = MatMul (scaled_dot_product_attention_18, val_114)
   linear_111 = Add (val_259, "text.transformer.encoder.layer.18.attention.output.dense.bias")
   add_1932 = Add (linear_111, layer_norm_36)
   layer_norm_37 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1932, "text.transformer.encoder.layer.18.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.18.attention.output.LayerNorm.bias")
   val_260 = MatMul (layer_norm_37, val_115)
   linear_112 = Add (val_260, "text.transformer.encoder.layer.18.intermediate.dense.bias")
   gelu_18 = Gelu <approximate: string = "none"> (linear_112)
   val_261 = MatMul (gelu_18, val_116)
   linear_113 = Add (val_261, "text.transformer.encoder.layer.18.output.dense.bias")
   add_1957 = Add (linear_113, layer_norm_37)
   layer_norm_38 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1957, "text.transformer.encoder.layer.18.output.LayerNorm.weight", "text.transformer.encoder.layer.18.output.LayerNorm.bias")
   val_262 = MatMul (layer_norm_38, val_117)
   linear_114 = Add (val_262, "text.transformer.encoder.layer.19.attention.self.query.bias")
   val_263 = MatMul (layer_norm_38, val_118)
   linear_115 = Add (val_263, "text.transformer.encoder.layer.19.attention.self.key.bias")
   val_264 = MatMul (layer_norm_38, val_119)
   scaled_dot_product_attention_19 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_114, linear_115, val_264, val_52_f_mask)
   val_265 = MatMul (scaled_dot_product_attention_19, val_120)
   linear_117 = Add (val_265, "text.transformer.encoder.layer.19.attention.output.dense.bias")
   add_2030 = Add (linear_117, layer_norm_38)
   layer_norm_39 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2030, "text.transformer.encoder.layer.19.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.19.attention.output.LayerNorm.bias")
   val_266 = MatMul (layer_norm_39, val_121)
   linear_118 = Add (val_266, "text.transformer.encoder.layer.19.intermediate.dense.bias")
   gelu_19 = Gelu <approximate: string = "none"> (linear_118)
   val_267 = MatMul (gelu_19, val_122)
   linear_119 = Add (val_267, "text.transformer.encoder.layer.19.output.dense.bias")
   add_2055 = Add (linear_119, layer_norm_39)
   layer_norm_40 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2055, "text.transformer.encoder.layer.19.output.LayerNorm.weight", "text.transformer.encoder.layer.19.output.LayerNorm.bias")
   val_268 = MatMul (layer_norm_40, val_123)
   linear_120 = Add (val_268, "text.transformer.encoder.layer.20.attention.self.query.bias")
   val_269 = MatMul (layer_norm_40, val_124)
   linear_121 = Add (val_269, "text.transformer.encoder.layer.20.attention.self.key.bias")
   val_270 = MatMul (layer_norm_40, val_125)
   scaled_dot_product_attention_20 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_120, linear_121, val_270, val_52_f_mask)
   val_271 = MatMul (scaled_dot_product_attention_20, val_126)
   linear_123 = Add (val_271, "text.transformer.encoder.layer.20.attention.output.dense.bias")
   add_2128 = Add (linear_123, layer_norm_40)
   layer_norm_41 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2128, "text.transformer.encoder.layer.20.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.20.attention.output.LayerNorm.bias")
   val_272 = MatMul (layer_norm_41, val_127)
   linear_124 = Add (val_272, "text.transformer.encoder.layer.20.intermediate.dense.bias")
   gelu_20 = Gelu <approximate: string = "none"> (linear_124)
   val_273 = MatMul (gelu_20, val_128)
   linear_125 = Add (val_273, "text.transformer.encoder.layer.20.output.dense.bias")
   add_2153 = Add (linear_125, layer_norm_41)
   layer_norm_42 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2153, "text.transformer.encoder.layer.20.output.LayerNorm.weight", "text.transformer.encoder.layer.20.output.LayerNorm.bias")
   val_274 = MatMul (layer_norm_42, val_129)
   linear_126 = Add (val_274, "text.transformer.encoder.layer.21.attention.self.query.bias")
   val_275 = MatMul (layer_norm_42, val_130)
   linear_127 = Add (val_275, "text.transformer.encoder.layer.21.attention.self.key.bias")
   val_276 = MatMul (layer_norm_42, val_131)
   scaled_dot_product_attention_21 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_126, linear_127, val_276, val_52_f_mask)
   val_277 = MatMul (scaled_dot_product_attention_21, val_132)
   linear_129 = Add (val_277, "text.transformer.encoder.layer.21.attention.output.dense.bias")
   add_2226 = Add (linear_129, layer_norm_42)
   layer_norm_43 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2226, "text.transformer.encoder.layer.21.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.21.attention.output.LayerNorm.bias")
   val_278 = MatMul (layer_norm_43, val_133)
   linear_130 = Add (val_278, "text.transformer.encoder.layer.21.intermediate.dense.bias")
   gelu_21 = Gelu <approximate: string = "none"> (linear_130)
   val_279 = MatMul (gelu_21, val_134)
   linear_131 = Add (val_279, "text.transformer.encoder.layer.21.output.dense.bias")
   add_2251 = Add (linear_131, layer_norm_43)
   layer_norm_44 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2251, "text.transformer.encoder.layer.21.output.LayerNorm.weight", "text.transformer.encoder.layer.21.output.LayerNorm.bias")
   val_280 = MatMul (layer_norm_44, val_135)
   linear_132 = Add (val_280, "text.transformer.encoder.layer.22.attention.self.query.bias")
   val_281 = MatMul (layer_norm_44, val_136)
   linear_133 = Add (val_281, "text.transformer.encoder.layer.22.attention.self.key.bias")
   val_282 = MatMul (layer_norm_44, val_137)
   scaled_dot_product_attention_22 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_132, linear_133, val_282, val_52_f_mask)
   val_283 = MatMul (scaled_dot_product_attention_22, val_138)
   linear_135 = Add (val_283, "text.transformer.encoder.layer.22.attention.output.dense.bias")
   add_2324 = Add (linear_135, layer_norm_44)
   layer_norm_45 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2324, "text.transformer.encoder.layer.22.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.22.attention.output.LayerNorm.bias")
   val_284 = MatMul (layer_norm_45, val_139)
   linear_136 = Add (val_284, "text.transformer.encoder.layer.22.intermediate.dense.bias")
   gelu_22 = Gelu <approximate: string = "none"> (linear_136)
   val_285 = MatMul (gelu_22, val_140)
   linear_137 = Add (val_285, "text.transformer.encoder.layer.22.output.dense.bias")
   add_2349 = Add (linear_137, layer_norm_45)
   layer_norm_46 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2349, "text.transformer.encoder.layer.22.output.LayerNorm.weight", "text.transformer.encoder.layer.22.output.LayerNorm.bias")
   val_286 = MatMul (layer_norm_46, val_141)
   linear_138 = Add (val_286, "text.transformer.encoder.layer.23.attention.self.query.bias")
   val_287 = MatMul (layer_norm_46, val_142)
   linear_139 = Add (val_287, "text.transformer.encoder.layer.23.attention.self.key.bias")
   val_288 = MatMul (layer_norm_46, val_143)
   scaled_dot_product_attention_23 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_138, linear_139, val_288, val_52_f_mask)
   val_289 = MatMul (scaled_dot_product_attention_23, val_144)
   linear_141 = Add (val_289, "text.transformer.encoder.layer.23.attention.output.dense.bias")
   add_2422 = Add (linear_141, layer_norm_46)
   layer_norm_47 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2422, "text.transformer.encoder.layer.23.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.23.attention.output.LayerNorm.bias")
   val_290 = MatMul (layer_norm_47, val_145)
   linear_142 = Add (val_290, "text.transformer.encoder.layer.23.intermediate.dense.bias")
   gelu_23 = Gelu <approximate: string = "none"> (linear_142)
   val_291 = MatMul (gelu_23, val_146)
   linear_143 = Add (val_291, "text.transformer.encoder.layer.23.output.dense.bias")
   add_2447 = Add (linear_143, layer_norm_47)
   layer_norm_48 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2447, "text.transformer.encoder.layer.23.output.LayerNorm.weight", "text.transformer.encoder.layer.23.output.LayerNorm.bias")
   [unsqueeze_12_f] unsqueeze_12_f = Unsqueeze (text_keep, val_0)
   mul_1225 = Mul (layer_norm_48, unsqueeze_12_f)
   sum_1 = ReduceSum <keepdims: int = 0, noop_with_empty_axes: int = 0> (mul_1225, val_2)
   [sum_2_f] sum_2_f = ReduceSum <keepdims: int = 1, noop_with_empty_axes: int = 0> (text_keep, val_0)
   [node_div] div = Div (sum_1, sum_2_f)
   linear_144 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (div, "text.proj.0.weight")
   gelu_24 = Gelu <approximate: string = "none"> (linear_144)
   linear_145 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (gelu_24, "text.proj.2.weight")
   [node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_145, val_0)
   [node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
   text_embedding = Div (linear_145, clamp_min)
}

weights:
embedding_1 FLOAT[1,1,1024] d65da9ca2569
embedding_2 FLOAT[1,77,1024] 20a4053d5f08
text.proj.0.weight FLOAT[1024,1024] 3f8b677697e7
text.proj.2.weight FLOAT[1024,1024] 33ece37c9c40
text.transformer.embeddings.LayerNorm.bias FLOAT[1024] 953de42dd309
text.transformer.embeddings.LayerNorm.weight FLOAT[1024] 24c6b3f1f982
text.transformer.embeddings.word_embeddings.weight_fp16 FLOAT16[250002,1024] eed0a493a803
text.transformer.encoder.layer.0.attention.output.LayerNorm.bias FLOAT[1024] 76b5eb50f790
text.transformer.encoder.layer.0.attention.output.LayerNorm.weight FLOAT[1024] 1d0d0bd85801
text.transformer.encoder.layer.0.attention.output.dense.bias FLOAT[1024] 0df35634ed8e
text.transformer.encoder.layer.0.attention.self.key.bias FLOAT[1024] 83c1c5af1fa4
text.transformer.encoder.layer.0.attention.self.query.bias FLOAT[1024] 3c6e71b22041
text.transformer.encoder.layer.0.intermediate.dense.bias FLOAT[4096] f60687c50051
text.transformer.encoder.layer.0.output.LayerNorm.bias FLOAT[1024] acb443d02077
text.transformer.encoder.layer.0.output.LayerNorm.weight FLOAT[1024] 7f1fe05abfc7
text.transformer.encoder.layer.0.output.dense.bias FLOAT[1024] 235bb87b68ea
text.transformer.encoder.layer.1.attention.output.LayerNorm.bias FLOAT[1024] 53133e4479ca
text.transformer.encoder.layer.1.attention.output.LayerNorm.weight FLOAT[1024] a4f7b1e5857e
text.transformer.encoder.layer.1.attention.output.dense.bias FLOAT[1024] 66485b6180bc
text.transformer.encoder.layer.1.attention.self.key.bias FLOAT[1024] 77df7109b542
text.transformer.encoder.layer.1.attention.self.query.bias FLOAT[1024] 7419c711fef0
text.transformer.encoder.layer.1.intermediate.dense.bias FLOAT[4096] cb00bef85ebb
text.transformer.encoder.layer.1.output.LayerNorm.bias FLOAT[1024] 7fde7376a2e1
text.transformer.encoder.layer.1.output.LayerNorm.weight FLOAT[1024] b7d262c27e57
text.transformer.encoder.layer.1.output.dense.bias FLOAT[1024] aaf271022bf9
text.transformer.encoder.layer.10.attention.output.LayerNorm.bias FLOAT[1024] ddbf06aab54f
text.transformer.encoder.layer.10.attention.output.LayerNorm.weight FLOAT[1024] 0d0c74ed7f1b
text.transformer.encoder.layer.10.attention.output.dense.bias FLOAT[1024] b7aabef50542
text.transformer.encoder.layer.10.attention.self.key.bias FLOAT[1024] 9ac466bb78d5
text.transformer.encoder.layer.10.attention.self.query.bias FLOAT[1024] ffa3fa27ed82
text.transformer.encoder.layer.10.intermediate.dense.bias FLOAT[4096] b70b8b489ea4
text.transformer.encoder.layer.10.output.LayerNorm.bias FLOAT[1024] 3a4411c8c4c6
text.transformer.encoder.layer.10.output.LayerNorm.weight FLOAT[1024] 297f9fefdc30
text.transformer.encoder.layer.10.output.dense.bias FLOAT[1024] ffffac268a2f
text.transformer.encoder.layer.11.attention.output.LayerNorm.bias FLOAT[1024] 4fb23b198b90
text.transformer.encoder.layer.11.attention.output.LayerNorm.weight FLOAT[1024] a1c3b0243954
text.transformer.encoder.layer.11.attention.output.dense.bias FLOAT[1024] a6051d4d9bfb
text.transformer.encoder.layer.11.attention.self.key.bias FLOAT[1024] 2bb6e00da8cd
text.transformer.encoder.layer.11.attention.self.query.bias FLOAT[1024] 3b77dab30715
text.transformer.encoder.layer.11.intermediate.dense.bias FLOAT[4096] a8b6a39bb936
text.transformer.encoder.layer.11.output.LayerNorm.bias FLOAT[1024] 6b950ffdcc57
text.transformer.encoder.layer.11.output.LayerNorm.weight FLOAT[1024] ffdb799f51b1
text.transformer.encoder.layer.11.output.dense.bias FLOAT[1024] 91188ee3a6cb
text.transformer.encoder.layer.12.attention.output.LayerNorm.bias FLOAT[1024] 0a391e1e5ca5
text.transformer.encoder.layer.12.attention.output.LayerNorm.weight FLOAT[1024] b4d54590ab6c
text.transformer.encoder.layer.12.attention.output.dense.bias FLOAT[1024] 47c039f39032
text.transformer.encoder.layer.12.attention.self.key.bias FLOAT[1024] 2f8dddd23a00
text.transformer.encoder.layer.12.attention.self.query.bias FLOAT[1024] 3a860d948733
text.transformer.encoder.layer.12.intermediate.dense.bias FLOAT[4096] c964deccc39d
text.transformer.encoder.layer.12.output.LayerNorm.bias FLOAT[1024] 3c019685cf2e
text.transformer.encoder.layer.12.output.LayerNorm.weight FLOAT[1024] 4f302b162b9e
text.transformer.encoder.layer.12.output.dense.bias FLOAT[1024] 7738555b73db
text.transformer.encoder.layer.13.attention.output.LayerNorm.bias FLOAT[1024] 82da70b81500
text.transformer.encoder.layer.13.attention.output.LayerNorm.weight FLOAT[1024] 33072126e42c
text.transformer.encoder.layer.13.attention.output.dense.bias FLOAT[1024] 17f1d7884530
text.transformer.encoder.layer.13.attention.self.key.bias FLOAT[1024] 7fdfb4e9f8fe
text.transformer.encoder.layer.13.attention.self.query.bias FLOAT[1024] 52ec1650c746
text.transformer.encoder.layer.13.intermediate.dense.bias FLOAT[4096] 1a6b981457f8
text.transformer.encoder.layer.13.output.LayerNorm.bias FLOAT[1024] 591dd81971de
text.transformer.encoder.layer.13.output.LayerNorm.weight FLOAT[1024] e3355b4a423a
text.transformer.encoder.layer.13.output.dense.bias FLOAT[1024] 252514713e36
text.transformer.encoder.layer.14.attention.output.LayerNorm.bias FLOAT[1024] b5bace38d678
text.transformer.encoder.layer.14.attention.output.LayerNorm.weight FLOAT[1024] eec968cad947
text.transformer.encoder.layer.14.attention.output.dense.bias FLOAT[1024] 051555e0ed64
text.transformer.encoder.layer.14.attention.self.key.bias FLOAT[1024] f3145f45ad2a
text.transformer.encoder.layer.14.attention.self.query.bias FLOAT[1024] c6b8a0509048
text.transformer.encoder.layer.14.intermediate.dense.bias FLOAT[4096] a34ce7fbf1d2
text.transformer.encoder.layer.14.output.LayerNorm.bias FLOAT[1024] 1398d061343e
text.transformer.encoder.layer.14.output.LayerNorm.weight FLOAT[1024] e16b4894dc6b
text.transformer.encoder.layer.14.output.dense.bias FLOAT[1024] a966d26ee3c2
text.transformer.encoder.layer.15.attention.output.LayerNorm.bias FLOAT[1024] de211dbfff71
text.transformer.encoder.layer.15.attention.output.LayerNorm.weight FLOAT[1024] 70e11e36994b
text.transformer.encoder.layer.15.attention.output.dense.bias FLOAT[1024] 24cc9cee5eb2
text.transformer.encoder.layer.15.attention.self.key.bias FLOAT[1024] 9d3bff6fa676
text.transformer.encoder.layer.15.attention.self.query.bias FLOAT[1024] 17023b854f3a
text.transformer.encoder.layer.15.intermediate.dense.bias FLOAT[4096] 2be26f36ce1e
text.transformer.encoder.layer.15.output.LayerNorm.bias FLOAT[1024] 8cd7b0b18bd5
text.transformer.encoder.layer.15.output.LayerNorm.weight FLOAT[1024] d39aa08ba919
text.transformer.encoder.layer.15.output.dense.bias FLOAT[1024] ee7af37c8455
text.transformer.encoder.layer.16.attention.output.LayerNorm.bias FLOAT[1024] de8d136e43cb
text.transformer.encoder.layer.16.attention.output.LayerNorm.weight FLOAT[1024] 3a8d66dcd86f
text.transformer.encoder.layer.16.attention.output.dense.bias FLOAT[1024] 626a22b55251
text.transformer.encoder.layer.16.attention.self.key.bias FLOAT[1024] e9bd18700fef
text.transformer.encoder.layer.16.attention.self.query.bias FLOAT[1024] d10a4cfb6d95
text.transformer.encoder.layer.16.intermediate.dense.bias FLOAT[4096] 5a72c3e05e59
text.transformer.encoder.layer.16.output.LayerNorm.bias FLOAT[1024] 9b6866b7e00f
text.transformer.encoder.layer.16.output.LayerNorm.weight FLOAT[1024] 4d2f55688e0a
text.transformer.encoder.layer.16.output.dense.bias FLOAT[1024] 937f5cbe68ce
text.transformer.encoder.layer.17.attention.output.LayerNorm.bias FLOAT[1024] eec0ac6a53c4
text.transformer.encoder.layer.17.attention.output.LayerNorm.weight FLOAT[1024] 365bcae42561
text.transformer.encoder.layer.17.attention.output.dense.bias FLOAT[1024] ba5bab9383fa
text.transformer.encoder.layer.17.attention.self.key.bias FLOAT[1024] db3de0f735b2
text.transformer.encoder.layer.17.attention.self.query.bias FLOAT[1024] c0f0fb9f2e7a
text.transformer.encoder.layer.17.intermediate.dense.bias FLOAT[4096] 898d3a041479
text.transformer.encoder.layer.17.output.LayerNorm.bias FLOAT[1024] 8aa0bd2e817f
text.transformer.encoder.layer.17.output.LayerNorm.weight FLOAT[1024] 4ed1fca3546a
text.transformer.encoder.layer.17.output.dense.bias FLOAT[1024] f5d36301c72e
text.transformer.encoder.layer.18.attention.output.LayerNorm.bias FLOAT[1024] 1ab051e8b273
text.transformer.encoder.layer.18.attention.output.LayerNorm.weight FLOAT[1024] f6cdb290ff39
text.transformer.encoder.layer.18.attention.output.dense.bias FLOAT[1024] 2ece19a5b393
text.transformer.encoder.layer.18.attention.self.key.bias FLOAT[1024] c1085ced0d54
text.transformer.encoder.layer.18.attention.self.query.bias FLOAT[1024] beecf4b19c1c
text.transformer.encoder.layer.18.intermediate.dense.bias FLOAT[4096] c1238a7ab6ba
text.transformer.encoder.layer.18.output.LayerNorm.bias FLOAT[1024] 36487bf2bebf
text.transformer.encoder.layer.18.output.LayerNorm.weight FLOAT[1024] 6f9ac1f650ef
text.transformer.encoder.layer.18.output.dense.bias FLOAT[1024] e2e7526dea2a
text.transformer.encoder.layer.19.attention.output.LayerNorm.bias FLOAT[1024] 601026adb127
text.transformer.encoder.layer.19.attention.output.LayerNorm.weight FLOAT[1024] 556b910c8f08
text.transformer.encoder.layer.19.attention.output.dense.bias FLOAT[1024] 99693ab23ef8
text.transformer.encoder.layer.19.attention.self.key.bias FLOAT[1024] bfd946652a5b
text.transformer.encoder.layer.19.attention.self.query.bias FLOAT[1024] 0b5739a42809
text.transformer.encoder.layer.19.intermediate.dense.bias FLOAT[4096] c6655aa57950
text.transformer.encoder.layer.19.output.LayerNorm.bias FLOAT[1024] e2e327abfd95
text.transformer.encoder.layer.19.output.LayerNorm.weight FLOAT[1024] 221ccefad2a7
text.transformer.encoder.layer.19.output.dense.bias FLOAT[1024] b812df4684ad
text.transformer.encoder.layer.2.attention.output.LayerNorm.bias FLOAT[1024] 03aa444b0a53
text.transformer.encoder.layer.2.attention.output.LayerNorm.weight FLOAT[1024] 3b9894f10ec2
text.transformer.encoder.layer.2.attention.output.dense.bias FLOAT[1024] 139962827c95
text.transformer.encoder.layer.2.attention.self.key.bias FLOAT[1024] 47b36beb3002
text.transformer.encoder.layer.2.attention.self.query.bias FLOAT[1024] 8c0a2b9590db
text.transformer.encoder.layer.2.intermediate.dense.bias FLOAT[4096] cfee87aa34a1
text.transformer.encoder.layer.2.output.LayerNorm.bias FLOAT[1024] 14a3cab95d9f
text.transformer.encoder.layer.2.output.LayerNorm.weight FLOAT[1024] c72424f1449c
text.transformer.encoder.layer.2.output.dense.bias FLOAT[1024] c60af348b82c
text.transformer.encoder.layer.20.attention.output.LayerNorm.bias FLOAT[1024] 4f7bd855e0b7
text.transformer.encoder.layer.20.attention.output.LayerNorm.weight FLOAT[1024] 8c2bf38dda07
text.transformer.encoder.layer.20.attention.output.dense.bias FLOAT[1024] f7c09c195915
text.transformer.encoder.layer.20.attention.self.key.bias FLOAT[1024] d0e475934b0e
text.transformer.encoder.layer.20.attention.self.query.bias FLOAT[1024] 03ad9ecca687
text.transformer.encoder.layer.20.intermediate.dense.bias FLOAT[4096] 77d3de2c5251
text.transformer.encoder.layer.20.output.LayerNorm.bias FLOAT[1024] cf042799a0d4
text.transformer.encoder.layer.20.output.LayerNorm.weight FLOAT[1024] acaec86a8d56
text.transformer.encoder.layer.20.output.dense.bias FLOAT[1024] 601b0ac875d1
text.transformer.encoder.layer.21.attention.output.LayerNorm.bias FLOAT[1024] b434329ddf8e
text.transformer.encoder.layer.21.attention.output.LayerNorm.weight FLOAT[1024] fe53850ecfbc
text.transformer.encoder.layer.21.attention.output.dense.bias FLOAT[1024] a9372a3201eb
text.transformer.encoder.layer.21.attention.self.key.bias FLOAT[1024] 3d694e72ee0a
text.transformer.encoder.layer.21.attention.self.query.bias FLOAT[1024] 3fb5d9c6c50a
text.transformer.encoder.layer.21.intermediate.dense.bias FLOAT[4096] acec7feddf59
text.transformer.encoder.layer.21.output.LayerNorm.bias FLOAT[1024] 674bfac52e6e
text.transformer.encoder.layer.21.output.LayerNorm.weight FLOAT[1024] 37c602562901
text.transformer.encoder.layer.21.output.dense.bias FLOAT[1024] ffb164d6a83b
text.transformer.encoder.layer.22.attention.output.LayerNorm.bias FLOAT[1024] 45171f80bcde
text.transformer.encoder.layer.22.attention.output.LayerNorm.weight FLOAT[1024] daaa70f740b9
text.transformer.encoder.layer.22.attention.output.dense.bias FLOAT[1024] 70a6dc99da5e
text.transformer.encoder.layer.22.attention.self.key.bias FLOAT[1024] 1789d9760d7e
text.transformer.encoder.layer.22.attention.self.query.bias FLOAT[1024] 47e68acc0b55
text.transformer.encoder.layer.22.intermediate.dense.bias FLOAT[4096] 2fa44fb944ec
text.transformer.encoder.layer.22.output.LayerNorm.bias FLOAT[1024] 9c53bb516542
text.transformer.encoder.layer.22.output.LayerNorm.weight FLOAT[1024] 93e29a4b7f15
text.transformer.encoder.layer.22.output.dense.bias FLOAT[1024] 75cd9bdfbbc7
text.transformer.encoder.layer.23.attention.output.LayerNorm.bias FLOAT[1024] dc1460c195bc
text.transformer.encoder.layer.23.attention.output.LayerNorm.weight FLOAT[1024] a4b1e8a0d105
text.transformer.encoder.layer.23.attention.output.dense.bias FLOAT[1024] 4959666b0318
text.transformer.encoder.layer.23.attention.self.key.bias FLOAT[1024] af5cd9400b16
text.transformer.encoder.layer.23.attention.self.query.bias FLOAT[1024] 6b5615c52c5b
text.transformer.encoder.layer.23.intermediate.dense.bias FLOAT[4096] 3bc0fb6e5531
text.transformer.encoder.layer.23.output.LayerNorm.bias FLOAT[1024] a347c4a3503c
text.transformer.encoder.layer.23.output.LayerNorm.weight FLOAT[1024] cb71e3e50f59
text.transformer.encoder.layer.23.output.dense.bias FLOAT[1024] 1284101ffd36
text.transformer.encoder.layer.3.attention.output.LayerNorm.bias FLOAT[1024] 02f9f7bb2bd3
text.transformer.encoder.layer.3.attention.output.LayerNorm.weight FLOAT[1024] dc03329e57f0
text.transformer.encoder.layer.3.attention.output.dense.bias FLOAT[1024] df805a50228c
text.transformer.encoder.layer.3.attention.self.key.bias FLOAT[1024] 9fe0c5689dc3
text.transformer.encoder.layer.3.attention.self.query.bias FLOAT[1024] a660fb053e5d
text.transformer.encoder.layer.3.intermediate.dense.bias FLOAT[4096] 1e03e9d11a25
text.transformer.encoder.layer.3.output.LayerNorm.bias FLOAT[1024] 6168a6161307
text.transformer.encoder.layer.3.output.LayerNorm.weight FLOAT[1024] c3d045db11e8
text.transformer.encoder.layer.3.output.dense.bias FLOAT[1024] 2737044eb708
text.transformer.encoder.layer.4.attention.output.LayerNorm.bias FLOAT[1024] 279b6e7e24e0
text.transformer.encoder.layer.4.attention.output.LayerNorm.weight FLOAT[1024] f24fa5a4e74d
text.transformer.encoder.layer.4.attention.output.dense.bias FLOAT[1024] b899c5a2bcfa
text.transformer.encoder.layer.4.attention.self.key.bias FLOAT[1024] df66762b9221
text.transformer.encoder.layer.4.attention.self.query.bias FLOAT[1024] d8725f4595f7
text.transformer.encoder.layer.4.intermediate.dense.bias FLOAT[4096] 5ea6ffcc61d2
text.transformer.encoder.layer.4.output.LayerNorm.bias FLOAT[1024] 9f28834a4052
text.transformer.encoder.layer.4.output.LayerNorm.weight FLOAT[1024] 4477d40887de
text.transformer.encoder.layer.4.output.dense.bias FLOAT[1024] 42b51a1ae998
text.transformer.encoder.layer.5.attention.output.LayerNorm.bias FLOAT[1024] 0289923884bd
text.transformer.encoder.layer.5.attention.output.LayerNorm.weight FLOAT[1024] ddb6f9ae206b
text.transformer.encoder.layer.5.attention.output.dense.bias FLOAT[1024] 20d668d7e53c
text.transformer.encoder.layer.5.attention.self.key.bias FLOAT[1024] 94b075a62676
text.transformer.encoder.layer.5.attention.self.query.bias FLOAT[1024] 714ddb1e4350
text.transformer.encoder.layer.5.intermediate.dense.bias FLOAT[4096] bed6cc4472aa
text.transformer.encoder.layer.5.output.LayerNorm.bias FLOAT[1024] 459377de2dea
text.transformer.encoder.layer.5.output.LayerNorm.weight FLOAT[1024] c6f1d6231990
text.transformer.encoder.layer.5.output.dense.bias FLOAT[1024] d6db61bce8ea
text.transformer.encoder.layer.6.attention.output.LayerNorm.bias FLOAT[1024] e27dd888bbe1
text.transformer.encoder.layer.6.attention.output.LayerNorm.weight FLOAT[1024] 814570130772
text.transformer.encoder.layer.6.attention.output.dense.bias FLOAT[1024] 75df3749f628
text.transformer.encoder.layer.6.attention.self.key.bias FLOAT[1024] ef1d49129452
text.transformer.encoder.layer.6.attention.self.query.bias FLOAT[1024] 3080a5172278
text.transformer.encoder.layer.6.intermediate.dense.bias FLOAT[4096] 4a71fad2a7c4
text.transformer.encoder.layer.6.output.LayerNorm.bias FLOAT[1024] 1bf2b4d0c550
text.transformer.encoder.layer.6.output.LayerNorm.weight FLOAT[1024] edc358eea28e
text.transformer.encoder.layer.6.output.dense.bias FLOAT[1024] 31f440388c63
text.transformer.encoder.layer.7.attention.output.LayerNorm.bias FLOAT[1024] 7b66c92ae728
text.transformer.encoder.layer.7.attention.output.LayerNorm.weight FLOAT[1024] 2267ee5df96d
text.transformer.encoder.layer.7.attention.output.dense.bias FLOAT[1024] 2f90ae2695e3
text.transformer.encoder.layer.7.attention.self.key.bias FLOAT[1024] 150e76a9c07a
text.transformer.encoder.layer.7.attention.self.query.bias FLOAT[1024] 8634ec784aeb
text.transformer.encoder.layer.7.intermediate.dense.bias FLOAT[4096] 1e7262a37656
text.transformer.encoder.layer.7.output.LayerNorm.bias FLOAT[1024] 5799909b2f90
text.transformer.encoder.layer.7.output.LayerNorm.weight FLOAT[1024] 2f23a2ebaa0f
text.transformer.encoder.layer.7.output.dense.bias FLOAT[1024] 367ae69cd79c
text.transformer.encoder.layer.8.attention.output.LayerNorm.bias FLOAT[1024] 7be5732deaa2
text.transformer.encoder.layer.8.attention.output.LayerNorm.weight FLOAT[1024] be110699bb45
text.transformer.encoder.layer.8.attention.output.dense.bias FLOAT[1024] 4accebb216c9
text.transformer.encoder.layer.8.attention.self.key.bias FLOAT[1024] 512d5ec53b0e
text.transformer.encoder.layer.8.attention.self.query.bias FLOAT[1024] 5a0390010693
text.transformer.encoder.layer.8.intermediate.dense.bias FLOAT[4096] daacc52d835f
text.transformer.encoder.layer.8.output.LayerNorm.bias FLOAT[1024] ec038c795ca4
text.transformer.encoder.layer.8.output.LayerNorm.weight FLOAT[1024] 76899212336b
text.transformer.encoder.layer.8.output.dense.bias FLOAT[1024] e81eddf50988
text.transformer.encoder.layer.9.attention.output.LayerNorm.bias FLOAT[1024] 68739f8fa715
text.transformer.encoder.layer.9.attention.output.LayerNorm.weight FLOAT[1024] fc565d797177
text.transformer.encoder.layer.9.attention.output.dense.bias FLOAT[1024] 823b300597b1
text.transformer.encoder.layer.9.attention.self.key.bias FLOAT[1024] 61c8463f8c34
text.transformer.encoder.layer.9.attention.self.query.bias FLOAT[1024] 24b0eb8b0bbe
text.transformer.encoder.layer.9.intermediate.dense.bias FLOAT[4096] 5711103d4dc0
text.transformer.encoder.layer.9.output.LayerNorm.bias FLOAT[1024] ceb6cc6e137a
text.transformer.encoder.layer.9.output.LayerNorm.weight FLOAT[1024] 624c60717e0f
text.transformer.encoder.layer.9.output.dense.bias FLOAT[1024] 4737b893a703
text_one FLOAT[] e00e5eb94441
text_pad_keep FLOAT[250002] 49e563d9ce8a
text_q_axis FLOAT[77,1] 9575b2125169
text_row_axes INT64[2] 0c730b69905c
text_scale FLOAT[] e401200e5808
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[1024,1024] eaa08127e8da
val_100 FLOAT[1024,1024] 89c58b2d45b3
val_101 FLOAT[1024,1024] 23997d6186bb
val_102 FLOAT[1024,1024] 2a4dd5663cca
val_103 FLOAT[1024,4096] cc58c283e895
val_104 FLOAT[4096,1024] 4e72135700d1
val_105 FLOAT[1024,1024] 839138f2d478
val_106 FLOAT[1024,1024] d3c2f338708b
val_107 FLOAT[1024,1024] bfaece6b0cd3
val_108 FLOAT[1024,1024] a847d60beb9f
val_109 FLOAT[1024,4096] 0e642044a8a3
val_11 FLOAT[1024,1024] acd858236b11
val_110 FLOAT[4096,1024] d14103439146
val_111 FLOAT[1024,1024] 353ac0f557cd
val_112 FLOAT[1024,1024] 435790df1177
val_113 FLOAT[1024,1024] b147e689d0d1
val_114 FLOAT[1024,1024] 950bf04e2ebb
val_115 FLOAT[1024,4096] c4b2c0e00e0f
val_116 FLOAT[4096,1024] 7a49c81801b4
val_117 FLOAT[1024,1024] ed0904545067
val_118 FLOAT[1024,1024] 605a3790fd32
val_119 FLOAT[1024,1024] 03e059f388a1
val_12 FLOAT[1024,1024] b9973631f3f7
val_120 FLOAT[1024,1024] dcf11a5d7523
val_121 FLOAT[1024,4096] a17827300dac
val_122 FLOAT[4096,1024] 268f95a91ea0
val_123 FLOAT[1024,1024] 62f24dec211e
val_124 FLOAT[1024,1024] 5b06099ef479
val_125 FLOAT[1024,1024] 0850147fcada
val_126 FLOAT[1024,1024] 01693b9ca921
val_127 FLOAT[1024,4096] 3bea178e11eb
val_128 FLOAT[4096,1024] 8c4eb8793b9e
val_129 FLOAT[1024,1024] 236bd9599df1
val_13 FLOAT[1024,4096] 494d1133f7a2
val_130 FLOAT[1024,1024] 3a2c43c1d7a1
val_131 FLOAT[1024,1024] 9e9938a71297
val_132 FLOAT[1024,1024] e1af51a6308c
val_133 FLOAT[1024,4096] 211d6e09416c
val_134 FLOAT[4096,1024] 1cc30ddb03e0
val_135 FLOAT[1024,1024] b3d81160cb2a
val_136 FLOAT[1024,1024] 5ba89d5fdd8e
val_137 FLOAT[1024,1024] ccdb7bc0ec93
val_138 FLOAT[1024,1024] 690f789cecec
val_139 FLOAT[1024,4096] b65407b376e4
val_14 FLOAT[4096,1024] 17c65e52737f
val_140 FLOAT[4096,1024] 9b2657a0dbd3
val_141 FLOAT[1024,1024] bcb6c98d2328
val_142 FLOAT[1024,1024] b87b129a2d96
val_143 FLOAT[1024,1024] 7c2c32efae48
val_144 FLOAT[1024,1024] 94da7dddfc4a
val_145 FLOAT[1024,4096] 2b993a9dedd4
val_146 FLOAT[4096,1024] 7cbc197d27d7
val_15 FLOAT[1024,1024] 4fbd1723a68e
val_16 FLOAT[1024,1024] 726aec1eb762
val_17 FLOAT[1024,1024] d6b6ea2ee31e
val_18 FLOAT[1024,1024] 1f9de7a2df44
val_19 FLOAT[1024,4096] f0215bf70303
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[4096,1024] 18811635dae4
val_21 FLOAT[1024,1024] b765c1615d9d
val_22 FLOAT[1024,1024] af86f2e8abda
val_23 FLOAT[1024,1024] 5046683fa18d
val_24 FLOAT[1024,1024] 9d7a9054c51a
val_25 FLOAT[1024,4096] 52eff63f81b7
val_26 FLOAT[4096,1024] 8dc8e33534fd
val_27 FLOAT[1024,1024] d3a3fbd738bb
val_28 FLOAT[1024,1024] 33a909429c11
val_29 FLOAT[1024,1024] 52bf85c342e8
val_3 FLOAT[1024,1024] c6ce680cf3d7
val_30 FLOAT[1024,1024] 6b1903a80a28
val_31 FLOAT[1024,4096] 75804daac2d9
val_32 FLOAT[4096,1024] 117ded09f469
val_33 FLOAT[1024,1024] 3bac0122c2e8
val_34 FLOAT[1024,1024] 4b22d720d397
val_35 FLOAT[1024,1024] 9919c8920cc5
val_36 FLOAT[1024,1024] e3413113554c
val_37 FLOAT[1024,4096] b40140392b63
val_38 FLOAT[4096,1024] f2274a9530bb
val_39 FLOAT[1024,1024] daea59e632cc
val_4 FLOAT[1024,1024] 3dc99796c00d
val_40 FLOAT[1024,1024] f19cdddbbc3f
val_41 FLOAT[1024,1024] 305a2566d17c
val_42 FLOAT[1024,1024] ab5914131ff6
val_43 FLOAT[1024,4096] b89a120d5a8a
val_44 FLOAT[4096,1024] c70cef70c3a8
val_45 FLOAT[1024,1024] 45b55949a1f5
val_46 FLOAT[1024,1024] d40f0c02acdb
val_47 FLOAT[1024,1024] db5d0b98d0f4
val_48 FLOAT[1024,1024] 0e15575bf6a5
val_49 FLOAT[1024,4096] dad92320c4da
val_5 FLOAT[1024,1024] 39f7b507a883
val_50 FLOAT[4096,1024] 4fcccff87144
val_51 FLOAT[1024,1024] 535608b2b893
val_52 FLOAT[1024,1024] db607f313d2f
val_53 FLOAT[1024,1024] 5590c74930c4
val_54 FLOAT[1024,1024] 6d9bb21b4885
val_55 FLOAT[1024,4096] 3d6aa6e28c69
val_56 FLOAT[4096,1024] 97b875ecef64
val_57 FLOAT[1024,1024] 4019d26466ec
val_58 FLOAT[1024,1024] 73fc019c7072
val_59 FLOAT[1024,1024] 6fe30546583d
val_6 FLOAT[1024,1024] a08664cd0cbf
val_60 FLOAT[1024,1024] 9d4a78aff35e
val_61 FLOAT[1024,4096] ed7cdfe32979
val_62 FLOAT[4096,1024] f920dd90fd34
val_63 FLOAT[1024,1024] d240aef7bcb7
val_64 FLOAT[1024,1024] 1f44e3b914be
val_65 FLOAT[1024,1024] bf3c56dd4fd1
val_66 FLOAT[1024,1024] 3db620b7a2d0
val_67 FLOAT[1024,4096] e75ebe6a1f42
val_68 FLOAT[4096,1024] 0b8092dee805
val_69 FLOAT[1024,1024] 1f18be0bf72c
val_7 FLOAT[1024,4096] e74724317d03
val_70 FLOAT[1024,1024] a6d7e468ead9
val_71 FLOAT[1024,1024] ae4300a3f488
val_72 FLOAT[1024,1024] 3fb82ad2dbd5
val_73 FLOAT[1024,4096] eb0c520f5253
val_74 FLOAT[4096,1024] 318879b0cb45
val_75 FLOAT[1024,1024] b3283caa2132
val_76 FLOAT[1024,1024] 30500f0ff02a
val_77 FLOAT[1024,1024] 1b2982459dfd
val_78 FLOAT[1024,1024] 03c251ccc05d
val_79 FLOAT[1024,4096] 9f15ba884c87
val_8 FLOAT[4096,1024] 0385e13495df
val_80 FLOAT[4096,1024] 33011c2b7c59
val_81 FLOAT[1024,1024] c351e64cf423
val_82 FLOAT[1024,1024] 7b29e8b392a2
val_83 FLOAT[1024,1024] 86093f6f2e0d
val_84 FLOAT[1024,1024] a4bdc8df10a6
val_85 FLOAT[1024,4096] 1e5b2de97bef
val_86 FLOAT[4096,1024] 5918a31302ff
val_87 FLOAT[1024,1024] 0358446c099a
val_88 FLOAT[1024,1024] ba3aa2341e2b
val_89 FLOAT[1024,1024] e2c55e75ce3e
val_9 FLOAT[1024,1024] 1feedfb85069
val_90 FLOAT[1024,1024] 07e7e097eb2d
val_91 FLOAT[1024,4096] f4c15d617dfd
val_92 FLOAT[4096,1024] 6e81a15f9225
val_93 FLOAT[1024,1024] c431fb50ebb1
val_94 FLOAT[1024,1024] 7e841adc3ce5
val_95 FLOAT[1024,1024] 4c51806b550b
val_96 FLOAT[1024,1024] a8fa30c07338
val_97 FLOAT[1024,4096] d9d1854d2fd4
val_98 FLOAT[4096,1024] aaafc2731aa4
val_99 FLOAT[1024,1024] ac5c5e28f8e2
