<
   ir_version: 10,
   opset_import: ["" : 23],
   producer_name: "pytorch"
>
main_graph (int32[batch,77] input_ids, int32[batch,77] attention_mask) => (float[batch,768] text_embedding) 
   <
      float[batch,77,1024] add_1044
      float[batch,77,1024] add_1069
      float[batch,77,1024] add_1142
      float[batch,77,1024] add_1167
      float[batch,77,1024] add_1240
      float[batch,77,1024] add_1265
      float[batch,77,1024] add_1338
      float[batch,77,1024] add_1363
      float[batch,77,1024] add_1436
      float[batch,77,1024] add_1461
      float[batch,77,1024] add_1534
      float[batch,77,1024] add_1559
      float[batch,77,1024] add_162
      float[batch,77,1024] add_1632
      float[batch,77,1024] add_1657
      float[batch,77,1024] add_1730
      float[batch,77,1024] add_1755
      float[batch,77,1024] add_1828
      float[batch,77,1024] add_1853
      float[batch,77,1024] add_187
      float[batch,77,1024] add_1926
      float[batch,77,1024] add_1951
      float[batch,77,1024] add_2024
      float[batch,77,1024] add_2049
      float[batch,77,1024] add_2122
      float[batch,77,1024] add_2147
      float[batch,77,1024] add_2220
      float[batch,77,1024] add_2245
      float[batch,77,1024] add_2318
      float[batch,77,1024] add_2343
      float[batch,77,1024] add_2416
      float[batch,77,1024] add_2441
      float[batch,77,1024] add_260
      float[batch,77,1024] add_285
      float[batch,77,1024] add_358
      float[batch,77,1024] add_383
      float[batch,77,1024] add_40
      float[batch,77,1024] add_456
      float[batch,77,1024] add_481
      float[batch,77,1024] add_49
      float[batch,77,1024] add_554
      float[batch,77,1024] add_579
      float[batch,77,1024] add_652
      float[batch,77,1024] add_677
      float[batch,77,1024] add_750
      float[batch,77,1024] add_775
      float[batch,77,1024] add_848
      float[batch,77,1024] add_873
      float[batch,77,1024] add_946
      float[batch,77,1024] add_971
      float[batch,1,77,77] bitwise_and_1
      float[batch,1] clamp_min
      float[batch,77,1] convert_element_type_default_1
      float[batch,1] convert_element_type_default_3
      float[batch,1024] div
      float[batch,77,1024] embedding
      float[batch,77,4096] gelu
      float[batch,77,4096] gelu_1
      float[batch,77,4096] gelu_10
      float[batch,77,4096] gelu_11
      float[batch,77,4096] gelu_12
      float[batch,77,4096] gelu_13
      float[batch,77,4096] gelu_14
      float[batch,77,4096] gelu_15
      float[batch,77,4096] gelu_16
      float[batch,77,4096] gelu_17
      float[batch,77,4096] gelu_18
      float[batch,77,4096] gelu_19
      float[batch,77,4096] gelu_2
      float[batch,77,4096] gelu_20
      float[batch,77,4096] gelu_21
      float[batch,77,4096] gelu_22
      float[batch,77,4096] gelu_23
      float[batch,77,4096] gelu_3
      float[batch,77,4096] gelu_4
      float[batch,77,4096] gelu_5
      float[batch,77,4096] gelu_6
      float[batch,77,4096] gelu_7
      float[batch,77,4096] gelu_8
      float[batch,77,4096] gelu_9
      float[batch,77,1024] layer_norm
      float[batch,77,1024] layer_norm_1
      float[batch,77,1024] layer_norm_10
      float[batch,77,1024] layer_norm_11
      float[batch,77,1024] layer_norm_12
      float[batch,77,1024] layer_norm_13
      float[batch,77,1024] layer_norm_14
      float[batch,77,1024] layer_norm_15
      float[batch,77,1024] layer_norm_16
      float[batch,77,1024] layer_norm_17
      float[batch,77,1024] layer_norm_18
      float[batch,77,1024] layer_norm_19
      float[batch,77,1024] layer_norm_2
      float[batch,77,1024] layer_norm_20
      float[batch,77,1024] layer_norm_21
      float[batch,77,1024] layer_norm_22
      float[batch,77,1024] layer_norm_23
      float[batch,77,1024] layer_norm_24
      float[batch,77,1024] layer_norm_25
      float[batch,77,1024] layer_norm_26
      float[batch,77,1024] layer_norm_27
      float[batch,77,1024] layer_norm_28
      float[batch,77,1024] layer_norm_29
      float[batch,77,1024] layer_norm_3
      float[batch,77,1024] layer_norm_30
      float[batch,77,1024] layer_norm_31
      float[batch,77,1024] layer_norm_32
      float[batch,77,1024] layer_norm_33
      float[batch,77,1024] layer_norm_34
      float[batch,77,1024] layer_norm_35
      float[batch,77,1024] layer_norm_36
      float[batch,77,1024] layer_norm_37
      float[batch,77,1024] layer_norm_38
      float[batch,77,1024] layer_norm_39
      float[batch,77,1024] layer_norm_4
      float[batch,77,1024] layer_norm_40
      float[batch,77,1024] layer_norm_41
      float[batch,77,1024] layer_norm_42
      float[batch,77,1024] layer_norm_43
      float[batch,77,1024] layer_norm_44
      float[batch,77,1024] layer_norm_45
      float[batch,77,1024] layer_norm_46
      float[batch,77,1024] layer_norm_47
      float[batch,77,1024] layer_norm_48
      float[batch,77,1024] layer_norm_5
      float[batch,77,1024] layer_norm_6
      float[batch,77,1024] layer_norm_7
      float[batch,77,1024] layer_norm_8
      float[batch,77,1024] layer_norm_9
      float[batch,1] linalg_vector_norm
      float[batch,77,1024] linear
      float[batch,77,1024] linear_1
      float[batch,77,4096] linear_10
      float[batch,77,4096] linear_100
      float[batch,77,1024] linear_101
      float[batch,77,1024] linear_102
      float[batch,77,1024] linear_103
      float[batch,77,1024] linear_105
      float[batch,77,4096] linear_106
      float[batch,77,1024] linear_107
      float[batch,77,1024] linear_108
      float[batch,77,1024] linear_109
      float[batch,77,1024] linear_11
      float[batch,77,1024] linear_111
      float[batch,77,4096] linear_112
      float[batch,77,1024] linear_113
      float[batch,77,1024] linear_114
      float[batch,77,1024] linear_115
      float[batch,77,1024] linear_117
      float[batch,77,4096] linear_118
      float[batch,77,1024] linear_119
      float[batch,77,1024] linear_12
      float[batch,77,1024] linear_120
      float[batch,77,1024] linear_121
      float[batch,77,1024] linear_123
      float[batch,77,4096] linear_124
      float[batch,77,1024] linear_125
      float[batch,77,1024] linear_126
      float[batch,77,1024] linear_127
      float[batch,77,1024] linear_129
      float[batch,77,1024] linear_13
      float[batch,77,4096] linear_130
      float[batch,77,1024] linear_131
      float[batch,77,1024] linear_132
      float[batch,77,1024] linear_133
      float[batch,77,1024] linear_135
      float[batch,77,4096] linear_136
      float[batch,77,1024] linear_137
      float[batch,77,1024] linear_138
      float[batch,77,1024] linear_139
      float[batch,77,1024] linear_141
      float[batch,77,4096] linear_142
      float[batch,77,1024] linear_143
      float[batch,768] linear_145
      float[batch,77,1024] linear_15
      float[batch,77,4096] linear_16
      float[batch,77,1024] linear_17
      float[batch,77,1024] linear_18
      float[batch,77,1024] linear_19
      float[batch,77,1024] linear_21
      float[batch,77,4096] linear_22
      float[batch,77,1024] linear_23
      float[batch,77,1024] linear_24
      float[batch,77,1024] linear_25
      float[batch,77,1024] linear_27
      float[batch,77,4096] linear_28
      float[batch,77,1024] linear_29
      float[batch,77,1024] linear_3
      float[batch,77,1024] linear_30
      float[batch,77,1024] linear_31
      float[batch,77,1024] linear_33
      float[batch,77,4096] linear_34
      float[batch,77,1024] linear_35
      float[batch,77,1024] linear_36
      float[batch,77,1024] linear_37
      float[batch,77,1024] linear_39
      float[batch,77,4096] linear_4
      float[batch,77,4096] linear_40
      float[batch,77,1024] linear_41
      float[batch,77,1024] linear_42
      float[batch,77,1024] linear_43
      float[batch,77,1024] linear_45
      float[batch,77,4096] linear_46
      float[batch,77,1024] linear_47
      float[batch,77,1024] linear_48
      float[batch,77,1024] linear_49
      float[batch,77,1024] linear_5
      float[batch,77,1024] linear_51
      float[batch,77,4096] linear_52
      float[batch,77,1024] linear_53
      float[batch,77,1024] linear_54
      float[batch,77,1024] linear_55
      float[batch,77,1024] linear_57
      float[batch,77,4096] linear_58
      float[batch,77,1024] linear_59
      float[batch,77,1024] linear_6
      float[batch,77,1024] linear_60
      float[batch,77,1024] linear_61
      float[batch,77,1024] linear_63
      float[batch,77,4096] linear_64
      float[batch,77,1024] linear_65
      float[batch,77,1024] linear_66
      float[batch,77,1024] linear_67
      float[batch,77,1024] linear_69
      float[batch,77,1024] linear_7
      float[batch,77,4096] linear_70
      float[batch,77,1024] linear_71
      float[batch,77,1024] linear_72
      float[batch,77,1024] linear_73
      float[batch,77,1024] linear_75
      float[batch,77,4096] linear_76
      float[batch,77,1024] linear_77
      float[batch,77,1024] linear_78
      float[batch,77,1024] linear_79
      float[batch,77,1024] linear_81
      float[batch,77,4096] linear_82
      float[batch,77,1024] linear_83
      float[batch,77,1024] linear_84
      float[batch,77,1024] linear_85
      float[batch,77,1024] linear_87
      float[batch,77,4096] linear_88
      float[batch,77,1024] linear_89
      float[batch,77,1024] linear_9
      float[batch,77,1024] linear_90
      float[batch,77,1024] linear_91
      float[batch,77,1024] linear_93
      float[batch,77,4096] linear_94
      float[batch,77,1024] linear_95
      float[batch,77,1024] linear_96
      float[batch,77,1024] linear_97
      float[batch,77,1024] linear_99
      float[batch,77,1024] mul_1230
      float[batch,77,1024] scaled_dot_product_attention
      float[batch,77,1024] scaled_dot_product_attention_1
      float[batch,77,1024] scaled_dot_product_attention_10
      float[batch,77,1024] scaled_dot_product_attention_11
      float[batch,77,1024] scaled_dot_product_attention_12
      float[batch,77,1024] scaled_dot_product_attention_13
      float[batch,77,1024] scaled_dot_product_attention_14
      float[batch,77,1024] scaled_dot_product_attention_15
      float[batch,77,1024] scaled_dot_product_attention_16
      float[batch,77,1024] scaled_dot_product_attention_17
      float[batch,77,1024] scaled_dot_product_attention_18
      float[batch,77,1024] scaled_dot_product_attention_19
      float[batch,77,1024] scaled_dot_product_attention_2
      float[batch,77,1024] scaled_dot_product_attention_20
      float[batch,77,1024] scaled_dot_product_attention_21
      float[batch,77,1024] scaled_dot_product_attention_22
      float[batch,77,1024] scaled_dot_product_attention_23
      float[batch,77,1024] scaled_dot_product_attention_3
      float[batch,77,1024] scaled_dot_product_attention_4
      float[batch,77,1024] scaled_dot_product_attention_5
      float[batch,77,1024] scaled_dot_product_attention_6
      float[batch,77,1024] scaled_dot_product_attention_7
      float[batch,77,1024] scaled_dot_product_attention_8
      float[batch,77,1024] scaled_dot_product_attention_9
      float[batch,1024] sum_1
      int32[batch,77,1] unsqueeze_12
      float[batch,77] val_153
      float[batch,77] val_154
      float[batch,77] val_155
      float[batch,1,1,77] val_156
      float[batch,77,1024] val_157
      float[batch,77,1024] val_158
      float[batch,77,1024] val_159
      float[batch,77,1024] val_160
      float[batch,77,4096] val_161
      float[batch,77,1024] val_162
      float[batch,77,1024] val_163
      float[batch,77,1024] val_164
      float[batch,77,1024] val_165
      float[batch,77,1024] val_166
      float[batch,77,4096] val_167
      float[batch,77,1024] val_168
      float[batch,77,1024] val_169
      float[batch,77,1024] val_170
      float[batch,77,1024] val_171
      float[batch,77,1024] val_172
      float[batch,77,4096] val_173
      float[batch,77,1024] val_174
      float[batch,77,1024] val_175
      float[batch,77,1024] val_176
      float[batch,77,1024] val_177
      float[batch,77,1024] val_178
      float[batch,77,4096] val_179
      float[batch,77,1024] val_180
      float[batch,77,1024] val_181
      float[batch,77,1024] val_182
      float[batch,77,1024] val_183
      float[batch,77,1024] val_184
      float[batch,77,4096] val_185
      float[batch,77,1024] val_186
      float[batch,77,1024] val_187
      float[batch,77,1024] val_188
      float[batch,77,1024] val_189
      float[batch,77,1024] val_190
      float[batch,77,4096] val_191
      float[batch,77,1024] val_192
      float[batch,77,1024] val_193
      float[batch,77,1024] val_194
      float[batch,77,1024] val_195
      float[batch,77,1024] val_196
      float[batch,77,4096] val_197
      float[batch,77,1024] val_198
      float[batch,77,1024] val_199
      float[batch,77,1024] val_200
      float[batch,77,1024] val_201
      float[batch,77,1024] val_202
      float[batch,77,4096] val_203
      float[batch,77,1024] val_204
      float[batch,77,1024] val_205
      float[batch,77,1024] val_206
      float[batch,77,1024] val_207
      float[batch,77,1024] val_208
      float[batch,77,4096] val_209
      float[batch,77,1024] val_210
      float[batch,77,1024] val_211
      float[batch,77,1024] val_212
      float[batch,77,1024] val_213
      float[batch,77,1024] val_214
      float[batch,77,4096] val_215
      float[batch,77,1024] val_216
      float[batch,77,1024] val_217
      float[batch,77,1024] val_218
      float[batch,77,1024] val_219
      float[batch,77,1024] val_220
      float[batch,77,4096] val_221
      float[batch,77,1024] val_222
      float[batch,77,1024] val_223
      float[batch,77,1024] val_224
      float[batch,77,1024] val_225
      float[batch,77,1024] val_226
      float[batch,77,4096] val_227
      float[batch,77,1024] val_228
      float[batch,77,1024] val_229
      float[batch,77,1024] val_230
      float[batch,77,1024] val_231
      float[batch,77,1024] val_232
      float[batch,77,4096] val_233
      float[batch,77,1024] val_234
      float[batch,77,1024] val_235
      float[batch,77,1024] val_236
      float[batch,77,1024] val_237
      float[batch,77,1024] val_238
      float[batch,77,4096] val_239
      float[batch,77,1024] val_240
      float[batch,77,1024] val_241
      float[batch,77,1024] val_242
      float[batch,77,1024] val_243
      float[batch,77,1024] val_244
      float[batch,77,4096] val_245
      float[batch,77,1024] val_246
      float[batch,77,1024] val_247
      float[batch,77,1024] val_248
      float[batch,77,1024] val_249
      float[batch,77,1024] val_250
      float[batch,77,4096] val_251
      float[batch,77,1024] val_252
      float[batch,77,1024] val_253
      float[batch,77,1024] val_254
      float[batch,77,1024] val_255
      float[batch,77,1024] val_256
      float[batch,77,4096] val_257
      float[batch,77,1024] val_258
      float[batch,77,1024] val_259
      float[batch,77,1024] val_260
      float[batch,77,1024] val_261
      float[batch,77,1024] val_262
      float[batch,77,4096] val_263
      float[batch,77,1024] val_264
      float[batch,77,1024] val_265
      float[batch,77,1024] val_266
      float[batch,77,1024] val_267
      float[batch,77,1024] val_268
      float[batch,77,4096] val_269
      float[batch,77,1024] val_270
      float[batch,77,1024] val_271
      float[batch,77,1024] val_272
      float[batch,77,1024] val_273
      float[batch,77,1024] val_274
      float[batch,77,4096] val_275
      float[batch,77,1024] val_276
      float[batch,77,1024] val_277
      float[batch,77,1024] val_278
      float[batch,77,1024] val_279
      float[batch,77,1024] val_280
      float[batch,77,4096] val_281
      float[batch,77,1024] val_282
      float[batch,77,1024] val_283
      float[batch,77,1024] val_284
      float[batch,77,1024] val_285
      float[batch,77,1024] val_286
      float[batch,77,4096] val_287
      float[batch,77,1024] val_288
      float[batch,77,1024] val_289
      float[batch,77,1024] val_290
      float[batch,77,1024] val_291
      float[batch,77,1024] val_292
      float[batch,77,4096] val_293
      float[batch,77,1024] val_294
      float[batch,77,1024] val_295
      float[batch,77,1024] val_296
      float[batch,77,1024] val_297
      float[batch,77,1024] val_298
      float[batch,77,4096] val_299
      float[batch,77,1024] val_300
      float[batch,77] val_301
      float[batch] val_302
   >
{
   val_152 = Gather <axis: int = 0> ("transformer.embeddings.word_embeddings.weight_fp16", input_ids)
   embedding = Cast <to: int = 1> (val_152)
   add_40 = Add (embedding, embedding_1)
   add_49 = Add (add_40, embedding_2)
   [node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_49, "transformer.embeddings.LayerNorm.weight", "transformer.embeddings.LayerNorm.bias")
   val_153 = Cast <to: int = 1> (attention_mask)
   val_154 = Sub (val_153, val_4)
   val_155 = Mul (val_154, val_5)
   val_156 = Unsqueeze (val_155, val_6)
   bitwise_and_1 = Add (val_156, val_7)
   val_157 = MatMul (layer_norm, val_8)
   [node_linear] linear = Add (val_157, "transformer.encoder.layer.0.attention.self.query.bias")
   val_158 = MatMul (layer_norm, val_9)
   linear_1 = Add (val_158, "transformer.encoder.layer.0.attention.self.key.bias")
   val_159 = MatMul (layer_norm, val_10)
   [node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear, linear_1, val_159, bitwise_and_1)
   val_160 = MatMul (scaled_dot_product_attention, val_11)
   linear_3 = Add (val_160, "transformer.encoder.layer.0.attention.output.dense.bias")
   add_162 = Add (linear_3, layer_norm)
   layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_162, "transformer.encoder.layer.0.attention.output.LayerNorm.weight", "transformer.encoder.layer.0.attention.output.LayerNorm.bias")
   val_161 = MatMul (layer_norm_1, val_12)
   linear_4 = Add (val_161, "transformer.encoder.layer.0.intermediate.dense.bias")
   [node_gelu] gelu = Gelu <approximate: string = "none"> (linear_4)
   val_162 = MatMul (gelu, val_13)
   linear_5 = Add (val_162, "transformer.encoder.layer.0.output.dense.bias")
   add_187 = Add (linear_5, layer_norm_1)
   layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_187, "transformer.encoder.layer.0.output.LayerNorm.weight", "transformer.encoder.layer.0.output.LayerNorm.bias")
   val_163 = MatMul (layer_norm_2, val_14)
   linear_6 = Add (val_163, "transformer.encoder.layer.1.attention.self.query.bias")
   val_164 = MatMul (layer_norm_2, val_15)
   linear_7 = Add (val_164, "transformer.encoder.layer.1.attention.self.key.bias")
   val_165 = MatMul (layer_norm_2, val_16)
   scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_6, linear_7, val_165, bitwise_and_1)
   val_166 = MatMul (scaled_dot_product_attention_1, val_17)
   linear_9 = Add (val_166, "transformer.encoder.layer.1.attention.output.dense.bias")
   add_260 = Add (linear_9, layer_norm_2)
   layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_260, "transformer.encoder.layer.1.attention.output.LayerNorm.weight", "transformer.encoder.layer.1.attention.output.LayerNorm.bias")
   val_167 = MatMul (layer_norm_3, val_18)
   linear_10 = Add (val_167, "transformer.encoder.layer.1.intermediate.dense.bias")
   gelu_1 = Gelu <approximate: string = "none"> (linear_10)
   val_168 = MatMul (gelu_1, val_19)
   linear_11 = Add (val_168, "transformer.encoder.layer.1.output.dense.bias")
   add_285 = Add (linear_11, layer_norm_3)
   layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_285, "transformer.encoder.layer.1.output.LayerNorm.weight", "transformer.encoder.layer.1.output.LayerNorm.bias")
   val_169 = MatMul (layer_norm_4, val_20)
   linear_12 = Add (val_169, "transformer.encoder.layer.2.attention.self.query.bias")
   val_170 = MatMul (layer_norm_4, val_21)
   linear_13 = Add (val_170, "transformer.encoder.layer.2.attention.self.key.bias")
   val_171 = MatMul (layer_norm_4, val_22)
   scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_12, linear_13, val_171, bitwise_and_1)
   val_172 = MatMul (scaled_dot_product_attention_2, val_23)
   linear_15 = Add (val_172, "transformer.encoder.layer.2.attention.output.dense.bias")
   add_358 = Add (linear_15, layer_norm_4)
   layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_358, "transformer.encoder.layer.2.attention.output.LayerNorm.weight", "transformer.encoder.layer.2.attention.output.LayerNorm.bias")
   val_173 = MatMul (layer_norm_5, val_24)
   linear_16 = Add (val_173, "transformer.encoder.layer.2.intermediate.dense.bias")
   gelu_2 = Gelu <approximate: string = "none"> (linear_16)
   val_174 = MatMul (gelu_2, val_25)
   linear_17 = Add (val_174, "transformer.encoder.layer.2.output.dense.bias")
   add_383 = Add (linear_17, layer_norm_5)
   layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_383, "transformer.encoder.layer.2.output.LayerNorm.weight", "transformer.encoder.layer.2.output.LayerNorm.bias")
   val_175 = MatMul (layer_norm_6, val_26)
   linear_18 = Add (val_175, "transformer.encoder.layer.3.attention.self.query.bias")
   val_176 = MatMul (layer_norm_6, val_27)
   linear_19 = Add (val_176, "transformer.encoder.layer.3.attention.self.key.bias")
   val_177 = MatMul (layer_norm_6, val_28)
   scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_18, linear_19, val_177, bitwise_and_1)
   val_178 = MatMul (scaled_dot_product_attention_3, val_29)
   linear_21 = Add (val_178, "transformer.encoder.layer.3.attention.output.dense.bias")
   add_456 = Add (linear_21, layer_norm_6)
   layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_456, "transformer.encoder.layer.3.attention.output.LayerNorm.weight", "transformer.encoder.layer.3.attention.output.LayerNorm.bias")
   val_179 = MatMul (layer_norm_7, val_30)
   linear_22 = Add (val_179, "transformer.encoder.layer.3.intermediate.dense.bias")
   gelu_3 = Gelu <approximate: string = "none"> (linear_22)
   val_180 = MatMul (gelu_3, val_31)
   linear_23 = Add (val_180, "transformer.encoder.layer.3.output.dense.bias")
   add_481 = Add (linear_23, layer_norm_7)
   layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_481, "transformer.encoder.layer.3.output.LayerNorm.weight", "transformer.encoder.layer.3.output.LayerNorm.bias")
   val_181 = MatMul (layer_norm_8, val_32)
   linear_24 = Add (val_181, "transformer.encoder.layer.4.attention.self.query.bias")
   val_182 = MatMul (layer_norm_8, val_33)
   linear_25 = Add (val_182, "transformer.encoder.layer.4.attention.self.key.bias")
   val_183 = MatMul (layer_norm_8, val_34)
   scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_24, linear_25, val_183, bitwise_and_1)
   val_184 = MatMul (scaled_dot_product_attention_4, val_35)
   linear_27 = Add (val_184, "transformer.encoder.layer.4.attention.output.dense.bias")
   add_554 = Add (linear_27, layer_norm_8)
   layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_554, "transformer.encoder.layer.4.attention.output.LayerNorm.weight", "transformer.encoder.layer.4.attention.output.LayerNorm.bias")
   val_185 = MatMul (layer_norm_9, val_36)
   linear_28 = Add (val_185, "transformer.encoder.layer.4.intermediate.dense.bias")
   gelu_4 = Gelu <approximate: string = "none"> (linear_28)
   val_186 = MatMul (gelu_4, val_37)
   linear_29 = Add (val_186, "transformer.encoder.layer.4.output.dense.bias")
   add_579 = Add (linear_29, layer_norm_9)
   layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_579, "transformer.encoder.layer.4.output.LayerNorm.weight", "transformer.encoder.layer.4.output.LayerNorm.bias")
   val_187 = MatMul (layer_norm_10, val_38)
   linear_30 = Add (val_187, "transformer.encoder.layer.5.attention.self.query.bias")
   val_188 = MatMul (layer_norm_10, val_39)
   linear_31 = Add (val_188, "transformer.encoder.layer.5.attention.self.key.bias")
   val_189 = MatMul (layer_norm_10, val_40)
   scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_30, linear_31, val_189, bitwise_and_1)
   val_190 = MatMul (scaled_dot_product_attention_5, val_41)
   linear_33 = Add (val_190, "transformer.encoder.layer.5.attention.output.dense.bias")
   add_652 = Add (linear_33, layer_norm_10)
   layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_652, "transformer.encoder.layer.5.attention.output.LayerNorm.weight", "transformer.encoder.layer.5.attention.output.LayerNorm.bias")
   val_191 = MatMul (layer_norm_11, val_42)
   linear_34 = Add (val_191, "transformer.encoder.layer.5.intermediate.dense.bias")
   gelu_5 = Gelu <approximate: string = "none"> (linear_34)
   val_192 = MatMul (gelu_5, val_43)
   linear_35 = Add (val_192, "transformer.encoder.layer.5.output.dense.bias")
   add_677 = Add (linear_35, layer_norm_11)
   layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_677, "transformer.encoder.layer.5.output.LayerNorm.weight", "transformer.encoder.layer.5.output.LayerNorm.bias")
   val_193 = MatMul (layer_norm_12, val_44)
   linear_36 = Add (val_193, "transformer.encoder.layer.6.attention.self.query.bias")
   val_194 = MatMul (layer_norm_12, val_45)
   linear_37 = Add (val_194, "transformer.encoder.layer.6.attention.self.key.bias")
   val_195 = MatMul (layer_norm_12, val_46)
   scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_36, linear_37, val_195, bitwise_and_1)
   val_196 = MatMul (scaled_dot_product_attention_6, val_47)
   linear_39 = Add (val_196, "transformer.encoder.layer.6.attention.output.dense.bias")
   add_750 = Add (linear_39, layer_norm_12)
   layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_750, "transformer.encoder.layer.6.attention.output.LayerNorm.weight", "transformer.encoder.layer.6.attention.output.LayerNorm.bias")
   val_197 = MatMul (layer_norm_13, val_48)
   linear_40 = Add (val_197, "transformer.encoder.layer.6.intermediate.dense.bias")
   gelu_6 = Gelu <approximate: string = "none"> (linear_40)
   val_198 = MatMul (gelu_6, val_49)
   linear_41 = Add (val_198, "transformer.encoder.layer.6.output.dense.bias")
   add_775 = Add (linear_41, layer_norm_13)
   layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_775, "transformer.encoder.layer.6.output.LayerNorm.weight", "transformer.encoder.layer.6.output.LayerNorm.bias")
   val_199 = MatMul (layer_norm_14, val_50)
   linear_42 = Add (val_199, "transformer.encoder.layer.7.attention.self.query.bias")
   val_200 = MatMul (layer_norm_14, val_51)
   linear_43 = Add (val_200, "transformer.encoder.layer.7.attention.self.key.bias")
   val_201 = MatMul (layer_norm_14, val_52)
   scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_42, linear_43, val_201, bitwise_and_1)
   val_202 = MatMul (scaled_dot_product_attention_7, val_53)
   linear_45 = Add (val_202, "transformer.encoder.layer.7.attention.output.dense.bias")
   add_848 = Add (linear_45, layer_norm_14)
   layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_848, "transformer.encoder.layer.7.attention.output.LayerNorm.weight", "transformer.encoder.layer.7.attention.output.LayerNorm.bias")
   val_203 = MatMul (layer_norm_15, val_54)
   linear_46 = Add (val_203, "transformer.encoder.layer.7.intermediate.dense.bias")
   gelu_7 = Gelu <approximate: string = "none"> (linear_46)
   val_204 = MatMul (gelu_7, val_55)
   linear_47 = Add (val_204, "transformer.encoder.layer.7.output.dense.bias")
   add_873 = Add (linear_47, layer_norm_15)
   layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_873, "transformer.encoder.layer.7.output.LayerNorm.weight", "transformer.encoder.layer.7.output.LayerNorm.bias")
   val_205 = MatMul (layer_norm_16, val_56)
   linear_48 = Add (val_205, "transformer.encoder.layer.8.attention.self.query.bias")
   val_206 = MatMul (layer_norm_16, val_57)
   linear_49 = Add (val_206, "transformer.encoder.layer.8.attention.self.key.bias")
   val_207 = MatMul (layer_norm_16, val_58)
   scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_48, linear_49, val_207, bitwise_and_1)
   val_208 = MatMul (scaled_dot_product_attention_8, val_59)
   linear_51 = Add (val_208, "transformer.encoder.layer.8.attention.output.dense.bias")
   add_946 = Add (linear_51, layer_norm_16)
   layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_946, "transformer.encoder.layer.8.attention.output.LayerNorm.weight", "transformer.encoder.layer.8.attention.output.LayerNorm.bias")
   val_209 = MatMul (layer_norm_17, val_60)
   linear_52 = Add (val_209, "transformer.encoder.layer.8.intermediate.dense.bias")
   gelu_8 = Gelu <approximate: string = "none"> (linear_52)
   val_210 = MatMul (gelu_8, val_61)
   linear_53 = Add (val_210, "transformer.encoder.layer.8.output.dense.bias")
   add_971 = Add (linear_53, layer_norm_17)
   layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_971, "transformer.encoder.layer.8.output.LayerNorm.weight", "transformer.encoder.layer.8.output.LayerNorm.bias")
   val_211 = MatMul (layer_norm_18, val_62)
   linear_54 = Add (val_211, "transformer.encoder.layer.9.attention.self.query.bias")
   val_212 = MatMul (layer_norm_18, val_63)
   linear_55 = Add (val_212, "transformer.encoder.layer.9.attention.self.key.bias")
   val_213 = MatMul (layer_norm_18, val_64)
   scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_54, linear_55, val_213, bitwise_and_1)
   val_214 = MatMul (scaled_dot_product_attention_9, val_65)
   linear_57 = Add (val_214, "transformer.encoder.layer.9.attention.output.dense.bias")
   add_1044 = Add (linear_57, layer_norm_18)
   layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1044, "transformer.encoder.layer.9.attention.output.LayerNorm.weight", "transformer.encoder.layer.9.attention.output.LayerNorm.bias")
   val_215 = MatMul (layer_norm_19, val_66)
   linear_58 = Add (val_215, "transformer.encoder.layer.9.intermediate.dense.bias")
   gelu_9 = Gelu <approximate: string = "none"> (linear_58)
   val_216 = MatMul (gelu_9, val_67)
   linear_59 = Add (val_216, "transformer.encoder.layer.9.output.dense.bias")
   add_1069 = Add (linear_59, layer_norm_19)
   layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1069, "transformer.encoder.layer.9.output.LayerNorm.weight", "transformer.encoder.layer.9.output.LayerNorm.bias")
   val_217 = MatMul (layer_norm_20, val_68)
   linear_60 = Add (val_217, "transformer.encoder.layer.10.attention.self.query.bias")
   val_218 = MatMul (layer_norm_20, val_69)
   linear_61 = Add (val_218, "transformer.encoder.layer.10.attention.self.key.bias")
   val_219 = MatMul (layer_norm_20, val_70)
   scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_60, linear_61, val_219, bitwise_and_1)
   val_220 = MatMul (scaled_dot_product_attention_10, val_71)
   linear_63 = Add (val_220, "transformer.encoder.layer.10.attention.output.dense.bias")
   add_1142 = Add (linear_63, layer_norm_20)
   layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1142, "transformer.encoder.layer.10.attention.output.LayerNorm.weight", "transformer.encoder.layer.10.attention.output.LayerNorm.bias")
   val_221 = MatMul (layer_norm_21, val_72)
   linear_64 = Add (val_221, "transformer.encoder.layer.10.intermediate.dense.bias")
   gelu_10 = Gelu <approximate: string = "none"> (linear_64)
   val_222 = MatMul (gelu_10, val_73)
   linear_65 = Add (val_222, "transformer.encoder.layer.10.output.dense.bias")
   add_1167 = Add (linear_65, layer_norm_21)
   layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1167, "transformer.encoder.layer.10.output.LayerNorm.weight", "transformer.encoder.layer.10.output.LayerNorm.bias")
   val_223 = MatMul (layer_norm_22, val_74)
   linear_66 = Add (val_223, "transformer.encoder.layer.11.attention.self.query.bias")
   val_224 = MatMul (layer_norm_22, val_75)
   linear_67 = Add (val_224, "transformer.encoder.layer.11.attention.self.key.bias")
   val_225 = MatMul (layer_norm_22, val_76)
   scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_66, linear_67, val_225, bitwise_and_1)
   val_226 = MatMul (scaled_dot_product_attention_11, val_77)
   linear_69 = Add (val_226, "transformer.encoder.layer.11.attention.output.dense.bias")
   add_1240 = Add (linear_69, layer_norm_22)
   layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1240, "transformer.encoder.layer.11.attention.output.LayerNorm.weight", "transformer.encoder.layer.11.attention.output.LayerNorm.bias")
   val_227 = MatMul (layer_norm_23, val_78)
   linear_70 = Add (val_227, "transformer.encoder.layer.11.intermediate.dense.bias")
   gelu_11 = Gelu <approximate: string = "none"> (linear_70)
   val_228 = MatMul (gelu_11, val_79)
   linear_71 = Add (val_228, "transformer.encoder.layer.11.output.dense.bias")
   add_1265 = Add (linear_71, layer_norm_23)
   layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1265, "transformer.encoder.layer.11.output.LayerNorm.weight", "transformer.encoder.layer.11.output.LayerNorm.bias")
   val_229 = MatMul (layer_norm_24, val_80)
   linear_72 = Add (val_229, "transformer.encoder.layer.12.attention.self.query.bias")
   val_230 = MatMul (layer_norm_24, val_81)
   linear_73 = Add (val_230, "transformer.encoder.layer.12.attention.self.key.bias")
   val_231 = MatMul (layer_norm_24, val_82)
   scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_72, linear_73, val_231, bitwise_and_1)
   val_232 = MatMul (scaled_dot_product_attention_12, val_83)
   linear_75 = Add (val_232, "transformer.encoder.layer.12.attention.output.dense.bias")
   add_1338 = Add (linear_75, layer_norm_24)
   layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1338, "transformer.encoder.layer.12.attention.output.LayerNorm.weight", "transformer.encoder.layer.12.attention.output.LayerNorm.bias")
   val_233 = MatMul (layer_norm_25, val_84)
   linear_76 = Add (val_233, "transformer.encoder.layer.12.intermediate.dense.bias")
   gelu_12 = Gelu <approximate: string = "none"> (linear_76)
   val_234 = MatMul (gelu_12, val_85)
   linear_77 = Add (val_234, "transformer.encoder.layer.12.output.dense.bias")
   add_1363 = Add (linear_77, layer_norm_25)
   layer_norm_26 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1363, "transformer.encoder.layer.12.output.LayerNorm.weight", "transformer.encoder.layer.12.output.LayerNorm.bias")
   val_235 = MatMul (layer_norm_26, val_86)
   linear_78 = Add (val_235, "transformer.encoder.layer.13.attention.self.query.bias")
   val_236 = MatMul (layer_norm_26, val_87)
   linear_79 = Add (val_236, "transformer.encoder.layer.13.attention.self.key.bias")
   val_237 = MatMul (layer_norm_26, val_88)
   scaled_dot_product_attention_13 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_78, linear_79, val_237, bitwise_and_1)
   val_238 = MatMul (scaled_dot_product_attention_13, val_89)
   linear_81 = Add (val_238, "transformer.encoder.layer.13.attention.output.dense.bias")
   add_1436 = Add (linear_81, layer_norm_26)
   layer_norm_27 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1436, "transformer.encoder.layer.13.attention.output.LayerNorm.weight", "transformer.encoder.layer.13.attention.output.LayerNorm.bias")
   val_239 = MatMul (layer_norm_27, val_90)
   linear_82 = Add (val_239, "transformer.encoder.layer.13.intermediate.dense.bias")
   gelu_13 = Gelu <approximate: string = "none"> (linear_82)
   val_240 = MatMul (gelu_13, val_91)
   linear_83 = Add (val_240, "transformer.encoder.layer.13.output.dense.bias")
   add_1461 = Add (linear_83, layer_norm_27)
   layer_norm_28 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1461, "transformer.encoder.layer.13.output.LayerNorm.weight", "transformer.encoder.layer.13.output.LayerNorm.bias")
   val_241 = MatMul (layer_norm_28, val_92)
   linear_84 = Add (val_241, "transformer.encoder.layer.14.attention.self.query.bias")
   val_242 = MatMul (layer_norm_28, val_93)
   linear_85 = Add (val_242, "transformer.encoder.layer.14.attention.self.key.bias")
   val_243 = MatMul (layer_norm_28, val_94)
   scaled_dot_product_attention_14 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_84, linear_85, val_243, bitwise_and_1)
   val_244 = MatMul (scaled_dot_product_attention_14, val_95)
   linear_87 = Add (val_244, "transformer.encoder.layer.14.attention.output.dense.bias")
   add_1534 = Add (linear_87, layer_norm_28)
   layer_norm_29 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1534, "transformer.encoder.layer.14.attention.output.LayerNorm.weight", "transformer.encoder.layer.14.attention.output.LayerNorm.bias")
   val_245 = MatMul (layer_norm_29, val_96)
   linear_88 = Add (val_245, "transformer.encoder.layer.14.intermediate.dense.bias")
   gelu_14 = Gelu <approximate: string = "none"> (linear_88)
   val_246 = MatMul (gelu_14, val_97)
   linear_89 = Add (val_246, "transformer.encoder.layer.14.output.dense.bias")
   add_1559 = Add (linear_89, layer_norm_29)
   layer_norm_30 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.encoder.layer.14.output.LayerNorm.weight", "transformer.encoder.layer.14.output.LayerNorm.bias")
   val_247 = MatMul (layer_norm_30, val_98)
   linear_90 = Add (val_247, "transformer.encoder.layer.15.attention.self.query.bias")
   val_248 = MatMul (layer_norm_30, val_99)
   linear_91 = Add (val_248, "transformer.encoder.layer.15.attention.self.key.bias")
   val_249 = MatMul (layer_norm_30, val_100)
   scaled_dot_product_attention_15 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_90, linear_91, val_249, bitwise_and_1)
   val_250 = MatMul (scaled_dot_product_attention_15, val_101)
   linear_93 = Add (val_250, "transformer.encoder.layer.15.attention.output.dense.bias")
   add_1632 = Add (linear_93, layer_norm_30)
   layer_norm_31 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "transformer.encoder.layer.15.attention.output.LayerNorm.weight", "transformer.encoder.layer.15.attention.output.LayerNorm.bias")
   val_251 = MatMul (layer_norm_31, val_102)
   linear_94 = Add (val_251, "transformer.encoder.layer.15.intermediate.dense.bias")
   gelu_15 = Gelu <approximate: string = "none"> (linear_94)
   val_252 = MatMul (gelu_15, val_103)
   linear_95 = Add (val_252, "transformer.encoder.layer.15.output.dense.bias")
   add_1657 = Add (linear_95, layer_norm_31)
   layer_norm_32 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1657, "transformer.encoder.layer.15.output.LayerNorm.weight", "transformer.encoder.layer.15.output.LayerNorm.bias")
   val_253 = MatMul (layer_norm_32, val_104)
   linear_96 = Add (val_253, "transformer.encoder.layer.16.attention.self.query.bias")
   val_254 = MatMul (layer_norm_32, val_105)
   linear_97 = Add (val_254, "transformer.encoder.layer.16.attention.self.key.bias")
   val_255 = MatMul (layer_norm_32, val_106)
   scaled_dot_product_attention_16 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_96, linear_97, val_255, bitwise_and_1)
   val_256 = MatMul (scaled_dot_product_attention_16, val_107)
   linear_99 = Add (val_256, "transformer.encoder.layer.16.attention.output.dense.bias")
   add_1730 = Add (linear_99, layer_norm_32)
   layer_norm_33 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1730, "transformer.encoder.layer.16.attention.output.LayerNorm.weight", "transformer.encoder.layer.16.attention.output.LayerNorm.bias")
   val_257 = MatMul (layer_norm_33, val_108)
   linear_100 = Add (val_257, "transformer.encoder.layer.16.intermediate.dense.bias")
   gelu_16 = Gelu <approximate: string = "none"> (linear_100)
   val_258 = MatMul (gelu_16, val_109)
   linear_101 = Add (val_258, "transformer.encoder.layer.16.output.dense.bias")
   add_1755 = Add (linear_101, layer_norm_33)
   layer_norm_34 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1755, "transformer.encoder.layer.16.output.LayerNorm.weight", "transformer.encoder.layer.16.output.LayerNorm.bias")
   val_259 = MatMul (layer_norm_34, val_110)
   linear_102 = Add (val_259, "transformer.encoder.layer.17.attention.self.query.bias")
   val_260 = MatMul (layer_norm_34, val_111)
   linear_103 = Add (val_260, "transformer.encoder.layer.17.attention.self.key.bias")
   val_261 = MatMul (layer_norm_34, val_112)
   scaled_dot_product_attention_17 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_102, linear_103, val_261, bitwise_and_1)
   val_262 = MatMul (scaled_dot_product_attention_17, val_113)
   linear_105 = Add (val_262, "transformer.encoder.layer.17.attention.output.dense.bias")
   add_1828 = Add (linear_105, layer_norm_34)
   layer_norm_35 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1828, "transformer.encoder.layer.17.attention.output.LayerNorm.weight", "transformer.encoder.layer.17.attention.output.LayerNorm.bias")
   val_263 = MatMul (layer_norm_35, val_114)
   linear_106 = Add (val_263, "transformer.encoder.layer.17.intermediate.dense.bias")
   gelu_17 = Gelu <approximate: string = "none"> (linear_106)
   val_264 = MatMul (gelu_17, val_115)
   linear_107 = Add (val_264, "transformer.encoder.layer.17.output.dense.bias")
   add_1853 = Add (linear_107, layer_norm_35)
   layer_norm_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1853, "transformer.encoder.layer.17.output.LayerNorm.weight", "transformer.encoder.layer.17.output.LayerNorm.bias")
   val_265 = MatMul (layer_norm_36, val_116)
   linear_108 = Add (val_265, "transformer.encoder.layer.18.attention.self.query.bias")
   val_266 = MatMul (layer_norm_36, val_117)
   linear_109 = Add (val_266, "transformer.encoder.layer.18.attention.self.key.bias")
   val_267 = MatMul (layer_norm_36, val_118)
   scaled_dot_product_attention_18 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_108, linear_109, val_267, bitwise_and_1)
   val_268 = MatMul (scaled_dot_product_attention_18, val_119)
   linear_111 = Add (val_268, "transformer.encoder.layer.18.attention.output.dense.bias")
   add_1926 = Add (linear_111, layer_norm_36)
   layer_norm_37 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1926, "transformer.encoder.layer.18.attention.output.LayerNorm.weight", "transformer.encoder.layer.18.attention.output.LayerNorm.bias")
   val_269 = MatMul (layer_norm_37, val_120)
   linear_112 = Add (val_269, "transformer.encoder.layer.18.intermediate.dense.bias")
   gelu_18 = Gelu <approximate: string = "none"> (linear_112)
   val_270 = MatMul (gelu_18, val_121)
   linear_113 = Add (val_270, "transformer.encoder.layer.18.output.dense.bias")
   add_1951 = Add (linear_113, layer_norm_37)
   layer_norm_38 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1951, "transformer.encoder.layer.18.output.LayerNorm.weight", "transformer.encoder.layer.18.output.LayerNorm.bias")
   val_271 = MatMul (layer_norm_38, val_122)
   linear_114 = Add (val_271, "transformer.encoder.layer.19.attention.self.query.bias")
   val_272 = MatMul (layer_norm_38, val_123)
   linear_115 = Add (val_272, "transformer.encoder.layer.19.attention.self.key.bias")
   val_273 = MatMul (layer_norm_38, val_124)
   scaled_dot_product_attention_19 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_114, linear_115, val_273, bitwise_and_1)
   val_274 = MatMul (scaled_dot_product_attention_19, val_125)
   linear_117 = Add (val_274, "transformer.encoder.layer.19.attention.output.dense.bias")
   add_2024 = Add (linear_117, layer_norm_38)
   layer_norm_39 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2024, "transformer.encoder.layer.19.attention.output.LayerNorm.weight", "transformer.encoder.layer.19.attention.output.LayerNorm.bias")
   val_275 = MatMul (layer_norm_39, val_126)
   linear_118 = Add (val_275, "transformer.encoder.layer.19.intermediate.dense.bias")
   gelu_19 = Gelu <approximate: string = "none"> (linear_118)
   val_276 = MatMul (gelu_19, val_127)
   linear_119 = Add (val_276, "transformer.encoder.layer.19.output.dense.bias")
   add_2049 = Add (linear_119, layer_norm_39)
   layer_norm_40 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2049, "transformer.encoder.layer.19.output.LayerNorm.weight", "transformer.encoder.layer.19.output.LayerNorm.bias")
   val_277 = MatMul (layer_norm_40, val_128)
   linear_120 = Add (val_277, "transformer.encoder.layer.20.attention.self.query.bias")
   val_278 = MatMul (layer_norm_40, val_129)
   linear_121 = Add (val_278, "transformer.encoder.layer.20.attention.self.key.bias")
   val_279 = MatMul (layer_norm_40, val_130)
   scaled_dot_product_attention_20 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_120, linear_121, val_279, bitwise_and_1)
   val_280 = MatMul (scaled_dot_product_attention_20, val_131)
   linear_123 = Add (val_280, "transformer.encoder.layer.20.attention.output.dense.bias")
   add_2122 = Add (linear_123, layer_norm_40)
   layer_norm_41 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2122, "transformer.encoder.layer.20.attention.output.LayerNorm.weight", "transformer.encoder.layer.20.attention.output.LayerNorm.bias")
   val_281 = MatMul (layer_norm_41, val_132)
   linear_124 = Add (val_281, "transformer.encoder.layer.20.intermediate.dense.bias")
   gelu_20 = Gelu <approximate: string = "none"> (linear_124)
   val_282 = MatMul (gelu_20, val_133)
   linear_125 = Add (val_282, "transformer.encoder.layer.20.output.dense.bias")
   add_2147 = Add (linear_125, layer_norm_41)
   layer_norm_42 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2147, "transformer.encoder.layer.20.output.LayerNorm.weight", "transformer.encoder.layer.20.output.LayerNorm.bias")
   val_283 = MatMul (layer_norm_42, val_134)
   linear_126 = Add (val_283, "transformer.encoder.layer.21.attention.self.query.bias")
   val_284 = MatMul (layer_norm_42, val_135)
   linear_127 = Add (val_284, "transformer.encoder.layer.21.attention.self.key.bias")
   val_285 = MatMul (layer_norm_42, val_136)
   scaled_dot_product_attention_21 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_126, linear_127, val_285, bitwise_and_1)
   val_286 = MatMul (scaled_dot_product_attention_21, val_137)
   linear_129 = Add (val_286, "transformer.encoder.layer.21.attention.output.dense.bias")
   add_2220 = Add (linear_129, layer_norm_42)
   layer_norm_43 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2220, "transformer.encoder.layer.21.attention.output.LayerNorm.weight", "transformer.encoder.layer.21.attention.output.LayerNorm.bias")
   val_287 = MatMul (layer_norm_43, val_138)
   linear_130 = Add (val_287, "transformer.encoder.layer.21.intermediate.dense.bias")
   gelu_21 = Gelu <approximate: string = "none"> (linear_130)
   val_288 = MatMul (gelu_21, val_139)
   linear_131 = Add (val_288, "transformer.encoder.layer.21.output.dense.bias")
   add_2245 = Add (linear_131, layer_norm_43)
   layer_norm_44 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2245, "transformer.encoder.layer.21.output.LayerNorm.weight", "transformer.encoder.layer.21.output.LayerNorm.bias")
   val_289 = MatMul (layer_norm_44, val_140)
   linear_132 = Add (val_289, "transformer.encoder.layer.22.attention.self.query.bias")
   val_290 = MatMul (layer_norm_44, val_141)
   linear_133 = Add (val_290, "transformer.encoder.layer.22.attention.self.key.bias")
   val_291 = MatMul (layer_norm_44, val_142)
   scaled_dot_product_attention_22 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_132, linear_133, val_291, bitwise_and_1)
   val_292 = MatMul (scaled_dot_product_attention_22, val_143)
   linear_135 = Add (val_292, "transformer.encoder.layer.22.attention.output.dense.bias")
   add_2318 = Add (linear_135, layer_norm_44)
   layer_norm_45 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2318, "transformer.encoder.layer.22.attention.output.LayerNorm.weight", "transformer.encoder.layer.22.attention.output.LayerNorm.bias")
   val_293 = MatMul (layer_norm_45, val_144)
   linear_136 = Add (val_293, "transformer.encoder.layer.22.intermediate.dense.bias")
   gelu_22 = Gelu <approximate: string = "none"> (linear_136)
   val_294 = MatMul (gelu_22, val_145)
   linear_137 = Add (val_294, "transformer.encoder.layer.22.output.dense.bias")
   add_2343 = Add (linear_137, layer_norm_45)
   layer_norm_46 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2343, "transformer.encoder.layer.22.output.LayerNorm.weight", "transformer.encoder.layer.22.output.LayerNorm.bias")
   val_295 = MatMul (layer_norm_46, val_146)
   linear_138 = Add (val_295, "transformer.encoder.layer.23.attention.self.query.bias")
   val_296 = MatMul (layer_norm_46, val_147)
   linear_139 = Add (val_296, "transformer.encoder.layer.23.attention.self.key.bias")
   val_297 = MatMul (layer_norm_46, val_148)
   scaled_dot_product_attention_23 = Attention <is_causal: int = 0, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_138, linear_139, val_297, bitwise_and_1)
   val_298 = MatMul (scaled_dot_product_attention_23, val_149)
   linear_141 = Add (val_298, "transformer.encoder.layer.23.attention.output.dense.bias")
   add_2416 = Add (linear_141, layer_norm_46)
   layer_norm_47 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2416, "transformer.encoder.layer.23.attention.output.LayerNorm.weight", "transformer.encoder.layer.23.attention.output.LayerNorm.bias")
   val_299 = MatMul (layer_norm_47, val_150)
   linear_142 = Add (val_299, "transformer.encoder.layer.23.intermediate.dense.bias")
   gelu_23 = Gelu <approximate: string = "none"> (linear_142)
   val_300 = MatMul (gelu_23, val_151)
   linear_143 = Add (val_300, "transformer.encoder.layer.23.output.dense.bias")
   add_2441 = Add (linear_143, layer_norm_47)
   layer_norm_48 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_2441, "transformer.encoder.layer.23.output.LayerNorm.weight", "transformer.encoder.layer.23.output.LayerNorm.bias")
   unsqueeze_12 = Unsqueeze (attention_mask, val_3)
   convert_element_type_default_1 = Cast <to: int = 1> (unsqueeze_12)
   mul_1230 = Mul (layer_norm_48, convert_element_type_default_1)
   sum_1 = ReduceSum <keepdims: int = 0, noop_with_empty_axes: int = 0> (mul_1230, val_2)
   val_301 = Cast <to: int = 1> (attention_mask)
   val_302 = ReduceSum <keepdims: int = 0, noop_with_empty_axes: int = 0> (val_301, val_2)
   convert_element_type_default_3 = Unsqueeze (val_302, val_2)
   [node_div] div = Div (sum_1, convert_element_type_default_3)
   linear_145 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (div, "LinearTransformation.weight", "LinearTransformation.bias")
   [node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_145, val_0)
   [node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
   text_embedding = Div (linear_145, clamp_min)
}

weights:
LinearTransformation.bias FLOAT[768] 484baf5eb237
LinearTransformation.weight FLOAT[768,1024] 335cd7487dde
embedding_1 FLOAT[1,1,1024] fde44e13f97e
embedding_2 FLOAT[1,77,1024] 6a9dd377a20c
transformer.embeddings.LayerNorm.bias FLOAT[1024] aa9decc972df
transformer.embeddings.LayerNorm.weight FLOAT[1024] eb1be6fa8ed2
transformer.embeddings.word_embeddings.weight_fp16 FLOAT16[250002,1024] efc315eef9f6
transformer.encoder.layer.0.attention.output.LayerNorm.bias FLOAT[1024] e667dac74bc7
transformer.encoder.layer.0.attention.output.LayerNorm.weight FLOAT[1024] a37dd9d017da
transformer.encoder.layer.0.attention.output.dense.bias FLOAT[1024] 92301300cb7a
transformer.encoder.layer.0.attention.self.key.bias FLOAT[1024] fe18fdbfe45f
transformer.encoder.layer.0.attention.self.query.bias FLOAT[1024] ea62111a1023
transformer.encoder.layer.0.intermediate.dense.bias FLOAT[4096] 7d279938a062
transformer.encoder.layer.0.output.LayerNorm.bias FLOAT[1024] a8edbd30c12e
transformer.encoder.layer.0.output.LayerNorm.weight FLOAT[1024] 146d1711b3ab
transformer.encoder.layer.0.output.dense.bias FLOAT[1024] 97e0b85ddb59
transformer.encoder.layer.1.attention.output.LayerNorm.bias FLOAT[1024] 68ba8190539b
transformer.encoder.layer.1.attention.output.LayerNorm.weight FLOAT[1024] a223c90e0d7f
transformer.encoder.layer.1.attention.output.dense.bias FLOAT[1024] 5250c7b41803
transformer.encoder.layer.1.attention.self.key.bias FLOAT[1024] 4bb745bb5778
transformer.encoder.layer.1.attention.self.query.bias FLOAT[1024] 3adfb8899618
transformer.encoder.layer.1.intermediate.dense.bias FLOAT[4096] 274dbad4bad9
transformer.encoder.layer.1.output.LayerNorm.bias FLOAT[1024] 5674a693fb6a
transformer.encoder.layer.1.output.LayerNorm.weight FLOAT[1024] f213dbcdf3e1
transformer.encoder.layer.1.output.dense.bias FLOAT[1024] 61d7a90d66ba
transformer.encoder.layer.10.attention.output.LayerNorm.bias FLOAT[1024] 1c744374f46a
transformer.encoder.layer.10.attention.output.LayerNorm.weight FLOAT[1024] 81d9bad901fc
transformer.encoder.layer.10.attention.output.dense.bias FLOAT[1024] 5f094f301a18
transformer.encoder.layer.10.attention.self.key.bias FLOAT[1024] 066ed1bdcb4f
transformer.encoder.layer.10.attention.self.query.bias FLOAT[1024] 25d92d0d60cb
transformer.encoder.layer.10.intermediate.dense.bias FLOAT[4096] e38cf2987a06
transformer.encoder.layer.10.output.LayerNorm.bias FLOAT[1024] eafb3b5fe369
transformer.encoder.layer.10.output.LayerNorm.weight FLOAT[1024] e33dff639b30
transformer.encoder.layer.10.output.dense.bias FLOAT[1024] 6ed2cb5a4931
transformer.encoder.layer.11.attention.output.LayerNorm.bias FLOAT[1024] 8916c284b60c
transformer.encoder.layer.11.attention.output.LayerNorm.weight FLOAT[1024] 6a880e9793ac
transformer.encoder.layer.11.attention.output.dense.bias FLOAT[1024] 1c609a5f756e
transformer.encoder.layer.11.attention.self.key.bias FLOAT[1024] 70c7e4c2b5c9
transformer.encoder.layer.11.attention.self.query.bias FLOAT[1024] 8215c5077bc3
transformer.encoder.layer.11.intermediate.dense.bias FLOAT[4096] 5a6c68d77696
transformer.encoder.layer.11.output.LayerNorm.bias FLOAT[1024] fcaf2d280cef
transformer.encoder.layer.11.output.LayerNorm.weight FLOAT[1024] 7bdaab8a075e
transformer.encoder.layer.11.output.dense.bias FLOAT[1024] c973400a9ca0
transformer.encoder.layer.12.attention.output.LayerNorm.bias FLOAT[1024] aad8f546b157
transformer.encoder.layer.12.attention.output.LayerNorm.weight FLOAT[1024] 72f25e3b2745
transformer.encoder.layer.12.attention.output.dense.bias FLOAT[1024] fa43b88db882
transformer.encoder.layer.12.attention.self.key.bias FLOAT[1024] 4a2c785df99f
transformer.encoder.layer.12.attention.self.query.bias FLOAT[1024] edc60bfc7071
transformer.encoder.layer.12.intermediate.dense.bias FLOAT[4096] 221993fa02b9
transformer.encoder.layer.12.output.LayerNorm.bias FLOAT[1024] 9ca52b99b6df
transformer.encoder.layer.12.output.LayerNorm.weight FLOAT[1024] b74b37972b04
transformer.encoder.layer.12.output.dense.bias FLOAT[1024] d09b4e0c88d5
transformer.encoder.layer.13.attention.output.LayerNorm.bias FLOAT[1024] 78c0d1b74028
transformer.encoder.layer.13.attention.output.LayerNorm.weight FLOAT[1024] db239e0af485
transformer.encoder.layer.13.attention.output.dense.bias FLOAT[1024] de0517228fc4
transformer.encoder.layer.13.attention.self.key.bias FLOAT[1024] e0acfb120f2d
transformer.encoder.layer.13.attention.self.query.bias FLOAT[1024] 2e51c0da7103
transformer.encoder.layer.13.intermediate.dense.bias FLOAT[4096] 55174f9877f6
transformer.encoder.layer.13.output.LayerNorm.bias FLOAT[1024] 87cbac2f8cec
transformer.encoder.layer.13.output.LayerNorm.weight FLOAT[1024] 0d985aa05612
transformer.encoder.layer.13.output.dense.bias FLOAT[1024] 8a2d7de4bc17
transformer.encoder.layer.14.attention.output.LayerNorm.bias FLOAT[1024] 8543261f73b7
transformer.encoder.layer.14.attention.output.LayerNorm.weight FLOAT[1024] 9b9943f3b95b
transformer.encoder.layer.14.attention.output.dense.bias FLOAT[1024] 309b167b4270
transformer.encoder.layer.14.attention.self.key.bias FLOAT[1024] 532b67c1b103
transformer.encoder.layer.14.attention.self.query.bias FLOAT[1024] aa6efcb661d7
transformer.encoder.layer.14.intermediate.dense.bias FLOAT[4096] 0d264589d3de
transformer.encoder.layer.14.output.LayerNorm.bias FLOAT[1024] b2bbab5b2ebc
transformer.encoder.layer.14.output.LayerNorm.weight FLOAT[1024] 04423e991851
transformer.encoder.layer.14.output.dense.bias FLOAT[1024] 230b2c241618
transformer.encoder.layer.15.attention.output.LayerNorm.bias FLOAT[1024] 08897b453085
transformer.encoder.layer.15.attention.output.LayerNorm.weight FLOAT[1024] 11e1983648d4
transformer.encoder.layer.15.attention.output.dense.bias FLOAT[1024] 711d810f8558
transformer.encoder.layer.15.attention.self.key.bias FLOAT[1024] 3649d909b9b6
transformer.encoder.layer.15.attention.self.query.bias FLOAT[1024] 9187f7faa657
transformer.encoder.layer.15.intermediate.dense.bias FLOAT[4096] 61d86cb2467b
transformer.encoder.layer.15.output.LayerNorm.bias FLOAT[1024] 1bf7842feb58
transformer.encoder.layer.15.output.LayerNorm.weight FLOAT[1024] 857c18148f8c
transformer.encoder.layer.15.output.dense.bias FLOAT[1024] a14a49757dad
transformer.encoder.layer.16.attention.output.LayerNorm.bias FLOAT[1024] 1a32a0b6ca2b
transformer.encoder.layer.16.attention.output.LayerNorm.weight FLOAT[1024] 222c06f55468
transformer.encoder.layer.16.attention.output.dense.bias FLOAT[1024] 0dc061bfe1f3
transformer.encoder.layer.16.attention.self.key.bias FLOAT[1024] c26e63f76138
transformer.encoder.layer.16.attention.self.query.bias FLOAT[1024] e11177e51007
transformer.encoder.layer.16.intermediate.dense.bias FLOAT[4096] c5fde6ec4cee
transformer.encoder.layer.16.output.LayerNorm.bias FLOAT[1024] eec5a10f8cac
transformer.encoder.layer.16.output.LayerNorm.weight FLOAT[1024] ebc40503feef
transformer.encoder.layer.16.output.dense.bias FLOAT[1024] 96da545f2956
transformer.encoder.layer.17.attention.output.LayerNorm.bias FLOAT[1024] 1e6efad6e0b8
transformer.encoder.layer.17.attention.output.LayerNorm.weight FLOAT[1024] 898f8878a2a3
transformer.encoder.layer.17.attention.output.dense.bias FLOAT[1024] b2368e91c521
transformer.encoder.layer.17.attention.self.key.bias FLOAT[1024] 4a1f35952de3
transformer.encoder.layer.17.attention.self.query.bias FLOAT[1024] 63515622e280
transformer.encoder.layer.17.intermediate.dense.bias FLOAT[4096] 01655d505d71
transformer.encoder.layer.17.output.LayerNorm.bias FLOAT[1024] ff828241740b
transformer.encoder.layer.17.output.LayerNorm.weight FLOAT[1024] d1235629b2e2
transformer.encoder.layer.17.output.dense.bias FLOAT[1024] cf35c3db7f25
transformer.encoder.layer.18.attention.output.LayerNorm.bias FLOAT[1024] 78bb92c88b00
transformer.encoder.layer.18.attention.output.LayerNorm.weight FLOAT[1024] 753bfa039c1f
transformer.encoder.layer.18.attention.output.dense.bias FLOAT[1024] 10923a916b68
transformer.encoder.layer.18.attention.self.key.bias FLOAT[1024] 2ee631c36f01
transformer.encoder.layer.18.attention.self.query.bias FLOAT[1024] 835cac216cab
transformer.encoder.layer.18.intermediate.dense.bias FLOAT[4096] 364919728e1d
transformer.encoder.layer.18.output.LayerNorm.bias FLOAT[1024] f9c466c68ec6
transformer.encoder.layer.18.output.LayerNorm.weight FLOAT[1024] 1ada8bd9b240
transformer.encoder.layer.18.output.dense.bias FLOAT[1024] 634cb331719f
transformer.encoder.layer.19.attention.output.LayerNorm.bias FLOAT[1024] 01d7a1f80052
transformer.encoder.layer.19.attention.output.LayerNorm.weight FLOAT[1024] 9886b8fce029
transformer.encoder.layer.19.attention.output.dense.bias FLOAT[1024] 12b75900e87e
transformer.encoder.layer.19.attention.self.key.bias FLOAT[1024] 92616fe98bf2
transformer.encoder.layer.19.attention.self.query.bias FLOAT[1024] dbee4c5554b1
transformer.encoder.layer.19.intermediate.dense.bias FLOAT[4096] 04dca774c6eb
transformer.encoder.layer.19.output.LayerNorm.bias FLOAT[1024] add169f9717e
transformer.encoder.layer.19.output.LayerNorm.weight FLOAT[1024] 4b86d9b46d30
transformer.encoder.layer.19.output.dense.bias FLOAT[1024] f7c75639d0da
transformer.encoder.layer.2.attention.output.LayerNorm.bias FLOAT[1024] ad94e8ce7a53
transformer.encoder.layer.2.attention.output.LayerNorm.weight FLOAT[1024] 03fd06783f4b
transformer.encoder.layer.2.attention.output.dense.bias FLOAT[1024] 20f30f266d20
transformer.encoder.layer.2.attention.self.key.bias FLOAT[1024] 52de1ccdde16
transformer.encoder.layer.2.attention.self.query.bias FLOAT[1024] 4ece5c9cadcd
transformer.encoder.layer.2.intermediate.dense.bias FLOAT[4096] 7be3bd41979b
transformer.encoder.layer.2.output.LayerNorm.bias FLOAT[1024] 979a0ed4bb44
transformer.encoder.layer.2.output.LayerNorm.weight FLOAT[1024] cd5688bbea5c
transformer.encoder.layer.2.output.dense.bias FLOAT[1024] 618c0ad627dd
transformer.encoder.layer.20.attention.output.LayerNorm.bias FLOAT[1024] 160700107c8d
transformer.encoder.layer.20.attention.output.LayerNorm.weight FLOAT[1024] 32aebc298bab
transformer.encoder.layer.20.attention.output.dense.bias FLOAT[1024] 71a8c7dc5f7c
transformer.encoder.layer.20.attention.self.key.bias FLOAT[1024] 3cb1757c0968
transformer.encoder.layer.20.attention.self.query.bias FLOAT[1024] f0078a6cecbe
transformer.encoder.layer.20.intermediate.dense.bias FLOAT[4096] a6b85575a101
transformer.encoder.layer.20.output.LayerNorm.bias FLOAT[1024] ad14ffb64322
transformer.encoder.layer.20.output.LayerNorm.weight FLOAT[1024] 91085a608210
transformer.encoder.layer.20.output.dense.bias FLOAT[1024] 3aaa81d4b936
transformer.encoder.layer.21.attention.output.LayerNorm.bias FLOAT[1024] afa2df6143b5
transformer.encoder.layer.21.attention.output.LayerNorm.weight FLOAT[1024] 03c92d8d7e9f
transformer.encoder.layer.21.attention.output.dense.bias FLOAT[1024] 135828d166c9
transformer.encoder.layer.21.attention.self.key.bias FLOAT[1024] c452cd1e6d05
transformer.encoder.layer.21.attention.self.query.bias FLOAT[1024] 93df5a8b55a7
transformer.encoder.layer.21.intermediate.dense.bias FLOAT[4096] ee2a5779b3a1
transformer.encoder.layer.21.output.LayerNorm.bias FLOAT[1024] f5ee093b60a7
transformer.encoder.layer.21.output.LayerNorm.weight FLOAT[1024] d54e9f820566
transformer.encoder.layer.21.output.dense.bias FLOAT[1024] 6f57c8419f18
transformer.encoder.layer.22.attention.output.LayerNorm.bias FLOAT[1024] d3385d85b917
transformer.encoder.layer.22.attention.output.LayerNorm.weight FLOAT[1024] b0a61c2c3976
transformer.encoder.layer.22.attention.output.dense.bias FLOAT[1024] b06bb29e1d49
transformer.encoder.layer.22.attention.self.key.bias FLOAT[1024] 12b96ad8c588
transformer.encoder.layer.22.attention.self.query.bias FLOAT[1024] d0ae0eee90b4
transformer.encoder.layer.22.intermediate.dense.bias FLOAT[4096] 6496de194f5c
transformer.encoder.layer.22.output.LayerNorm.bias FLOAT[1024] 8eb829f28b3f
transformer.encoder.layer.22.output.LayerNorm.weight FLOAT[1024] a44c7b69169c
transformer.encoder.layer.22.output.dense.bias FLOAT[1024] bca08f6c66c5
transformer.encoder.layer.23.attention.output.LayerNorm.bias FLOAT[1024] 0cbc51aca14d
transformer.encoder.layer.23.attention.output.LayerNorm.weight FLOAT[1024] 1abbb3115184
transformer.encoder.layer.23.attention.output.dense.bias FLOAT[1024] 6cc2f354efd9
transformer.encoder.layer.23.attention.self.key.bias FLOAT[1024] 52359e56404b
transformer.encoder.layer.23.attention.self.query.bias FLOAT[1024] e454f06c07c4
transformer.encoder.layer.23.intermediate.dense.bias FLOAT[4096] 7031d4d636e1
transformer.encoder.layer.23.output.LayerNorm.bias FLOAT[1024] 521ae5418d1d
transformer.encoder.layer.23.output.LayerNorm.weight FLOAT[1024] 0f1957ddd95e
transformer.encoder.layer.23.output.dense.bias FLOAT[1024] b445c5585aca
transformer.encoder.layer.3.attention.output.LayerNorm.bias FLOAT[1024] 710478799c0c
transformer.encoder.layer.3.attention.output.LayerNorm.weight FLOAT[1024] 91be7a2e4b27
transformer.encoder.layer.3.attention.output.dense.bias FLOAT[1024] b63a31a67dff
transformer.encoder.layer.3.attention.self.key.bias FLOAT[1024] e74c2b9b0253
transformer.encoder.layer.3.attention.self.query.bias FLOAT[1024] 3bfd241526b8
transformer.encoder.layer.3.intermediate.dense.bias FLOAT[4096] 42dab3727d5b
transformer.encoder.layer.3.output.LayerNorm.bias FLOAT[1024] 5af34ba74908
transformer.encoder.layer.3.output.LayerNorm.weight FLOAT[1024] 88b797ad15bf
transformer.encoder.layer.3.output.dense.bias FLOAT[1024] ac36cf12ee2c
transformer.encoder.layer.4.attention.output.LayerNorm.bias FLOAT[1024] 7f9fd1ddc8cf
transformer.encoder.layer.4.attention.output.LayerNorm.weight FLOAT[1024] 43aa1153bb2c
transformer.encoder.layer.4.attention.output.dense.bias FLOAT[1024] 3b458f2e8178
transformer.encoder.layer.4.attention.self.key.bias FLOAT[1024] a738df043a0e
transformer.encoder.layer.4.attention.self.query.bias FLOAT[1024] 21dccee63529
transformer.encoder.layer.4.intermediate.dense.bias FLOAT[4096] 0a53a918884b
transformer.encoder.layer.4.output.LayerNorm.bias FLOAT[1024] 5503b296e5ac
transformer.encoder.layer.4.output.LayerNorm.weight FLOAT[1024] ea8e5a591c58
transformer.encoder.layer.4.output.dense.bias FLOAT[1024] 447e4bf024c5
transformer.encoder.layer.5.attention.output.LayerNorm.bias FLOAT[1024] c7c22cdc071d
transformer.encoder.layer.5.attention.output.LayerNorm.weight FLOAT[1024] 0699f37de9d2
transformer.encoder.layer.5.attention.output.dense.bias FLOAT[1024] b248aa9dfcfa
transformer.encoder.layer.5.attention.self.key.bias FLOAT[1024] be6a8d40bd72
transformer.encoder.layer.5.attention.self.query.bias FLOAT[1024] e2261e3c0b8e
transformer.encoder.layer.5.intermediate.dense.bias FLOAT[4096] 168f6cc0a425
transformer.encoder.layer.5.output.LayerNorm.bias FLOAT[1024] db4c1d6889a6
transformer.encoder.layer.5.output.LayerNorm.weight FLOAT[1024] ea2c584a9a91
transformer.encoder.layer.5.output.dense.bias FLOAT[1024] 7c43b0085a00
transformer.encoder.layer.6.attention.output.LayerNorm.bias FLOAT[1024] 82fe00123af6
transformer.encoder.layer.6.attention.output.LayerNorm.weight FLOAT[1024] 79d83823c90f
transformer.encoder.layer.6.attention.output.dense.bias FLOAT[1024] 57f400066933
transformer.encoder.layer.6.attention.self.key.bias FLOAT[1024] 7955eaa18052
transformer.encoder.layer.6.attention.self.query.bias FLOAT[1024] 4d4c5ac46014
transformer.encoder.layer.6.intermediate.dense.bias FLOAT[4096] 3e1e9d0f79ee
transformer.encoder.layer.6.output.LayerNorm.bias FLOAT[1024] 1232a63d4e34
transformer.encoder.layer.6.output.LayerNorm.weight FLOAT[1024] 2bda1226a35c
transformer.encoder.layer.6.output.dense.bias FLOAT[1024] f9e0924b2602
transformer.encoder.layer.7.attention.output.LayerNorm.bias FLOAT[1024] 8e889237e6cc
transformer.encoder.layer.7.attention.output.LayerNorm.weight FLOAT[1024] a6422722d965
transformer.encoder.layer.7.attention.output.dense.bias FLOAT[1024] 07f049e01315
transformer.encoder.layer.7.attention.self.key.bias FLOAT[1024] a87fd68b4a18
transformer.encoder.layer.7.attention.self.query.bias FLOAT[1024] 1693a4dc66f6
transformer.encoder.layer.7.intermediate.dense.bias FLOAT[4096] cfd8b88a26b4
transformer.encoder.layer.7.output.LayerNorm.bias FLOAT[1024] 5bc17186e455
transformer.encoder.layer.7.output.LayerNorm.weight FLOAT[1024] b91a18fa770a
transformer.encoder.layer.7.output.dense.bias FLOAT[1024] 23dfa149ba1a
transformer.encoder.layer.8.attention.output.LayerNorm.bias FLOAT[1024] 96bbc884fb8d
transformer.encoder.layer.8.attention.output.LayerNorm.weight FLOAT[1024] 5def878fd4de
transformer.encoder.layer.8.attention.output.dense.bias FLOAT[1024] 9366fdd0b3a9
transformer.encoder.layer.8.attention.self.key.bias FLOAT[1024] 5f01414d44db
transformer.encoder.layer.8.attention.self.query.bias FLOAT[1024] f67d2149231a
transformer.encoder.layer.8.intermediate.dense.bias FLOAT[4096] bba9cfe27304
transformer.encoder.layer.8.output.LayerNorm.bias FLOAT[1024] 3ce2eec5da75
transformer.encoder.layer.8.output.LayerNorm.weight FLOAT[1024] 482f1b595717
transformer.encoder.layer.8.output.dense.bias FLOAT[1024] 703184a9a85f
transformer.encoder.layer.9.attention.output.LayerNorm.bias FLOAT[1024] 27be10dc2cc5
transformer.encoder.layer.9.attention.output.LayerNorm.weight FLOAT[1024] b3c4dd81810b
transformer.encoder.layer.9.attention.output.dense.bias FLOAT[1024] b8376eba134f
transformer.encoder.layer.9.attention.self.key.bias FLOAT[1024] 193ac36b0f2b
transformer.encoder.layer.9.attention.self.query.bias FLOAT[1024] 3232dbd45cd0
transformer.encoder.layer.9.intermediate.dense.bias FLOAT[4096] 360199e51b7d
transformer.encoder.layer.9.output.LayerNorm.bias FLOAT[1024] 9819438e82ed
transformer.encoder.layer.9.output.LayerNorm.weight FLOAT[1024] 326c526658ec
transformer.encoder.layer.9.output.dense.bias FLOAT[1024] 40ae63684237
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[1024,1024] ffff75d715e6
val_100 FLOAT[1024,1024] 501e4239120c
val_101 FLOAT[1024,1024] 57d12dcc218b
val_102 FLOAT[1024,4096] 7661ebb29e06
val_103 FLOAT[4096,1024] 600660473ef1
val_104 FLOAT[1024,1024] 968b0f7927ef
val_105 FLOAT[1024,1024] 8bdfa3544a32
val_106 FLOAT[1024,1024] a9449a29e116
val_107 FLOAT[1024,1024] 1f0202143d2f
val_108 FLOAT[1024,4096] b3351afb0b2b
val_109 FLOAT[4096,1024] e058e253c8da
val_11 FLOAT[1024,1024] 2fca10a36afd
val_110 FLOAT[1024,1024] a3666ca01ac3
val_111 FLOAT[1024,1024] efbcb4e98491
val_112 FLOAT[1024,1024] ace90bd29c30
val_113 FLOAT[1024,1024] 20a6ae5d2f68
val_114 FLOAT[1024,4096] 2a788f1b5bbf
val_115 FLOAT[4096,1024] 1d80469b1493
val_116 FLOAT[1024,1024] 90fef0a38794
val_117 FLOAT[1024,1024] 5177f3b60e05
val_118 FLOAT[1024,1024] 16b86e246ec9
val_119 FLOAT[1024,1024] 62b678433ab2
val_12 FLOAT[1024,4096] 5085ee8d7eb3
val_120 FLOAT[1024,4096] 9174a415d1a5
val_121 FLOAT[4096,1024] 24017d686471
val_122 FLOAT[1024,1024] 8e689c3c58cb
val_123 FLOAT[1024,1024] cda48467bb56
val_124 FLOAT[1024,1024] 4a53b1dbfc0e
val_125 FLOAT[1024,1024] 235472755507
val_126 FLOAT[1024,4096] a273bda084cb
val_127 FLOAT[4096,1024] 5ed04aa9b18c
val_128 FLOAT[1024,1024] ce6d665435b8
val_129 FLOAT[1024,1024] 8be8ff8ef79e
val_13 FLOAT[4096,1024] 5aaa96172f11
val_130 FLOAT[1024,1024] 809be1517356
val_131 FLOAT[1024,1024] 569c8d10f2fe
val_132 FLOAT[1024,4096] a100dae50675
val_133 FLOAT[4096,1024] c3cee6678643
val_134 FLOAT[1024,1024] 4df0c9ef2b5e
val_135 FLOAT[1024,1024] b18d26721950
val_136 FLOAT[1024,1024] 93e1550c3102
val_137 FLOAT[1024,1024] 7715226bec98
val_138 FLOAT[1024,4096] 810a49958051
val_139 FLOAT[4096,1024] d73b43cab424
val_14 FLOAT[1024,1024] 60d1947a424b
val_140 FLOAT[1024,1024] fd7a95e3fb3a
val_141 FLOAT[1024,1024] c523ea54f5cd
val_142 FLOAT[1024,1024] 04ac7b810deb
val_143 FLOAT[1024,1024] 2efa25cb3339
val_144 FLOAT[1024,4096] 831253ccc0e9
val_145 FLOAT[4096,1024] 2451ed9bd824
val_146 FLOAT[1024,1024] 2f721c675ff9
val_147 FLOAT[1024,1024] bce1b8a787e8
val_148 FLOAT[1024,1024] e50b834744be
val_149 FLOAT[1024,1024] 25282b38eee8
val_15 FLOAT[1024,1024] df6ed8385b10
val_150 FLOAT[1024,4096] 7cda49ad7a81
val_151 FLOAT[4096,1024] c4c9933333ec
val_16 FLOAT[1024,1024] 3abf3c522798
val_17 FLOAT[1024,1024] 1b2012eb54ae
val_18 FLOAT[1024,4096] 43cd4a88139a
val_19 FLOAT[4096,1024] 7639bf94cb4d
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[1024,1024] 21c017595dc3
val_21 FLOAT[1024,1024] 92f8f7ca46d7
val_22 FLOAT[1024,1024] 941462863a6f
val_23 FLOAT[1024,1024] db818dd352de
val_24 FLOAT[1024,4096] 8f8c1e5bfc36
val_25 FLOAT[4096,1024] 8b897776b9dc
val_26 FLOAT[1024,1024] 5575919b6a65
val_27 FLOAT[1024,1024] 9631cd3be45d
val_28 FLOAT[1024,1024] a965f54e0b26
val_29 FLOAT[1024,1024] 714e56b3cc32
val_3 INT64[1] d86e8112f3c4
val_30 FLOAT[1024,4096] a26c5b832395
val_31 FLOAT[4096,1024] f4de2a6098de
val_32 FLOAT[1024,1024] 86bed0b1f505
val_33 FLOAT[1024,1024] 5d2f237e5d07
val_34 FLOAT[1024,1024] 9ca47609689c
val_35 FLOAT[1024,1024] 3630f3d583d9
val_36 FLOAT[1024,4096] 0cc85f91a4d0
val_37 FLOAT[4096,1024] a0753e6f106e
val_38 FLOAT[1024,1024] 0ad81d1a7d8d
val_39 FLOAT[1024,1024] 4de00d492233
val_4 FLOAT[] e00e5eb94441
val_40 FLOAT[1024,1024] 297f9c22cd49
val_41 FLOAT[1024,1024] 8434affe89d6
val_42 FLOAT[1024,4096] c3a3780a6d71
val_43 FLOAT[4096,1024] f01c0e5314c7
val_44 FLOAT[1024,1024] 1009266729c2
val_45 FLOAT[1024,1024] 16653095d70c
val_46 FLOAT[1024,1024] dcaa577f6bda
val_47 FLOAT[1024,1024] 29003df33279
val_48 FLOAT[1024,4096] 7cb5331ccd19
val_49 FLOAT[4096,1024] 1b1f88d8caf8
val_5 FLOAT[] e401200e5808
val_50 FLOAT[1024,1024] 43804e7653f3
val_51 FLOAT[1024,1024] c695f70782f0
val_52 FLOAT[1024,1024] 5d7e10b048c0
val_53 FLOAT[1024,1024] b6590fc8a0ed
val_54 FLOAT[1024,4096] a41d382ee3e6
val_55 FLOAT[4096,1024] 1ad45feed212
val_56 FLOAT[1024,1024] c4d70c545375
val_57 FLOAT[1024,1024] db7618685b9f
val_58 FLOAT[1024,1024] 0d3e591fea94
val_59 FLOAT[1024,1024] 223b7fb2d122
val_6 INT64[2] 0c730b69905c
val_60 FLOAT[1024,4096] b38cd821d67c
val_61 FLOAT[4096,1024] cd51bde32816
val_62 FLOAT[1024,1024] a5d4e33b5c06
val_63 FLOAT[1024,1024] 6f2688c1585b
val_64 FLOAT[1024,1024] dc999a32d89c
val_65 FLOAT[1024,1024] 1234c24ff7ce
val_66 FLOAT[1024,4096] 7f4d578b2982
val_67 FLOAT[4096,1024] 51a46f2df01d
val_68 FLOAT[1024,1024] 5d8b9e322eb5
val_69 FLOAT[1024,1024] aa160752d08c
val_7 FLOAT[77,1] 9575b2125169
val_70 FLOAT[1024,1024] e5dbf3969867
val_71 FLOAT[1024,1024] 366dcfd33fcd
val_72 FLOAT[1024,4096] 5e899abce2ad
val_73 FLOAT[4096,1024] 89b619e83610
val_74 FLOAT[1024,1024] 3810fa8954f7
val_75 FLOAT[1024,1024] cf895d131422
val_76 FLOAT[1024,1024] 5356210b0c91
val_77 FLOAT[1024,1024] 05d5ffa0d390
val_78 FLOAT[1024,4096] 3eb50827f8b6
val_79 FLOAT[4096,1024] 9e053ac26b6d
val_8 FLOAT[1024,1024] 922fcaac53d8
val_80 FLOAT[1024,1024] 38cb4624a8a0
val_81 FLOAT[1024,1024] 4e99898868f5
val_82 FLOAT[1024,1024] 57c8fe31841c
val_83 FLOAT[1024,1024] d8b39a558a30
val_84 FLOAT[1024,4096] 2257aa4b8bea
val_85 FLOAT[4096,1024] 8fc3b2b25c29
val_86 FLOAT[1024,1024] 8ebd2704329c
val_87 FLOAT[1024,1024] 363c26c123cf
val_88 FLOAT[1024,1024] 422cb7f4332d
val_89 FLOAT[1024,1024] 7009eebe1a94
val_9 FLOAT[1024,1024] 4e2168c14f98
val_90 FLOAT[1024,4096] bad5329e2427
val_91 FLOAT[4096,1024] b8bc5cebfdb0
val_92 FLOAT[1024,1024] f1bb8eb1e34e
val_93 FLOAT[1024,1024] bc3494e2ab72
val_94 FLOAT[1024,1024] 3030ae32d025
val_95 FLOAT[1024,1024] 7a4ce6ba5b3f
val_96 FLOAT[1024,4096] 6033d28efd39
val_97 FLOAT[4096,1024] d04b7fdfcb78
val_98 FLOAT[1024,1024] 567ab583537e
val_99 FLOAT[1024,1024] cbfe40e5b266
