<
   ir_version: 10,
   opset_import: ["" : 23],
   producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding) 
   <
      float[batch,77,1024] add_1012
      float[batch,77,1024] add_1127
      float[batch,77,1024] add_1156
      float[batch,77,1024] add_119
      float[batch,77,1024] add_1271
      float[batch,77,1024] add_1300
      float[batch,77,1024] add_1415
      float[batch,77,1024] add_1444
      float[batch,77,1024] add_148
      float[batch,77,1024] add_1559
      float[batch,77,1024] add_1588
      float[batch,1,1024] add_1588_pooled
      float[batch,1,1024] add_1703
      float[batch,1,1024] add_1732
      float[batch,77,1024] add_263
      float[batch,77,1024] add_292
      float[batch,77,1024] add_4
      float[batch,77,1024] add_407
      float[batch,77,1024] add_436
      float[batch,77,1024] add_551
      float[batch,77,1024] add_580
      float[batch,77,1024] add_695
      float[batch,77,1024] add_724
      float[batch,77,1024] add_839
      float[batch,77,1024] add_868
      float[batch,77,1024] add_983
      int64[batch] argmax
      float[batch,1] clamp_min
      float[batch,77,1024] embedding
      float[batch,77,1024] layer_norm
      float[batch,77,1024] layer_norm_1
      float[batch,77,1024] layer_norm_10
      float[batch,77,1024] layer_norm_11
      float[batch,77,1024] layer_norm_12
      float[batch,77,1024] layer_norm_13
      float[batch,77,1024] layer_norm_14
      float[batch,77,1024] layer_norm_15
      float[batch,77,1024] layer_norm_16
      float[batch,77,1024] layer_norm_17
      float[batch,77,1024] layer_norm_18
      float[batch,77,1024] layer_norm_19
      float[batch,77,1024] layer_norm_2
      float[batch,77,1024] layer_norm_20
      float[batch,77,1024] layer_norm_21
      float[batch,77,1024] layer_norm_22
      float[batch,1,1024] layer_norm_23
      float[batch,77,1024] layer_norm_3
      float[batch,77,1024] layer_norm_4
      float[batch,77,1024] layer_norm_5
      float[batch,77,1024] layer_norm_6
      float[batch,77,1024] layer_norm_7
      float[batch,77,1024] layer_norm_8
      float[batch,77,1024] layer_norm_9
      float[batch,1] linalg_vector_norm
      float[batch,77,4096] linear_10
      float[batch,77,1024] linear_11
      float[batch,77,4096] linear_14
      float[batch,77,1024] linear_15
      float[batch,77,4096] linear_18
      float[batch,77,1024] linear_19
      float[batch,77,4096] linear_2
      float[batch,77,4096] linear_22
      float[batch,77,1024] linear_23
      float[batch,77,4096] linear_26
      float[batch,77,1024] linear_27
      float[batch,77,1024] linear_3
      float[batch,77,4096] linear_30
      float[batch,77,1024] linear_31
      float[batch,77,4096] linear_34
      float[batch,77,1024] linear_35
      float[batch,77,4096] linear_38
      float[batch,77,1024] linear_39
      float[batch,77,4096] linear_42
      float[batch,77,1024] linear_43
      float[batch,1,4096] linear_46
      float[batch,1,1024] linear_47
      float[batch,77,4096] linear_6
      float[batch,77,1024] linear_7
      float[batch,1024] matmul
      float[batch,77,4096] mul_101
      float[batch,77,4096] mul_106
      float[batch,77,4096] mul_1064
      float[batch,77,4096] mul_1069
      float[batch,77,4096] mul_1171
      float[batch,77,4096] mul_1176
      float[batch,1,4096] mul_1278
      float[batch,1,4096] mul_1283
      float[batch,77,4096] mul_208
      float[batch,77,4096] mul_213
      float[batch,77,4096] mul_315
      float[batch,77,4096] mul_320
      float[batch,77,4096] mul_422
      float[batch,77,4096] mul_427
      float[batch,77,4096] mul_529
      float[batch,77,4096] mul_534
      float[batch,77,4096] mul_636
      float[batch,77,4096] mul_641
      float[batch,77,4096] mul_743
      float[batch,77,4096] mul_748
      float[batch,77,4096] mul_850
      float[batch,77,4096] mul_855
      float[batch,77,4096] mul_957
      float[batch,77,4096] mul_962
      float[batch,77,1024] node_scaled_dot_product_attention_10_k
      float[batch,77,1024] node_scaled_dot_product_attention_10_out
      float[batch,77,1024] node_scaled_dot_product_attention_10_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_10_q
      float[batch,77,3072] node_scaled_dot_product_attention_10_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_10_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_10_v
      float[batch,77,1024] node_scaled_dot_product_attention_11_k
      float[batch,1,1024] node_scaled_dot_product_attention_11_out
      float[batch,1,1024] node_scaled_dot_product_attention_11_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_11_q
      float[batch,77,3072] node_scaled_dot_product_attention_11_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_11_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_11_v
      float[batch,77,1024] node_scaled_dot_product_attention_1_k
      float[batch,77,1024] node_scaled_dot_product_attention_1_out
      float[batch,77,1024] node_scaled_dot_product_attention_1_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_1_q
      float[batch,77,3072] node_scaled_dot_product_attention_1_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_1_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_1_v
      float[batch,77,1024] node_scaled_dot_product_attention_2_k
      float[batch,77,1024] node_scaled_dot_product_attention_2_out
      float[batch,77,1024] node_scaled_dot_product_attention_2_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_2_q
      float[batch,77,3072] node_scaled_dot_product_attention_2_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_2_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_2_v
      float[batch,77,1024] node_scaled_dot_product_attention_3_k
      float[batch,77,1024] node_scaled_dot_product_attention_3_out
      float[batch,77,1024] node_scaled_dot_product_attention_3_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_3_q
      float[batch,77,3072] node_scaled_dot_product_attention_3_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_3_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_3_v
      float[batch,77,1024] node_scaled_dot_product_attention_4_k
      float[batch,77,1024] node_scaled_dot_product_attention_4_out
      float[batch,77,1024] node_scaled_dot_product_attention_4_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_4_q
      float[batch,77,3072] node_scaled_dot_product_attention_4_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_4_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_4_v
      float[batch,77,1024] node_scaled_dot_product_attention_5_k
      float[batch,77,1024] node_scaled_dot_product_attention_5_out
      float[batch,77,1024] node_scaled_dot_product_attention_5_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_5_q
      float[batch,77,3072] node_scaled_dot_product_attention_5_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_5_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_5_v
      float[batch,77,1024] node_scaled_dot_product_attention_6_k
      float[batch,77,1024] node_scaled_dot_product_attention_6_out
      float[batch,77,1024] node_scaled_dot_product_attention_6_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_6_q
      float[batch,77,3072] node_scaled_dot_product_attention_6_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_6_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_6_v
      float[batch,77,1024] node_scaled_dot_product_attention_7_k
      float[batch,77,1024] node_scaled_dot_product_attention_7_out
      float[batch,77,1024] node_scaled_dot_product_attention_7_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_7_q
      float[batch,77,3072] node_scaled_dot_product_attention_7_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_7_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_7_v
      float[batch,77,1024] node_scaled_dot_product_attention_8_k
      float[batch,77,1024] node_scaled_dot_product_attention_8_out
      float[batch,77,1024] node_scaled_dot_product_attention_8_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_8_q
      float[batch,77,3072] node_scaled_dot_product_attention_8_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_8_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_8_v
      float[batch,77,1024] node_scaled_dot_product_attention_9_k
      float[batch,77,1024] node_scaled_dot_product_attention_9_out
      float[batch,77,1024] node_scaled_dot_product_attention_9_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_9_q
      float[batch,77,3072] node_scaled_dot_product_attention_9_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_9_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_9_v
      float[batch,77,1024] node_scaled_dot_product_attention_k
      float[batch,77,1024] node_scaled_dot_product_attention_out
      float[batch,77,1024] node_scaled_dot_product_attention_out_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_q
      float[batch,77,3072] node_scaled_dot_product_attention_qkv
      float[batch,77,3072] node_scaled_dot_product_attention_qkv_mm_out
      float[batch,77,1024] node_scaled_dot_product_attention_v
      float[batch,77,1024] scaled_dot_product_attention
      float[batch,77,1024] scaled_dot_product_attention_1
      float[batch,77,1024] scaled_dot_product_attention_10
      float[batch,77,1024] scaled_dot_product_attention_11
      float[batch,1,1024] scaled_dot_product_attention_11_pooled
      float[batch,77,1024] scaled_dot_product_attention_2
      float[batch,77,1024] scaled_dot_product_attention_3
      float[batch,77,1024] scaled_dot_product_attention_4
      float[batch,77,1024] scaled_dot_product_attention_5
      float[batch,77,1024] scaled_dot_product_attention_6
      float[batch,77,1024] scaled_dot_product_attention_7
      float[batch,77,1024] scaled_dot_product_attention_8
      float[batch,77,1024] scaled_dot_product_attention_9
      float[batch,77,4096] sigmoid
      float[batch,77,4096] sigmoid_1
      float[batch,77,4096] sigmoid_10
      float[batch,1,4096] sigmoid_11
      float[batch,77,4096] sigmoid_2
      float[batch,77,4096] sigmoid_3
      float[batch,77,4096] sigmoid_4
      float[batch,77,4096] sigmoid_5
      float[batch,77,4096] sigmoid_6
      float[batch,77,4096] sigmoid_7
      float[batch,77,4096] sigmoid_8
      float[batch,77,4096] sigmoid_9
      float[batch,77,4096] val_40
      float[batch,77,1024] val_41
      float[batch,77,4096] val_42
      float[batch,77,1024] val_43
      float[batch,77,4096] val_44
      float[batch,77,1024] val_45
      float[batch,77,4096] val_46
      float[batch,77,1024] val_47
      float[batch,77,4096] val_48
      float[batch,77,1024] val_49
      float[batch,77,4096] val_50
      float[batch,77,1024] val_51
      float[batch,77,4096] val_52
      float[batch,77,1024] val_53
      float[batch,77,4096] val_54
      float[batch,77,1024] val_55
      float[batch,77,4096] val_56
      float[batch,77,1024] val_57
      float[batch,77,4096] val_58
      float[batch,77,1024] val_59
      float[batch,77,4096] val_60
      float[batch,77,1024] val_61
      float[batch,77] val_62
      float[batch,1,77] val_63
      float[batch,1,4096] val_64
      float[batch,1,1024] val_65
      float[batch,1,1024] val_66
      float[batch,1024] val_67
   >
{
   val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
   embedding = Cast <to: int = 1> (val_39)
   add_4 = Add (embedding, positional_embedding)
   [node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
   [node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
   [node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
   [node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
   [node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
   [node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
   add_119 = Add (add_4, node_scaled_dot_product_attention_out)
   layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
   val_40 = MatMul (layer_norm_1, val_4)
   linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
   mul_101 = Mul (linear_2, val_2)
   [node_sigmoid] sigmoid = Sigmoid (mul_101)
   mul_106 = Mul (linear_2, sigmoid)
   val_41 = MatMul (mul_106, val_5)
   linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
   add_148 = Add (add_119, linear_3)
   layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
   [node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
   [node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
   [node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
   [node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
   [node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
   add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
   layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
   val_42 = MatMul (layer_norm_3, val_7)
   linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
   mul_208 = Mul (linear_6, val_2)
   sigmoid_1 = Sigmoid (mul_208)
   mul_213 = Mul (linear_6, sigmoid_1)
   val_43 = MatMul (mul_213, val_8)
   linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
   add_292 = Add (add_263, linear_7)
   layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
   [node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
   [node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
   [node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
   [node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
   [node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
   add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
   layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
   val_44 = MatMul (layer_norm_5, val_10)
   linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
   mul_315 = Mul (linear_10, val_2)
   sigmoid_2 = Sigmoid (mul_315)
   mul_320 = Mul (linear_10, sigmoid_2)
   val_45 = MatMul (mul_320, val_11)
   linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
   add_436 = Add (add_407, linear_11)
   layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
   [node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
   [node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
   [node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
   [node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
   [node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
   add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
   layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
   val_46 = MatMul (layer_norm_7, val_13)
   linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
   mul_422 = Mul (linear_14, val_2)
   sigmoid_3 = Sigmoid (mul_422)
   mul_427 = Mul (linear_14, sigmoid_3)
   val_47 = MatMul (mul_427, val_14)
   linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
   add_580 = Add (add_551, linear_15)
   layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
   [node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
   [node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
   [node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
   [node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
   [node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
   add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
   layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
   val_48 = MatMul (layer_norm_9, val_16)
   linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
   mul_529 = Mul (linear_18, val_2)
   sigmoid_4 = Sigmoid (mul_529)
   mul_534 = Mul (linear_18, sigmoid_4)
   val_49 = MatMul (mul_534, val_17)
   linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
   add_724 = Add (add_695, linear_19)
   layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
   [node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
   [node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
   [node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
   [node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
   [node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
   add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
   layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
   val_50 = MatMul (layer_norm_11, val_19)
   linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
   mul_636 = Mul (linear_22, val_2)
   sigmoid_5 = Sigmoid (mul_636)
   mul_641 = Mul (linear_22, sigmoid_5)
   val_51 = MatMul (mul_641, val_20)
   linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
   add_868 = Add (add_839, linear_23)
   layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
   [node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
   [node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
   [node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
   [node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
   [node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
   add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
   layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
   val_52 = MatMul (layer_norm_13, val_22)
   linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
   mul_743 = Mul (linear_26, val_2)
   sigmoid_6 = Sigmoid (mul_743)
   mul_748 = Mul (linear_26, sigmoid_6)
   val_53 = MatMul (mul_748, val_23)
   linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
   add_1012 = Add (add_983, linear_27)
   layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
   [node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
   [node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
   [node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
   [node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
   [node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
   add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
   layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
   val_54 = MatMul (layer_norm_15, val_25)
   linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
   mul_850 = Mul (linear_30, val_2)
   sigmoid_7 = Sigmoid (mul_850)
   mul_855 = Mul (linear_30, sigmoid_7)
   val_55 = MatMul (mul_855, val_26)
   linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
   add_1156 = Add (add_1127, linear_31)
   layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
   [node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
   [node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
   [node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
   [node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
   [node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
   add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
   layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
   val_56 = MatMul (layer_norm_17, val_28)
   linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
   mul_957 = Mul (linear_34, val_2)
   sigmoid_8 = Sigmoid (mul_957)
   mul_962 = Mul (linear_34, sigmoid_8)
   val_57 = MatMul (mul_962, val_29)
   linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
   add_1300 = Add (add_1271, linear_35)
   layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
   [node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
   [node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
   [node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
   [node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
   [node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
   add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
   layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
   val_58 = MatMul (layer_norm_19, val_31)
   linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
   mul_1064 = Mul (linear_38, val_2)
   sigmoid_9 = Sigmoid (mul_1064)
   mul_1069 = Mul (linear_38, sigmoid_9)
   val_59 = MatMul (mul_1069, val_32)
   linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
   add_1444 = Add (add_1415, linear_39)
   layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
   [node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
   [node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
   [node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
   [node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
   [node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
   add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
   layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
   val_60 = MatMul (layer_norm_21, val_34)
   linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
   mul_1171 = Mul (linear_42, val_2)
   sigmoid_10 = Sigmoid (mul_1171)
   mul_1176 = Mul (linear_42, sigmoid_10)
   val_61 = MatMul (mul_1176, val_35)
   linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
   add_1588 = Add (add_1559, linear_43)
   layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
   [node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
   [node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
   [node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x1024)
   scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
   [node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
   val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
   val_63 = Unsqueeze (val_62, val_756_axes1)
   [pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
   [node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
   [node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
   [pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
   add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
   layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
   val_64 = MatMul (layer_norm_23, val_37)
   linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
   mul_1278 = Mul (linear_46, val_2)
   sigmoid_11 = Sigmoid (mul_1278)
   mul_1283 = Mul (linear_46, sigmoid_11)
   val_65 = MatMul (mul_1283, val_38)
   linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
   add_1732 = Add (add_1703, linear_47)
   val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
   val_67 = Squeeze (val_66, val_756_axes1)
   [node_matmul] matmul = MatMul (val_67, text_projection)
   [node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
   [node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
   [node_div] text_embedding = Div (matmul, clamp_min)
}

weights:
attn3d_split_3x1024 INT64[3] 0ec6f5651fd5
ln_final.bias FLOAT[1024] c158fa2fd310
ln_final.weight FLOAT[1024] 0f5085023d43
node_scaled_dot_product_attention_10_wo_t FLOAT[1024,1024] e88e79069507
node_scaled_dot_product_attention_11_wo_t FLOAT[1024,1024] 4a936c874f03
node_scaled_dot_product_attention_1_wo_t FLOAT[1024,1024] f676dc3ad242
node_scaled_dot_product_attention_2_wo_t FLOAT[1024,1024] ee2206309bd3
node_scaled_dot_product_attention_3_wo_t FLOAT[1024,1024] a08c5b0184a2
node_scaled_dot_product_attention_4_wo_t FLOAT[1024,1024] 69604966b61b
node_scaled_dot_product_attention_5_wo_t FLOAT[1024,1024] d542d49d0091
node_scaled_dot_product_attention_6_wo_t FLOAT[1024,1024] 8585c33cdd4d
node_scaled_dot_product_attention_7_wo_t FLOAT[1024,1024] 6db160de0a8c
node_scaled_dot_product_attention_8_wo_t FLOAT[1024,1024] ce1f55a23309
node_scaled_dot_product_attention_9_wo_t FLOAT[1024,1024] 8f795b2326f9
node_scaled_dot_product_attention_wo_t FLOAT[1024,1024] b406f6dfa0f9
positional_embedding FLOAT[77,1024] f008be43e715
text_projection FLOAT[1024,1024] 6d4fef8843c1
token_embedding.weight_fp16 FLOAT16[49408,1024] 1da8b0979903
transformer.resblocks.0.attn.in_proj_bias FLOAT[3072] 6279ad13131e
transformer.resblocks.0.attn.out_proj.bias FLOAT[1024] 4e30fe824e31
transformer.resblocks.0.ln_1.bias FLOAT[1024] 614c4325375d
transformer.resblocks.0.ln_1.weight FLOAT[1024] 25b598879841
transformer.resblocks.0.ln_2.bias FLOAT[1024] d25a2e7a00a3
transformer.resblocks.0.ln_2.weight FLOAT[1024] 5563178aba84
transformer.resblocks.0.mlp.c_fc.bias FLOAT[4096] 848ecd1a736b
transformer.resblocks.0.mlp.c_proj.bias FLOAT[1024] edd281b3ed00
transformer.resblocks.1.attn.in_proj_bias FLOAT[3072] 3aa22afdf34b
transformer.resblocks.1.attn.out_proj.bias FLOAT[1024] 8589f2c609be
transformer.resblocks.1.ln_1.bias FLOAT[1024] 090fbb84f350
transformer.resblocks.1.ln_1.weight FLOAT[1024] 71ce24bd1cb9
transformer.resblocks.1.ln_2.bias FLOAT[1024] 11d5082ed975
transformer.resblocks.1.ln_2.weight FLOAT[1024] f28b0c1c7d5f
transformer.resblocks.1.mlp.c_fc.bias FLOAT[4096] 84581e742f70
transformer.resblocks.1.mlp.c_proj.bias FLOAT[1024] 557de8b55ec3
transformer.resblocks.10.attn.in_proj_bias FLOAT[3072] 70af461830c4
transformer.resblocks.10.attn.out_proj.bias FLOAT[1024] 1778efa0d71b
transformer.resblocks.10.ln_1.bias FLOAT[1024] 9228ef6db72e
transformer.resblocks.10.ln_1.weight FLOAT[1024] 0c1291d2a693
transformer.resblocks.10.ln_2.bias FLOAT[1024] 04e713840828
transformer.resblocks.10.ln_2.weight FLOAT[1024] 6a71d74d68ca
transformer.resblocks.10.mlp.c_fc.bias FLOAT[4096] b2e3a7c5d287
transformer.resblocks.10.mlp.c_proj.bias FLOAT[1024] 6ad9a1e42b9b
transformer.resblocks.11.attn.in_proj_bias FLOAT[3072] ad0e1c2992ad
transformer.resblocks.11.attn.out_proj.bias FLOAT[1024] bd1f660ab5c1
transformer.resblocks.11.ln_1.bias FLOAT[1024] 60c27f9f0d06
transformer.resblocks.11.ln_1.weight FLOAT[1024] a2fafad8dcec
transformer.resblocks.11.ln_2.bias FLOAT[1024] 840a17ab89b1
transformer.resblocks.11.ln_2.weight FLOAT[1024] 3d87aaea2df4
transformer.resblocks.11.mlp.c_fc.bias FLOAT[4096] 289395febb66
transformer.resblocks.11.mlp.c_proj.bias FLOAT[1024] 7a75a89ea1d4
transformer.resblocks.2.attn.in_proj_bias FLOAT[3072] e6d2854786df
transformer.resblocks.2.attn.out_proj.bias FLOAT[1024] 4117ed9008e1
transformer.resblocks.2.ln_1.bias FLOAT[1024] 04617df69b96
transformer.resblocks.2.ln_1.weight FLOAT[1024] 98621e0461a3
transformer.resblocks.2.ln_2.bias FLOAT[1024] 29d0e86e05a7
transformer.resblocks.2.ln_2.weight FLOAT[1024] 9cfa88211778
transformer.resblocks.2.mlp.c_fc.bias FLOAT[4096] c131b5cb11aa
transformer.resblocks.2.mlp.c_proj.bias FLOAT[1024] 9debeee7c22a
transformer.resblocks.3.attn.in_proj_bias FLOAT[3072] 17aa099b96d3
transformer.resblocks.3.attn.out_proj.bias FLOAT[1024] 7a2275bd78f0
transformer.resblocks.3.ln_1.bias FLOAT[1024] c6784508b72d
transformer.resblocks.3.ln_1.weight FLOAT[1024] 21624818f500
transformer.resblocks.3.ln_2.bias FLOAT[1024] 88258e14de6b
transformer.resblocks.3.ln_2.weight FLOAT[1024] cc1c0429d421
transformer.resblocks.3.mlp.c_fc.bias FLOAT[4096] b88daea35120
transformer.resblocks.3.mlp.c_proj.bias FLOAT[1024] 5add36106c2f
transformer.resblocks.4.attn.in_proj_bias FLOAT[3072] 8e9d2764b572
transformer.resblocks.4.attn.out_proj.bias FLOAT[1024] 9eb75408fbf3
transformer.resblocks.4.ln_1.bias FLOAT[1024] 1c8feffb3961
transformer.resblocks.4.ln_1.weight FLOAT[1024] 5c5d7d3dc605
transformer.resblocks.4.ln_2.bias FLOAT[1024] 8e27a1cd3dbf
transformer.resblocks.4.ln_2.weight FLOAT[1024] 543ad5c1aa14
transformer.resblocks.4.mlp.c_fc.bias FLOAT[4096] c3a4aa27f5a8
transformer.resblocks.4.mlp.c_proj.bias FLOAT[1024] d527c6399ea2
transformer.resblocks.5.attn.in_proj_bias FLOAT[3072] f7c8279c7e7d
transformer.resblocks.5.attn.out_proj.bias FLOAT[1024] 42a397e51b3b
transformer.resblocks.5.ln_1.bias FLOAT[1024] 055229583cd1
transformer.resblocks.5.ln_1.weight FLOAT[1024] 6e6b46f70528
transformer.resblocks.5.ln_2.bias FLOAT[1024] 6e0fc8d5076c
transformer.resblocks.5.ln_2.weight FLOAT[1024] 06b5884dbd52
transformer.resblocks.5.mlp.c_fc.bias FLOAT[4096] a758d6342e53
transformer.resblocks.5.mlp.c_proj.bias FLOAT[1024] 3e33bf785395
transformer.resblocks.6.attn.in_proj_bias FLOAT[3072] 0faf26a979ac
transformer.resblocks.6.attn.out_proj.bias FLOAT[1024] 3071649956f9
transformer.resblocks.6.ln_1.bias FLOAT[1024] b4c9cb7aafd7
transformer.resblocks.6.ln_1.weight FLOAT[1024] 61fb7b7a7a55
transformer.resblocks.6.ln_2.bias FLOAT[1024] 7188da77d364
transformer.resblocks.6.ln_2.weight FLOAT[1024] f524991001d2
transformer.resblocks.6.mlp.c_fc.bias FLOAT[4096] b13f6119d6e8
transformer.resblocks.6.mlp.c_proj.bias FLOAT[1024] f22489672508
transformer.resblocks.7.attn.in_proj_bias FLOAT[3072] bce3bdd0c4b8
transformer.resblocks.7.attn.out_proj.bias FLOAT[1024] 8b46397b7ad4
transformer.resblocks.7.ln_1.bias FLOAT[1024] f11c7d0ef42f
transformer.resblocks.7.ln_1.weight FLOAT[1024] 70916a369813
transformer.resblocks.7.ln_2.bias FLOAT[1024] 4b1d30a80c2e
transformer.resblocks.7.ln_2.weight FLOAT[1024] ec407b6941f5
transformer.resblocks.7.mlp.c_fc.bias FLOAT[4096] be7638ba1390
transformer.resblocks.7.mlp.c_proj.bias FLOAT[1024] 369189e00ca0
transformer.resblocks.8.attn.in_proj_bias FLOAT[3072] 5c8de429591a
transformer.resblocks.8.attn.out_proj.bias FLOAT[1024] cf1cc73d7d3f
transformer.resblocks.8.ln_1.bias FLOAT[1024] 8ed2a3186d4c
transformer.resblocks.8.ln_1.weight FLOAT[1024] accee17dc839
transformer.resblocks.8.ln_2.bias FLOAT[1024] 98fb4cbb0c3b
transformer.resblocks.8.ln_2.weight FLOAT[1024] ede208ee0bf3
transformer.resblocks.8.mlp.c_fc.bias FLOAT[4096] d05c3e24f2db
transformer.resblocks.8.mlp.c_proj.bias FLOAT[1024] 1da760d4aab3
transformer.resblocks.9.attn.in_proj_bias FLOAT[3072] bfe88d188d4b
transformer.resblocks.9.attn.out_proj.bias FLOAT[1024] 2d36e069955f
transformer.resblocks.9.ln_1.bias FLOAT[1024] 20ebf61a78b5
transformer.resblocks.9.ln_1.weight FLOAT[1024] d7cd17781ac3
transformer.resblocks.9.ln_2.bias FLOAT[1024] 3c5efe387fb7
transformer.resblocks.9.ln_2.weight FLOAT[1024] 8d81f62a10c0
transformer.resblocks.9.mlp.c_fc.bias FLOAT[4096] 3e64b9307f4d
transformer.resblocks.9.mlp.c_proj.bias FLOAT[1024] 034773c5c494
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[1024,4096] c2183eb49796
val_11 FLOAT[4096,1024] c142568e80d2
val_12 FLOAT[1024,3072] 44941b4f0dd3
val_13 FLOAT[1024,4096] 06aa71e4097a
val_14 FLOAT[4096,1024] 0bc58a81fb20
val_15 FLOAT[1024,3072] 4e6112b2c72a
val_16 FLOAT[1024,4096] c81b38d4436f
val_17 FLOAT[4096,1024] e296c2111ef0
val_18 FLOAT[1024,3072] 03b5053ce129
val_19 FLOAT[1024,4096] 16ef6e6f1a13
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[4096,1024] 32174a78ac0a
val_21 FLOAT[1024,3072] fbe129c05a7c
val_22 FLOAT[1024,4096] 021fca3d1724
val_23 FLOAT[4096,1024] 3ce6495ff5fa
val_24 FLOAT[1024,3072] f64627edd8e5
val_25 FLOAT[1024,4096] 659535db2008
val_26 FLOAT[4096,1024] d70c69b6b3f1
val_27 FLOAT[1024,3072] 6e8b7049d2ed
val_28 FLOAT[1024,4096] 29bca006017a
val_29 FLOAT[4096,1024] 94f5d93ac2f0
val_3 FLOAT[1024,3072] de969930dc12
val_30 FLOAT[1024,3072] e586477a412e
val_31 FLOAT[1024,4096] e16242281285
val_32 FLOAT[4096,1024] b3fb7108dd94
val_33 FLOAT[1024,3072] ded202f7943c
val_34 FLOAT[1024,4096] 009af24fa472
val_35 FLOAT[4096,1024] 1801773841b9
val_36 FLOAT[1024,3072] b855848302db
val_37 FLOAT[1024,4096] b80090ef7163
val_38 FLOAT[4096,1024] 97b4fcc8cba3
val_4 FLOAT[1024,4096] fbf678a932bc
val_5 FLOAT[4096,1024] de768150ab79
val_6 FLOAT[1024,3072] f5c1a847b621
val_7 FLOAT[1024,4096] 54085f6a09ee
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[4096,1024] 01e80c26a440
val_9 FLOAT[1024,3072] 906c3865df06
