mirror of
https://github.com/immich-app/ml-models.git
synced 2026-09-30 21:27:43 +08:00
* feat: torch-free export core, shared graph/IR helpers, and CLI scaffolding * feat: fused InsightFace face exporter * feat: RKNN export path with per-SoC compilation * feat: single-partition CoreML CLIP export and runtime rewrite API * feat: refactor to passes, ep-specific fixes and optimizations * feat: check command diffing committed graph renderings, wired into CI * chore: graph and rewrite-plan renderings for the catalog * use pokedex large
626 lines
45 KiB
Plaintext
626 lines
45 KiB
Plaintext
<
|
|
ir_version: 10,
|
|
opset_import: ["" : 23],
|
|
producer_name: "pytorch"
|
|
>
|
|
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding)
|
|
<
|
|
float[batch,77,512] add_1012
|
|
float[batch,77,512] add_1127
|
|
float[batch,77,512] add_1156
|
|
float[batch,77,512] add_119
|
|
float[batch,77,512] add_1271
|
|
float[batch,77,512] add_1300
|
|
float[batch,77,512] add_1415
|
|
float[batch,77,512] add_1444
|
|
float[batch,77,512] add_148
|
|
float[batch,77,512] add_1559
|
|
float[batch,77,512] add_1588
|
|
float[batch,1,512] add_1588_pooled
|
|
float[batch,1,512] add_1703
|
|
float[batch,1,512] add_1732
|
|
float[batch,77,512] add_263
|
|
float[batch,77,512] add_292
|
|
float[batch,77,512] add_4
|
|
float[batch,77,512] add_407
|
|
float[batch,77,512] add_436
|
|
float[batch,77,512] add_551
|
|
float[batch,77,512] add_580
|
|
float[batch,77,512] add_695
|
|
float[batch,77,512] add_724
|
|
float[batch,77,512] add_839
|
|
float[batch,77,512] add_868
|
|
float[batch,77,512] add_983
|
|
int64[batch] argmax
|
|
float[batch,1] clamp_min
|
|
float[batch,77,512] embedding
|
|
float[batch,77,512] layer_norm
|
|
float[batch,77,512] layer_norm_1
|
|
float[batch,77,512] layer_norm_10
|
|
float[batch,77,512] layer_norm_11
|
|
float[batch,77,512] layer_norm_12
|
|
float[batch,77,512] layer_norm_13
|
|
float[batch,77,512] layer_norm_14
|
|
float[batch,77,512] layer_norm_15
|
|
float[batch,77,512] layer_norm_16
|
|
float[batch,77,512] layer_norm_17
|
|
float[batch,77,512] layer_norm_18
|
|
float[batch,77,512] layer_norm_19
|
|
float[batch,77,512] layer_norm_2
|
|
float[batch,77,512] layer_norm_20
|
|
float[batch,77,512] layer_norm_21
|
|
float[batch,77,512] layer_norm_22
|
|
float[batch,1,512] layer_norm_23
|
|
float[batch,77,512] layer_norm_3
|
|
float[batch,77,512] layer_norm_4
|
|
float[batch,77,512] layer_norm_5
|
|
float[batch,77,512] layer_norm_6
|
|
float[batch,77,512] layer_norm_7
|
|
float[batch,77,512] layer_norm_8
|
|
float[batch,77,512] layer_norm_9
|
|
float[batch,1] linalg_vector_norm
|
|
float[batch,77,2048] linear_10
|
|
float[batch,77,512] linear_11
|
|
float[batch,77,2048] linear_14
|
|
float[batch,77,512] linear_15
|
|
float[batch,77,2048] linear_18
|
|
float[batch,77,512] linear_19
|
|
float[batch,77,2048] linear_2
|
|
float[batch,77,2048] linear_22
|
|
float[batch,77,512] linear_23
|
|
float[batch,77,2048] linear_26
|
|
float[batch,77,512] linear_27
|
|
float[batch,77,512] linear_3
|
|
float[batch,77,2048] linear_30
|
|
float[batch,77,512] linear_31
|
|
float[batch,77,2048] linear_34
|
|
float[batch,77,512] linear_35
|
|
float[batch,77,2048] linear_38
|
|
float[batch,77,512] linear_39
|
|
float[batch,77,2048] linear_42
|
|
float[batch,77,512] linear_43
|
|
float[batch,1,2048] linear_46
|
|
float[batch,1,512] linear_47
|
|
float[batch,77,2048] linear_6
|
|
float[batch,77,512] linear_7
|
|
float[batch,1024] matmul
|
|
float[batch,77,2048] mul_101
|
|
float[batch,77,2048] mul_106
|
|
float[batch,77,2048] mul_1064
|
|
float[batch,77,2048] mul_1069
|
|
float[batch,77,2048] mul_1171
|
|
float[batch,77,2048] mul_1176
|
|
float[batch,1,2048] mul_1278
|
|
float[batch,1,2048] mul_1283
|
|
float[batch,77,2048] mul_208
|
|
float[batch,77,2048] mul_213
|
|
float[batch,77,2048] mul_315
|
|
float[batch,77,2048] mul_320
|
|
float[batch,77,2048] mul_422
|
|
float[batch,77,2048] mul_427
|
|
float[batch,77,2048] mul_529
|
|
float[batch,77,2048] mul_534
|
|
float[batch,77,2048] mul_636
|
|
float[batch,77,2048] mul_641
|
|
float[batch,77,2048] mul_743
|
|
float[batch,77,2048] mul_748
|
|
float[batch,77,2048] mul_850
|
|
float[batch,77,2048] mul_855
|
|
float[batch,77,2048] mul_957
|
|
float[batch,77,2048] mul_962
|
|
float[batch,77,512] node_scaled_dot_product_attention_10_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_10_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_10_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_10_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_11_k
|
|
float[batch,1,512] node_scaled_dot_product_attention_11_out
|
|
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_11_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_11_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_1_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_1_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_1_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_1_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_2_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_2_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_2_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_2_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_3_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_3_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_3_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_3_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_4_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_4_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_4_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_4_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_5_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_5_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_5_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_5_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_6_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_6_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_6_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_6_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_7_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_7_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_7_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_7_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_8_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_8_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_8_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_8_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_9_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_9_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_9_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_9_v
|
|
float[batch,77,512] node_scaled_dot_product_attention_k
|
|
float[batch,77,512] node_scaled_dot_product_attention_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_q
|
|
float[batch,77,1536] node_scaled_dot_product_attention_qkv
|
|
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
|
|
float[batch,77,512] node_scaled_dot_product_attention_v
|
|
float[batch,77,512] scaled_dot_product_attention
|
|
float[batch,77,512] scaled_dot_product_attention_1
|
|
float[batch,77,512] scaled_dot_product_attention_10
|
|
float[batch,77,512] scaled_dot_product_attention_11
|
|
float[batch,1,512] scaled_dot_product_attention_11_pooled
|
|
float[batch,77,512] scaled_dot_product_attention_2
|
|
float[batch,77,512] scaled_dot_product_attention_3
|
|
float[batch,77,512] scaled_dot_product_attention_4
|
|
float[batch,77,512] scaled_dot_product_attention_5
|
|
float[batch,77,512] scaled_dot_product_attention_6
|
|
float[batch,77,512] scaled_dot_product_attention_7
|
|
float[batch,77,512] scaled_dot_product_attention_8
|
|
float[batch,77,512] scaled_dot_product_attention_9
|
|
float[batch,77,2048] sigmoid
|
|
float[batch,77,2048] sigmoid_1
|
|
float[batch,77,2048] sigmoid_10
|
|
float[batch,1,2048] sigmoid_11
|
|
float[batch,77,2048] sigmoid_2
|
|
float[batch,77,2048] sigmoid_3
|
|
float[batch,77,2048] sigmoid_4
|
|
float[batch,77,2048] sigmoid_5
|
|
float[batch,77,2048] sigmoid_6
|
|
float[batch,77,2048] sigmoid_7
|
|
float[batch,77,2048] sigmoid_8
|
|
float[batch,77,2048] sigmoid_9
|
|
float[batch,77,2048] val_40
|
|
float[batch,77,512] val_41
|
|
float[batch,77,2048] val_42
|
|
float[batch,77,512] val_43
|
|
float[batch,77,2048] val_44
|
|
float[batch,77,512] val_45
|
|
float[batch,77,2048] val_46
|
|
float[batch,77,512] val_47
|
|
float[batch,77,2048] val_48
|
|
float[batch,77,512] val_49
|
|
float[batch,77,2048] val_50
|
|
float[batch,77,512] val_51
|
|
float[batch,77,2048] val_52
|
|
float[batch,77,512] val_53
|
|
float[batch,77,2048] val_54
|
|
float[batch,77,512] val_55
|
|
float[batch,77,2048] val_56
|
|
float[batch,77,512] val_57
|
|
float[batch,77,2048] val_58
|
|
float[batch,77,512] val_59
|
|
float[batch,77,2048] val_60
|
|
float[batch,77,512] val_61
|
|
float[batch,77] val_62
|
|
float[batch,1,77] val_63
|
|
float[batch,1,2048] val_64
|
|
float[batch,1,512] val_65
|
|
float[batch,1,512] val_66
|
|
float[batch,512] val_67
|
|
>
|
|
{
|
|
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
|
|
embedding = Cast <to: int = 1> (val_39)
|
|
add_4 = Add (embedding, positional_embedding)
|
|
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
|
|
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
|
|
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
|
|
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
|
|
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
|
|
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
|
|
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
|
|
val_40 = MatMul (layer_norm_1, val_4)
|
|
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
|
|
mul_101 = Mul (linear_2, val_2)
|
|
[node_sigmoid] sigmoid = Sigmoid (mul_101)
|
|
mul_106 = Mul (linear_2, sigmoid)
|
|
val_41 = MatMul (mul_106, val_5)
|
|
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
|
|
add_148 = Add (add_119, linear_3)
|
|
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
|
|
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
|
|
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
|
|
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
|
|
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
|
|
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
|
|
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
|
|
val_42 = MatMul (layer_norm_3, val_7)
|
|
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
|
|
mul_208 = Mul (linear_6, val_2)
|
|
sigmoid_1 = Sigmoid (mul_208)
|
|
mul_213 = Mul (linear_6, sigmoid_1)
|
|
val_43 = MatMul (mul_213, val_8)
|
|
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
|
|
add_292 = Add (add_263, linear_7)
|
|
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
|
|
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
|
|
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
|
|
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
|
|
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
|
|
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
|
|
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
|
|
val_44 = MatMul (layer_norm_5, val_10)
|
|
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
|
|
mul_315 = Mul (linear_10, val_2)
|
|
sigmoid_2 = Sigmoid (mul_315)
|
|
mul_320 = Mul (linear_10, sigmoid_2)
|
|
val_45 = MatMul (mul_320, val_11)
|
|
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
|
|
add_436 = Add (add_407, linear_11)
|
|
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
|
|
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
|
|
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
|
|
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
|
|
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
|
|
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
|
|
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
|
|
val_46 = MatMul (layer_norm_7, val_13)
|
|
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
|
|
mul_422 = Mul (linear_14, val_2)
|
|
sigmoid_3 = Sigmoid (mul_422)
|
|
mul_427 = Mul (linear_14, sigmoid_3)
|
|
val_47 = MatMul (mul_427, val_14)
|
|
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
|
|
add_580 = Add (add_551, linear_15)
|
|
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
|
|
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
|
|
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
|
|
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
|
|
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
|
|
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
|
|
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
|
|
val_48 = MatMul (layer_norm_9, val_16)
|
|
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
|
|
mul_529 = Mul (linear_18, val_2)
|
|
sigmoid_4 = Sigmoid (mul_529)
|
|
mul_534 = Mul (linear_18, sigmoid_4)
|
|
val_49 = MatMul (mul_534, val_17)
|
|
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
|
|
add_724 = Add (add_695, linear_19)
|
|
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
|
|
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
|
|
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
|
|
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
|
|
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
|
|
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
|
|
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
|
|
val_50 = MatMul (layer_norm_11, val_19)
|
|
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
|
|
mul_636 = Mul (linear_22, val_2)
|
|
sigmoid_5 = Sigmoid (mul_636)
|
|
mul_641 = Mul (linear_22, sigmoid_5)
|
|
val_51 = MatMul (mul_641, val_20)
|
|
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
|
|
add_868 = Add (add_839, linear_23)
|
|
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
|
|
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
|
|
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
|
|
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
|
|
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
|
|
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
|
|
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
|
|
val_52 = MatMul (layer_norm_13, val_22)
|
|
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
|
|
mul_743 = Mul (linear_26, val_2)
|
|
sigmoid_6 = Sigmoid (mul_743)
|
|
mul_748 = Mul (linear_26, sigmoid_6)
|
|
val_53 = MatMul (mul_748, val_23)
|
|
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
|
|
add_1012 = Add (add_983, linear_27)
|
|
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
|
|
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
|
|
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
|
|
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
|
|
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
|
|
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
|
|
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
|
|
val_54 = MatMul (layer_norm_15, val_25)
|
|
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
|
|
mul_850 = Mul (linear_30, val_2)
|
|
sigmoid_7 = Sigmoid (mul_850)
|
|
mul_855 = Mul (linear_30, sigmoid_7)
|
|
val_55 = MatMul (mul_855, val_26)
|
|
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
|
|
add_1156 = Add (add_1127, linear_31)
|
|
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
|
|
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
|
|
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
|
|
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
|
|
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
|
|
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
|
|
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
|
|
val_56 = MatMul (layer_norm_17, val_28)
|
|
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
|
|
mul_957 = Mul (linear_34, val_2)
|
|
sigmoid_8 = Sigmoid (mul_957)
|
|
mul_962 = Mul (linear_34, sigmoid_8)
|
|
val_57 = MatMul (mul_962, val_29)
|
|
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
|
|
add_1300 = Add (add_1271, linear_35)
|
|
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
|
|
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
|
|
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
|
|
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
|
|
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
|
|
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
|
|
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
|
|
val_58 = MatMul (layer_norm_19, val_31)
|
|
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
|
|
mul_1064 = Mul (linear_38, val_2)
|
|
sigmoid_9 = Sigmoid (mul_1064)
|
|
mul_1069 = Mul (linear_38, sigmoid_9)
|
|
val_59 = MatMul (mul_1069, val_32)
|
|
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
|
|
add_1444 = Add (add_1415, linear_39)
|
|
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
|
|
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
|
|
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
|
|
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
|
|
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
|
|
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
|
|
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
|
|
val_60 = MatMul (layer_norm_21, val_34)
|
|
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
|
|
mul_1171 = Mul (linear_42, val_2)
|
|
sigmoid_10 = Sigmoid (mul_1171)
|
|
mul_1176 = Mul (linear_42, sigmoid_10)
|
|
val_61 = MatMul (mul_1176, val_35)
|
|
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
|
|
add_1588 = Add (add_1559, linear_43)
|
|
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
|
|
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
|
|
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
|
|
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
|
|
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
|
|
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
|
|
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
|
|
val_63 = Unsqueeze (val_62, val_756_axes1)
|
|
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
|
|
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
|
|
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
|
|
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
|
|
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
|
|
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
|
|
val_64 = MatMul (layer_norm_23, val_37)
|
|
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
|
|
mul_1278 = Mul (linear_46, val_2)
|
|
sigmoid_11 = Sigmoid (mul_1278)
|
|
mul_1283 = Mul (linear_46, sigmoid_11)
|
|
val_65 = MatMul (mul_1283, val_38)
|
|
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
|
|
add_1732 = Add (add_1703, linear_47)
|
|
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
|
|
val_67 = Squeeze (val_66, val_756_axes1)
|
|
[node_matmul] matmul = MatMul (val_67, text_projection)
|
|
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
|
|
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
|
|
[node_div] text_embedding = Div (matmul, clamp_min)
|
|
}
|
|
|
|
weights:
|
|
attn3d_split_3x512 INT64[3] b4aa8df238da
|
|
ln_final.bias FLOAT[512] af9137c263d8
|
|
ln_final.weight FLOAT[512] 8fd94c8190fe
|
|
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] e496b94a9991
|
|
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] ce22c674db1e
|
|
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] ef1095dc2d19
|
|
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 093470e9cb87
|
|
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] faa6f7164be2
|
|
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 131b1e8431cc
|
|
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] a941b7e6356b
|
|
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] c797c745cc5a
|
|
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] ebc9c1bf88eb
|
|
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 35c1c67b810b
|
|
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 484c25db231b
|
|
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 2352ffe640ca
|
|
positional_embedding FLOAT[77,512] e62f735a7274
|
|
text_projection FLOAT[512,1024] ab2c8e929f61
|
|
token_embedding.weight_fp16 FLOAT16[49408,512] 3e2572cd3b5d
|
|
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] d730a75c41d4
|
|
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] b269e3fdd27e
|
|
transformer.resblocks.0.ln_1.bias FLOAT[512] 6a999dae3058
|
|
transformer.resblocks.0.ln_1.weight FLOAT[512] 3a74859230bc
|
|
transformer.resblocks.0.ln_2.bias FLOAT[512] 28e47a487477
|
|
transformer.resblocks.0.ln_2.weight FLOAT[512] b2f8dcff46da
|
|
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] e7755427cf22
|
|
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] ec33110019d6
|
|
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 92ef423e6753
|
|
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] aee4d12bddb8
|
|
transformer.resblocks.1.ln_1.bias FLOAT[512] c3b5587c32fa
|
|
transformer.resblocks.1.ln_1.weight FLOAT[512] d94c8699ebb3
|
|
transformer.resblocks.1.ln_2.bias FLOAT[512] 8acee9b93eea
|
|
transformer.resblocks.1.ln_2.weight FLOAT[512] b5ea71117480
|
|
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 7be6005f5719
|
|
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] f10a314b03aa
|
|
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 4dc87d85f7c4
|
|
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] d39b51fd18dd
|
|
transformer.resblocks.10.ln_1.bias FLOAT[512] 86da453b51bb
|
|
transformer.resblocks.10.ln_1.weight FLOAT[512] d2262b3a94f0
|
|
transformer.resblocks.10.ln_2.bias FLOAT[512] 187ba44b04fb
|
|
transformer.resblocks.10.ln_2.weight FLOAT[512] 73644a8834b2
|
|
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 1502d44f8339
|
|
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 8aa64eb01c68
|
|
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 14e81db017bd
|
|
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] b50b2548431e
|
|
transformer.resblocks.11.ln_1.bias FLOAT[512] 3a788b9bff16
|
|
transformer.resblocks.11.ln_1.weight FLOAT[512] 524505206932
|
|
transformer.resblocks.11.ln_2.bias FLOAT[512] a2e0827dc99a
|
|
transformer.resblocks.11.ln_2.weight FLOAT[512] fe06677baf9f
|
|
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] e7fec1a14924
|
|
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 1e34319b3d14
|
|
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] e5a731bf3c55
|
|
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] bd0f166c64a7
|
|
transformer.resblocks.2.ln_1.bias FLOAT[512] 91cdba3ffa80
|
|
transformer.resblocks.2.ln_1.weight FLOAT[512] 898003303792
|
|
transformer.resblocks.2.ln_2.bias FLOAT[512] 300d55ab28b1
|
|
transformer.resblocks.2.ln_2.weight FLOAT[512] 7dc90c9853d2
|
|
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 1ef8ba071013
|
|
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 8295cee881cd
|
|
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 8c5d14408274
|
|
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 38f8385635d9
|
|
transformer.resblocks.3.ln_1.bias FLOAT[512] d57a5e4f3e6f
|
|
transformer.resblocks.3.ln_1.weight FLOAT[512] 4eee33c98d5f
|
|
transformer.resblocks.3.ln_2.bias FLOAT[512] eca6077ba15d
|
|
transformer.resblocks.3.ln_2.weight FLOAT[512] 021f1d499a3b
|
|
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] c729ebf4c42f
|
|
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 1e31d78450ac
|
|
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] db3af0586487
|
|
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 49dea084601e
|
|
transformer.resblocks.4.ln_1.bias FLOAT[512] a6af2056772e
|
|
transformer.resblocks.4.ln_1.weight FLOAT[512] 59ede921b099
|
|
transformer.resblocks.4.ln_2.bias FLOAT[512] 1cf39c1bd8f8
|
|
transformer.resblocks.4.ln_2.weight FLOAT[512] 8bc1ce282da2
|
|
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] a8fe94006bd5
|
|
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 55ecff5baeef
|
|
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] c447ca87c8ec
|
|
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] f00c49fb6304
|
|
transformer.resblocks.5.ln_1.bias FLOAT[512] adb421f1043b
|
|
transformer.resblocks.5.ln_1.weight FLOAT[512] 6dee4fac068f
|
|
transformer.resblocks.5.ln_2.bias FLOAT[512] 2e0db66b04f7
|
|
transformer.resblocks.5.ln_2.weight FLOAT[512] 4701e6b43c45
|
|
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 767ab108ca12
|
|
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] a86bf48676c6
|
|
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 50a5604730c2
|
|
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 66cdc93fcecb
|
|
transformer.resblocks.6.ln_1.bias FLOAT[512] 090881896c31
|
|
transformer.resblocks.6.ln_1.weight FLOAT[512] 58057651de4f
|
|
transformer.resblocks.6.ln_2.bias FLOAT[512] a426abab5b00
|
|
transformer.resblocks.6.ln_2.weight FLOAT[512] a6c47dd83f3c
|
|
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 36dd3525f0e9
|
|
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 078be0d4f461
|
|
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 10eb00d234d1
|
|
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 1adb12589642
|
|
transformer.resblocks.7.ln_1.bias FLOAT[512] 50844a51f1cd
|
|
transformer.resblocks.7.ln_1.weight FLOAT[512] 2bfc9b786137
|
|
transformer.resblocks.7.ln_2.bias FLOAT[512] 7cf0b036a479
|
|
transformer.resblocks.7.ln_2.weight FLOAT[512] cde8283535db
|
|
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] b1f9f471f7a2
|
|
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 7496401e4ee6
|
|
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] ac7c36c9cdaa
|
|
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 798291178d79
|
|
transformer.resblocks.8.ln_1.bias FLOAT[512] 474767f50234
|
|
transformer.resblocks.8.ln_1.weight FLOAT[512] 469598211787
|
|
transformer.resblocks.8.ln_2.bias FLOAT[512] 1b265611fb29
|
|
transformer.resblocks.8.ln_2.weight FLOAT[512] bcdbe6036a86
|
|
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 56ff08e9e310
|
|
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 462993a4cbf1
|
|
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] b8958c4ad727
|
|
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 7244d7070ecf
|
|
transformer.resblocks.9.ln_1.bias FLOAT[512] 44ae6f4b8f00
|
|
transformer.resblocks.9.ln_1.weight FLOAT[512] b89497b9ef9e
|
|
transformer.resblocks.9.ln_2.bias FLOAT[512] 34a0782bfaf1
|
|
transformer.resblocks.9.ln_2.weight FLOAT[512] 7a6751e7cab7
|
|
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 2aea9f2ee8f8
|
|
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 1449d2853de3
|
|
val_0 INT64[1] 12a3ae445661
|
|
val_1 FLOAT[] 6708d9be4956
|
|
val_10 FLOAT[512,2048] d7d39e78f655
|
|
val_11 FLOAT[2048,512] 415ead01d224
|
|
val_12 FLOAT[512,1536] b73d909e4963
|
|
val_13 FLOAT[512,2048] 83da6fed9d36
|
|
val_14 FLOAT[2048,512] fc1d934fc32a
|
|
val_15 FLOAT[512,1536] 4a2a333c64f8
|
|
val_16 FLOAT[512,2048] 40500e6b7e20
|
|
val_17 FLOAT[2048,512] 6896b1431dac
|
|
val_18 FLOAT[512,1536] 1a7636877872
|
|
val_19 FLOAT[512,2048] 2435920c6f18
|
|
val_2 FLOAT[] c2e7ddfe3114
|
|
val_20 FLOAT[2048,512] 903b3f97c1fe
|
|
val_21 FLOAT[512,1536] 41ecdbc5689f
|
|
val_22 FLOAT[512,2048] 54d655ad774e
|
|
val_23 FLOAT[2048,512] d65df421f758
|
|
val_24 FLOAT[512,1536] a2623f37d7f9
|
|
val_25 FLOAT[512,2048] 551042b15636
|
|
val_26 FLOAT[2048,512] 12a0345ff182
|
|
val_27 FLOAT[512,1536] de0fffd27052
|
|
val_28 FLOAT[512,2048] a5a89ee220b6
|
|
val_29 FLOAT[2048,512] 603ac45f91be
|
|
val_3 FLOAT[512,1536] 813d339ed422
|
|
val_30 FLOAT[512,1536] 5dcde95f37d3
|
|
val_31 FLOAT[512,2048] 0d5fe4e667f5
|
|
val_32 FLOAT[2048,512] 4c02e645f954
|
|
val_33 FLOAT[512,1536] 1f527d6f3a81
|
|
val_34 FLOAT[512,2048] 65d9be2f7624
|
|
val_35 FLOAT[2048,512] 020f802ad476
|
|
val_36 FLOAT[512,1536] 572d5c646808
|
|
val_37 FLOAT[512,2048] dc638acbd602
|
|
val_38 FLOAT[2048,512] 26fb88d2592a
|
|
val_4 FLOAT[512,2048] b965975160bc
|
|
val_5 FLOAT[2048,512] f604c26d1396
|
|
val_6 FLOAT[512,1536] 6183eae5d49a
|
|
val_7 FLOAT[512,2048] 41b765cdc664
|
|
val_756_axes1 INT64[1] 7c9fa136d441
|
|
val_756_eye FLOAT[77,77] 39ccea14e08c
|
|
val_8 FLOAT[2048,512] 83cbb941fffa
|
|
val_9 FLOAT[512,1536] e8b22a42669a
|