feat: usable as library, model optimizations (#56)

* feat: torch-free export core, shared graph/IR helpers, and CLI scaffolding

* feat: fused InsightFace face exporter

* feat: RKNN export path with per-SoC compilation

* feat: single-partition CoreML CLIP export and runtime rewrite API

* feat: refactor to passes, ep-specific fixes and optimizations

* feat: check command diffing committed graph renderings, wired into CI

* chore: graph and rewrite-plan renderings for the catalog

* use pokedex large
This commit is contained in:
Mert
2026-08-04 17:46:25 -04:00
committed by GitHub
parent 96fa26c20e
commit df0ea33c8a
281 changed files with 128125 additions and 1199 deletions
+23 -16
View File
@@ -32,27 +32,34 @@ jobs:
enable-cache: true
cache-dependency-glob: uv.lock
- run: uv run --group onnx immich-model export "$MODEL_NAME" "$MODEL_SOURCE" --hf-model-name "$HF_MODEL_NAME"
- run: uv run --frozen --extra export immich-model onnx export "$MODEL_NAME" "$MODEL_SOURCE" --hf-model-name "$HF_MODEL_NAME"
env:
MODEL_NAME: ${{ inputs.model-name }}
MODEL_SOURCE: ${{ inputs.model-source }}
HF_MODEL_NAME: ${{ inputs.hf-name || inputs.model-name }}
HF_TOKEN: ${{ secrets.HF_TOKEN }}
# CLIP models publish at an opset RKNN can't ingest, so build the RKNN binaries from a lower-opset copy
- run: |
if [ "$MODEL_SOURCE" = insightface ]; then
uv run --group rknn immich-model compile "$MODEL_NAME"
else
uv run --group onnx immich-model export "$MODEL_NAME" "$MODEL_SOURCE" \
--hf-model-name "$HF_MODEL_NAME" --opset 20 --output-dir rknn-build
uv run --group rknn immich-model compile "$MODEL_NAME" --input-dir rknn-build
fi
# Here rather than in its own job because this is where an exported model exists
- id: check
run: uv run --frozen --extra export immich-model check --models models
# An exporter change stales every rendering at once; hand back this run's rather than making the
# author re-export the catalog
- if: ${{ failure() && steps.check.outcome == 'failure' }}
run: uv run --frozen --extra export immich-model check --models models --bless
- if: ${{ failure() && steps.check.outcome == 'failure' }}
uses: actions/upload-artifact@043fb46d1a93c77aae656e7c1c64a875d1fc6a0a # v7.0.1
with:
name: renderings-${{ inputs.model-name }}
path: |
ci/graphs/${{ inputs.model-name }}
ci/rewrites/${{ inputs.model-name }}
# RKNN binaries are built from the same fused ONNX every other backend uses
- run: uv run --frozen --extra rknn immich-model rknn compile "$MODEL_NAME"
env:
MODEL_NAME: ${{ inputs.model-name }}
MODEL_SOURCE: ${{ inputs.model-source }}
HF_MODEL_NAME: ${{ inputs.hf-name || inputs.model-name }}
HF_TOKEN: ${{ secrets.HF_TOKEN }}
- uses: actions/upload-artifact@043fb46d1a93c77aae656e7c1c64a875d1fc6a0a # v7.0.1
with:
@@ -74,7 +81,7 @@ jobs:
with:
enable-cache: true
cache-dependency-glob: uv.lock
- run: uv sync
- run: uv sync --frozen --extra export
- uses: actions/download-artifact@3e5f45b2cfb9172054b4087a40e8e0b5a5461e7c # v8.0.1
with:
@@ -83,8 +90,8 @@ jobs:
path: models/
- run: |
uv run immich-model upload "$MODEL_NAME" \
--hf-model-name "$HF_MODEL_NAME" --hf-organization immich-testing --revision v2
uv run --frozen --extra export immich-model upload "$MODEL_NAME" \
--hf-model-name "$HF_MODEL_NAME" --hf-organization immich-testing --hf-branch v2
env:
MODEL_NAME: ${{ inputs.model-name }}
HF_MODEL_NAME: ${{ inputs.hf-name || inputs.model-name }}
+19 -2
View File
@@ -17,6 +17,22 @@ concurrency:
cancel-in-progress: ${{ github.event_name == 'pull_request' }}
jobs:
# The plans need no model, so they gate every push instead of waiting on the export matrix
plans:
runs-on: ubuntu-latest
permissions:
contents: read
steps:
- uses: actions/checkout@de0fac2e4500dabe0009e67214ff5f5447ce83dd # v6.0.2
with:
persist-credentials: false
- uses: astral-sh/setup-uv@08807647e7069bb48b6ef5acd8ec9567f424441b # v8.1.0
with:
# this job produces no artifact for a poisoned cache to reach
enable-cache: true # zizmor: ignore[cache-poisoning]
cache-dependency-glob: uv.lock
- run: uv run --frozen --extra export immich-model check
configure:
runs-on: ubuntu-latest
outputs:
@@ -61,8 +77,9 @@ jobs:
force: ${{ inputs.force || 'false' }}
oldModels: ${{ steps.old-models.outputs.result }}
newModels: ${{ steps.new-models.outputs.result }}
oldHash: ${{ hashFiles('./before/immich_model/**', './before/.github/workflows/push.yaml', './before/.github/workflows/export.yaml') }}
newHash: ${{ hashFiles('./immich_model/**', './.github/workflows/push.yaml', './.github/workflows/export.yaml') }}
# rendering-only modules: hashing them would re-export the catalog for a change that cannot alter it
oldHash: ${{ hashFiles('./before/immich_model/**', '!./before/immich_model/_check.py', '!./before/immich_model/_render.py', './before/.github/workflows/push.yaml', './before/.github/workflows/export.yaml') }}
newHash: ${{ hashFiles('./immich_model/**', '!./immich_model/_check.py', '!./immich_model/_render.py', './.github/workflows/push.yaml', './.github/workflows/export.yaml') }}
script: |
const script = require('./.github/scripts/scope.js')
script({core})
+657
View File
@@ -0,0 +1,657 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] input_ids, int32[batch,77] attention_mask) => (float[batch,768] text_embedding)
<
float[batch,77,768] add_1008
float[batch,77,768] add_1033
float[batch,77,768] add_1106
float[batch,77,768] add_1131
float[batch,77,768] add_1204
float[batch,77,768] add_1229
float[batch,77,768] add_126
float[batch,77,768] add_13
float[batch,77,768] add_151
float[batch,77,768] add_224
float[batch,77,768] add_249
float[batch,77,768] add_322
float[batch,77,768] add_347
float[batch,77,768] add_420
float[batch,77,768] add_445
float[batch,77,768] add_518
float[batch,77,768] add_543
float[batch,77,768] add_616
float[batch,77,768] add_641
float[batch,77,768] add_714
float[batch,77,768] add_739
float[batch,77,768] add_8
float[batch,77,768] add_812
float[batch,77,768] add_837
float[batch,77,768] add_910
float[batch,77,768] add_935
float[batch,1,77,77] bitwise_and_1
float[batch,1] clamp_min
float[batch,77,1] convert_element_type_default
float[batch,1] convert_element_type_default_2
float[batch,768] div
float[batch,77,768] embedding
float[batch,77,3072] gelu
float[batch,77,3072] gelu_1
float[batch,77,3072] gelu_10
float[batch,77,3072] gelu_11
float[batch,77,3072] gelu_2
float[batch,77,3072] gelu_3
float[batch,77,3072] gelu_4
float[batch,77,3072] gelu_5
float[batch,77,3072] gelu_6
float[batch,77,3072] gelu_7
float[batch,77,3072] gelu_8
float[batch,77,3072] gelu_9
float[batch,77,768] layer_norm
float[batch,77,768] layer_norm_1
float[batch,77,768] layer_norm_10
float[batch,77,768] layer_norm_11
float[batch,77,768] layer_norm_12
float[batch,77,768] layer_norm_13
float[batch,77,768] layer_norm_14
float[batch,77,768] layer_norm_15
float[batch,77,768] layer_norm_16
float[batch,77,768] layer_norm_17
float[batch,77,768] layer_norm_18
float[batch,77,768] layer_norm_19
float[batch,77,768] layer_norm_2
float[batch,77,768] layer_norm_20
float[batch,77,768] layer_norm_21
float[batch,77,768] layer_norm_22
float[batch,77,768] layer_norm_23
float[batch,77,768] layer_norm_24
float[batch,77,768] layer_norm_3
float[batch,77,768] layer_norm_4
float[batch,77,768] layer_norm_5
float[batch,77,768] layer_norm_6
float[batch,77,768] layer_norm_7
float[batch,77,768] layer_norm_8
float[batch,77,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,768] linear
float[batch,77,768] linear_1
float[batch,77,3072] linear_10
float[batch,77,768] linear_11
float[batch,77,768] linear_12
float[batch,77,768] linear_13
float[batch,77,768] linear_15
float[batch,77,3072] linear_16
float[batch,77,768] linear_17
float[batch,77,768] linear_18
float[batch,77,768] linear_19
float[batch,77,768] linear_21
float[batch,77,3072] linear_22
float[batch,77,768] linear_23
float[batch,77,768] linear_24
float[batch,77,768] linear_25
float[batch,77,768] linear_27
float[batch,77,3072] linear_28
float[batch,77,768] linear_29
float[batch,77,768] linear_3
float[batch,77,768] linear_30
float[batch,77,768] linear_31
float[batch,77,768] linear_33
float[batch,77,3072] linear_34
float[batch,77,768] linear_35
float[batch,77,768] linear_36
float[batch,77,768] linear_37
float[batch,77,768] linear_39
float[batch,77,3072] linear_4
float[batch,77,3072] linear_40
float[batch,77,768] linear_41
float[batch,77,768] linear_42
float[batch,77,768] linear_43
float[batch,77,768] linear_45
float[batch,77,3072] linear_46
float[batch,77,768] linear_47
float[batch,77,768] linear_48
float[batch,77,768] linear_49
float[batch,77,768] linear_5
float[batch,77,768] linear_51
float[batch,77,3072] linear_52
float[batch,77,768] linear_53
float[batch,77,768] linear_54
float[batch,77,768] linear_55
float[batch,77,768] linear_57
float[batch,77,3072] linear_58
float[batch,77,768] linear_59
float[batch,77,768] linear_6
float[batch,77,768] linear_60
float[batch,77,768] linear_61
float[batch,77,768] linear_63
float[batch,77,3072] linear_64
float[batch,77,768] linear_65
float[batch,77,768] linear_66
float[batch,77,768] linear_67
float[batch,77,768] linear_69
float[batch,77,768] linear_7
float[batch,77,3072] linear_70
float[batch,77,768] linear_71
float[batch,768] linear_73
float[batch,77,768] linear_9
float[batch,77,768] mul_620
float[batch,77,768] scaled_dot_product_attention
float[batch,77,768] scaled_dot_product_attention_1
float[batch,77,768] scaled_dot_product_attention_10
float[batch,77,768] scaled_dot_product_attention_11
float[batch,77,768] scaled_dot_product_attention_2
float[batch,77,768] scaled_dot_product_attention_3
float[batch,77,768] scaled_dot_product_attention_4
float[batch,77,768] scaled_dot_product_attention_5
float[batch,77,768] scaled_dot_product_attention_6
float[batch,77,768] scaled_dot_product_attention_7
float[batch,77,768] scaled_dot_product_attention_8
float[batch,77,768] scaled_dot_product_attention_9
float[batch,768] sum_1
int32[batch,77,1] unsqueeze_12
float[batch,77,768] val_100
float[batch,77,3072] val_101
float[batch,77,768] val_102
float[batch,77,768] val_103
float[batch,77,768] val_104
float[batch,77,768] val_105
float[batch,77,768] val_106
float[batch,77,3072] val_107
float[batch,77,768] val_108
float[batch,77,768] val_109
float[batch,77,768] val_110
float[batch,77,768] val_111
float[batch,77,768] val_112
float[batch,77,3072] val_113
float[batch,77,768] val_114
float[batch,77,768] val_115
float[batch,77,768] val_116
float[batch,77,768] val_117
float[batch,77,768] val_118
float[batch,77,3072] val_119
float[batch,77,768] val_120
float[batch,77,768] val_121
float[batch,77,768] val_122
float[batch,77,768] val_123
float[batch,77,768] val_124
float[batch,77,3072] val_125
float[batch,77,768] val_126
float[batch,77,768] val_127
float[batch,77,768] val_128
float[batch,77,768] val_129
float[batch,77,768] val_130
float[batch,77,3072] val_131
float[batch,77,768] val_132
float[batch,77,768] val_133
float[batch,77,768] val_134
float[batch,77,768] val_135
float[batch,77,768] val_136
float[batch,77,3072] val_137
float[batch,77,768] val_138
float[batch,77,768] val_139
float[batch,77,768] val_140
float[batch,77,768] val_141
float[batch,77,768] val_142
float[batch,77,3072] val_143
float[batch,77,768] val_144
float[batch,77,768] val_145
float[batch,77,768] val_146
float[batch,77,768] val_147
float[batch,77,768] val_148
float[batch,77,3072] val_149
float[batch,77,768] val_150
float[batch,77,768] val_151
float[batch,77,768] val_152
float[batch,77,768] val_153
float[batch,77,768] val_154
float[batch,77,3072] val_155
float[batch,77,768] val_156
float[batch,77] val_157
float[batch] val_158
float[batch,77] val_81
float[batch,77] val_82
float[batch,77] val_83
float[batch,1,1,77] val_84
float[batch,77,768] val_85
float[batch,77,768] val_86
float[batch,77,768] val_87
float[batch,77,768] val_88
float[batch,77,3072] val_89
float[batch,77,768] val_90
float[batch,77,768] val_91
float[batch,77,768] val_92
float[batch,77,768] val_93
float[batch,77,768] val_94
float[batch,77,3072] val_95
float[batch,77,768] val_96
float[batch,77,768] val_97
float[batch,77,768] val_98
float[batch,77,768] val_99
>
{
val_80 = Gather <axis: int = 0> ("transformer.embeddings.word_embeddings.weight_fp16", input_ids)
embedding = Cast <to: int = 1> (val_80)
add_8 = Add (embedding, embedding_1)
add_13 = Add (add_8, embedding_2)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_13, "transformer.embeddings.LayerNorm.weight", "transformer.embeddings.LayerNorm.bias")
val_81 = Cast <to: int = 1> (attention_mask)
val_82 = Sub (val_81, val_4)
val_83 = Mul (val_82, val_5)
val_84 = Unsqueeze (val_83, val_6)
bitwise_and_1 = Add (val_84, val_7)
val_85 = MatMul (layer_norm, val_8)
[node_linear] linear = Add (val_85, "transformer.encoder.layer.0.attention.self.query.bias")
val_86 = MatMul (layer_norm, val_9)
linear_1 = Add (val_86, "transformer.encoder.layer.0.attention.self.key.bias")
val_87 = MatMul (layer_norm, val_10)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear, linear_1, val_87, bitwise_and_1)
val_88 = MatMul (scaled_dot_product_attention, val_11)
linear_3 = Add (val_88, "transformer.encoder.layer.0.attention.output.dense.bias")
add_126 = Add (linear_3, layer_norm)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_126, "transformer.encoder.layer.0.attention.output.LayerNorm.weight", "transformer.encoder.layer.0.attention.output.LayerNorm.bias")
val_89 = MatMul (layer_norm_1, val_12)
linear_4 = Add (val_89, "transformer.encoder.layer.0.intermediate.dense.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_4)
val_90 = MatMul (gelu, val_13)
linear_5 = Add (val_90, "transformer.encoder.layer.0.output.dense.bias")
add_151 = Add (linear_5, layer_norm_1)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_151, "transformer.encoder.layer.0.output.LayerNorm.weight", "transformer.encoder.layer.0.output.LayerNorm.bias")
val_91 = MatMul (layer_norm_2, val_14)
linear_6 = Add (val_91, "transformer.encoder.layer.1.attention.self.query.bias")
val_92 = MatMul (layer_norm_2, val_15)
linear_7 = Add (val_92, "transformer.encoder.layer.1.attention.self.key.bias")
val_93 = MatMul (layer_norm_2, val_16)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_6, linear_7, val_93, bitwise_and_1)
val_94 = MatMul (scaled_dot_product_attention_1, val_17)
linear_9 = Add (val_94, "transformer.encoder.layer.1.attention.output.dense.bias")
add_224 = Add (linear_9, layer_norm_2)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_224, "transformer.encoder.layer.1.attention.output.LayerNorm.weight", "transformer.encoder.layer.1.attention.output.LayerNorm.bias")
val_95 = MatMul (layer_norm_3, val_18)
linear_10 = Add (val_95, "transformer.encoder.layer.1.intermediate.dense.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_10)
val_96 = MatMul (gelu_1, val_19)
linear_11 = Add (val_96, "transformer.encoder.layer.1.output.dense.bias")
add_249 = Add (linear_11, layer_norm_3)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_249, "transformer.encoder.layer.1.output.LayerNorm.weight", "transformer.encoder.layer.1.output.LayerNorm.bias")
val_97 = MatMul (layer_norm_4, val_20)
linear_12 = Add (val_97, "transformer.encoder.layer.2.attention.self.query.bias")
val_98 = MatMul (layer_norm_4, val_21)
linear_13 = Add (val_98, "transformer.encoder.layer.2.attention.self.key.bias")
val_99 = MatMul (layer_norm_4, val_22)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_12, linear_13, val_99, bitwise_and_1)
val_100 = MatMul (scaled_dot_product_attention_2, val_23)
linear_15 = Add (val_100, "transformer.encoder.layer.2.attention.output.dense.bias")
add_322 = Add (linear_15, layer_norm_4)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_322, "transformer.encoder.layer.2.attention.output.LayerNorm.weight", "transformer.encoder.layer.2.attention.output.LayerNorm.bias")
val_101 = MatMul (layer_norm_5, val_24)
linear_16 = Add (val_101, "transformer.encoder.layer.2.intermediate.dense.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_16)
val_102 = MatMul (gelu_2, val_25)
linear_17 = Add (val_102, "transformer.encoder.layer.2.output.dense.bias")
add_347 = Add (linear_17, layer_norm_5)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_347, "transformer.encoder.layer.2.output.LayerNorm.weight", "transformer.encoder.layer.2.output.LayerNorm.bias")
val_103 = MatMul (layer_norm_6, val_26)
linear_18 = Add (val_103, "transformer.encoder.layer.3.attention.self.query.bias")
val_104 = MatMul (layer_norm_6, val_27)
linear_19 = Add (val_104, "transformer.encoder.layer.3.attention.self.key.bias")
val_105 = MatMul (layer_norm_6, val_28)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_18, linear_19, val_105, bitwise_and_1)
val_106 = MatMul (scaled_dot_product_attention_3, val_29)
linear_21 = Add (val_106, "transformer.encoder.layer.3.attention.output.dense.bias")
add_420 = Add (linear_21, layer_norm_6)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_420, "transformer.encoder.layer.3.attention.output.LayerNorm.weight", "transformer.encoder.layer.3.attention.output.LayerNorm.bias")
val_107 = MatMul (layer_norm_7, val_30)
linear_22 = Add (val_107, "transformer.encoder.layer.3.intermediate.dense.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_22)
val_108 = MatMul (gelu_3, val_31)
linear_23 = Add (val_108, "transformer.encoder.layer.3.output.dense.bias")
add_445 = Add (linear_23, layer_norm_7)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_445, "transformer.encoder.layer.3.output.LayerNorm.weight", "transformer.encoder.layer.3.output.LayerNorm.bias")
val_109 = MatMul (layer_norm_8, val_32)
linear_24 = Add (val_109, "transformer.encoder.layer.4.attention.self.query.bias")
val_110 = MatMul (layer_norm_8, val_33)
linear_25 = Add (val_110, "transformer.encoder.layer.4.attention.self.key.bias")
val_111 = MatMul (layer_norm_8, val_34)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_24, linear_25, val_111, bitwise_and_1)
val_112 = MatMul (scaled_dot_product_attention_4, val_35)
linear_27 = Add (val_112, "transformer.encoder.layer.4.attention.output.dense.bias")
add_518 = Add (linear_27, layer_norm_8)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_518, "transformer.encoder.layer.4.attention.output.LayerNorm.weight", "transformer.encoder.layer.4.attention.output.LayerNorm.bias")
val_113 = MatMul (layer_norm_9, val_36)
linear_28 = Add (val_113, "transformer.encoder.layer.4.intermediate.dense.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_28)
val_114 = MatMul (gelu_4, val_37)
linear_29 = Add (val_114, "transformer.encoder.layer.4.output.dense.bias")
add_543 = Add (linear_29, layer_norm_9)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_543, "transformer.encoder.layer.4.output.LayerNorm.weight", "transformer.encoder.layer.4.output.LayerNorm.bias")
val_115 = MatMul (layer_norm_10, val_38)
linear_30 = Add (val_115, "transformer.encoder.layer.5.attention.self.query.bias")
val_116 = MatMul (layer_norm_10, val_39)
linear_31 = Add (val_116, "transformer.encoder.layer.5.attention.self.key.bias")
val_117 = MatMul (layer_norm_10, val_40)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_30, linear_31, val_117, bitwise_and_1)
val_118 = MatMul (scaled_dot_product_attention_5, val_41)
linear_33 = Add (val_118, "transformer.encoder.layer.5.attention.output.dense.bias")
add_616 = Add (linear_33, layer_norm_10)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_616, "transformer.encoder.layer.5.attention.output.LayerNorm.weight", "transformer.encoder.layer.5.attention.output.LayerNorm.bias")
val_119 = MatMul (layer_norm_11, val_42)
linear_34 = Add (val_119, "transformer.encoder.layer.5.intermediate.dense.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_34)
val_120 = MatMul (gelu_5, val_43)
linear_35 = Add (val_120, "transformer.encoder.layer.5.output.dense.bias")
add_641 = Add (linear_35, layer_norm_11)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_641, "transformer.encoder.layer.5.output.LayerNorm.weight", "transformer.encoder.layer.5.output.LayerNorm.bias")
val_121 = MatMul (layer_norm_12, val_44)
linear_36 = Add (val_121, "transformer.encoder.layer.6.attention.self.query.bias")
val_122 = MatMul (layer_norm_12, val_45)
linear_37 = Add (val_122, "transformer.encoder.layer.6.attention.self.key.bias")
val_123 = MatMul (layer_norm_12, val_46)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_36, linear_37, val_123, bitwise_and_1)
val_124 = MatMul (scaled_dot_product_attention_6, val_47)
linear_39 = Add (val_124, "transformer.encoder.layer.6.attention.output.dense.bias")
add_714 = Add (linear_39, layer_norm_12)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_714, "transformer.encoder.layer.6.attention.output.LayerNorm.weight", "transformer.encoder.layer.6.attention.output.LayerNorm.bias")
val_125 = MatMul (layer_norm_13, val_48)
linear_40 = Add (val_125, "transformer.encoder.layer.6.intermediate.dense.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_40)
val_126 = MatMul (gelu_6, val_49)
linear_41 = Add (val_126, "transformer.encoder.layer.6.output.dense.bias")
add_739 = Add (linear_41, layer_norm_13)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_739, "transformer.encoder.layer.6.output.LayerNorm.weight", "transformer.encoder.layer.6.output.LayerNorm.bias")
val_127 = MatMul (layer_norm_14, val_50)
linear_42 = Add (val_127, "transformer.encoder.layer.7.attention.self.query.bias")
val_128 = MatMul (layer_norm_14, val_51)
linear_43 = Add (val_128, "transformer.encoder.layer.7.attention.self.key.bias")
val_129 = MatMul (layer_norm_14, val_52)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_42, linear_43, val_129, bitwise_and_1)
val_130 = MatMul (scaled_dot_product_attention_7, val_53)
linear_45 = Add (val_130, "transformer.encoder.layer.7.attention.output.dense.bias")
add_812 = Add (linear_45, layer_norm_14)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_812, "transformer.encoder.layer.7.attention.output.LayerNorm.weight", "transformer.encoder.layer.7.attention.output.LayerNorm.bias")
val_131 = MatMul (layer_norm_15, val_54)
linear_46 = Add (val_131, "transformer.encoder.layer.7.intermediate.dense.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_46)
val_132 = MatMul (gelu_7, val_55)
linear_47 = Add (val_132, "transformer.encoder.layer.7.output.dense.bias")
add_837 = Add (linear_47, layer_norm_15)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_837, "transformer.encoder.layer.7.output.LayerNorm.weight", "transformer.encoder.layer.7.output.LayerNorm.bias")
val_133 = MatMul (layer_norm_16, val_56)
linear_48 = Add (val_133, "transformer.encoder.layer.8.attention.self.query.bias")
val_134 = MatMul (layer_norm_16, val_57)
linear_49 = Add (val_134, "transformer.encoder.layer.8.attention.self.key.bias")
val_135 = MatMul (layer_norm_16, val_58)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_48, linear_49, val_135, bitwise_and_1)
val_136 = MatMul (scaled_dot_product_attention_8, val_59)
linear_51 = Add (val_136, "transformer.encoder.layer.8.attention.output.dense.bias")
add_910 = Add (linear_51, layer_norm_16)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_910, "transformer.encoder.layer.8.attention.output.LayerNorm.weight", "transformer.encoder.layer.8.attention.output.LayerNorm.bias")
val_137 = MatMul (layer_norm_17, val_60)
linear_52 = Add (val_137, "transformer.encoder.layer.8.intermediate.dense.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_52)
val_138 = MatMul (gelu_8, val_61)
linear_53 = Add (val_138, "transformer.encoder.layer.8.output.dense.bias")
add_935 = Add (linear_53, layer_norm_17)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_935, "transformer.encoder.layer.8.output.LayerNorm.weight", "transformer.encoder.layer.8.output.LayerNorm.bias")
val_139 = MatMul (layer_norm_18, val_62)
linear_54 = Add (val_139, "transformer.encoder.layer.9.attention.self.query.bias")
val_140 = MatMul (layer_norm_18, val_63)
linear_55 = Add (val_140, "transformer.encoder.layer.9.attention.self.key.bias")
val_141 = MatMul (layer_norm_18, val_64)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_54, linear_55, val_141, bitwise_and_1)
val_142 = MatMul (scaled_dot_product_attention_9, val_65)
linear_57 = Add (val_142, "transformer.encoder.layer.9.attention.output.dense.bias")
add_1008 = Add (linear_57, layer_norm_18)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1008, "transformer.encoder.layer.9.attention.output.LayerNorm.weight", "transformer.encoder.layer.9.attention.output.LayerNorm.bias")
val_143 = MatMul (layer_norm_19, val_66)
linear_58 = Add (val_143, "transformer.encoder.layer.9.intermediate.dense.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_58)
val_144 = MatMul (gelu_9, val_67)
linear_59 = Add (val_144, "transformer.encoder.layer.9.output.dense.bias")
add_1033 = Add (linear_59, layer_norm_19)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1033, "transformer.encoder.layer.9.output.LayerNorm.weight", "transformer.encoder.layer.9.output.LayerNorm.bias")
val_145 = MatMul (layer_norm_20, val_68)
linear_60 = Add (val_145, "transformer.encoder.layer.10.attention.self.query.bias")
val_146 = MatMul (layer_norm_20, val_69)
linear_61 = Add (val_146, "transformer.encoder.layer.10.attention.self.key.bias")
val_147 = MatMul (layer_norm_20, val_70)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_60, linear_61, val_147, bitwise_and_1)
val_148 = MatMul (scaled_dot_product_attention_10, val_71)
linear_63 = Add (val_148, "transformer.encoder.layer.10.attention.output.dense.bias")
add_1106 = Add (linear_63, layer_norm_20)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1106, "transformer.encoder.layer.10.attention.output.LayerNorm.weight", "transformer.encoder.layer.10.attention.output.LayerNorm.bias")
val_149 = MatMul (layer_norm_21, val_72)
linear_64 = Add (val_149, "transformer.encoder.layer.10.intermediate.dense.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_64)
val_150 = MatMul (gelu_10, val_73)
linear_65 = Add (val_150, "transformer.encoder.layer.10.output.dense.bias")
add_1131 = Add (linear_65, layer_norm_21)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1131, "transformer.encoder.layer.10.output.LayerNorm.weight", "transformer.encoder.layer.10.output.LayerNorm.bias")
val_151 = MatMul (layer_norm_22, val_74)
linear_66 = Add (val_151, "transformer.encoder.layer.11.attention.self.query.bias")
val_152 = MatMul (layer_norm_22, val_75)
linear_67 = Add (val_152, "transformer.encoder.layer.11.attention.self.key.bias")
val_153 = MatMul (layer_norm_22, val_76)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_66, linear_67, val_153, bitwise_and_1)
val_154 = MatMul (scaled_dot_product_attention_11, val_77)
linear_69 = Add (val_154, "transformer.encoder.layer.11.attention.output.dense.bias")
add_1204 = Add (linear_69, layer_norm_22)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1204, "transformer.encoder.layer.11.attention.output.LayerNorm.weight", "transformer.encoder.layer.11.attention.output.LayerNorm.bias")
val_155 = MatMul (layer_norm_23, val_78)
linear_70 = Add (val_155, "transformer.encoder.layer.11.intermediate.dense.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_70)
val_156 = MatMul (gelu_11, val_79)
linear_71 = Add (val_156, "transformer.encoder.layer.11.output.dense.bias")
add_1229 = Add (linear_71, layer_norm_23)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-12, stash_type: int = 1> (add_1229, "transformer.encoder.layer.11.output.LayerNorm.weight", "transformer.encoder.layer.11.output.LayerNorm.bias")
unsqueeze_12 = Unsqueeze (attention_mask, val_3)
[node_convert_element_type_default] convert_element_type_default = Cast <to: int = 1> (unsqueeze_12)
mul_620 = Mul (layer_norm_24, convert_element_type_default)
sum_1 = ReduceSum <keepdims: int = 0, noop_with_empty_axes: int = 0> (mul_620, val_2)
val_157 = Cast <to: int = 1> (attention_mask)
val_158 = ReduceSum <keepdims: int = 0, noop_with_empty_axes: int = 0> (val_157, val_2)
convert_element_type_default_2 = Unsqueeze (val_158, val_2)
[node_div] div = Div (sum_1, convert_element_type_default_2)
linear_73 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (div, "LinearTransformation.weight", "LinearTransformation.bias")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_73, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
text_embedding = Div (linear_73, clamp_min)
}
weights:
LinearTransformation.bias FLOAT[768] a54976c3e660
LinearTransformation.weight FLOAT[768,768] c8db98dcd021
embedding_1 FLOAT[1,1,768] ceabaa797f68
embedding_2 FLOAT[1,77,768] f077ebfab804
transformer.embeddings.LayerNorm.bias FLOAT[768] 9b5239938385
transformer.embeddings.LayerNorm.weight FLOAT[768] 4463df812923
transformer.embeddings.word_embeddings.weight_fp16 FLOAT16[501153,768] a2e1483dda5d
transformer.encoder.layer.0.attention.output.LayerNorm.bias FLOAT[768] 8cb88ddbd66b
transformer.encoder.layer.0.attention.output.LayerNorm.weight FLOAT[768] 4b8bc583d78f
transformer.encoder.layer.0.attention.output.dense.bias FLOAT[768] 2a348b461167
transformer.encoder.layer.0.attention.self.key.bias FLOAT[768] ec8e7b8faf59
transformer.encoder.layer.0.attention.self.query.bias FLOAT[768] b4118cb99cf8
transformer.encoder.layer.0.intermediate.dense.bias FLOAT[3072] 72879c310b94
transformer.encoder.layer.0.output.LayerNorm.bias FLOAT[768] 65a007c6920c
transformer.encoder.layer.0.output.LayerNorm.weight FLOAT[768] 51c2b88df8a7
transformer.encoder.layer.0.output.dense.bias FLOAT[768] 09f59c91984c
transformer.encoder.layer.1.attention.output.LayerNorm.bias FLOAT[768] f4f335155e30
transformer.encoder.layer.1.attention.output.LayerNorm.weight FLOAT[768] 7a1d15182d02
transformer.encoder.layer.1.attention.output.dense.bias FLOAT[768] 41e8d3e5b18b
transformer.encoder.layer.1.attention.self.key.bias FLOAT[768] bd14696a7619
transformer.encoder.layer.1.attention.self.query.bias FLOAT[768] 0f5a299f20f3
transformer.encoder.layer.1.intermediate.dense.bias FLOAT[3072] 9f718b511d6a
transformer.encoder.layer.1.output.LayerNorm.bias FLOAT[768] 8ca17386eec7
transformer.encoder.layer.1.output.LayerNorm.weight FLOAT[768] 50ec41829cbc
transformer.encoder.layer.1.output.dense.bias FLOAT[768] d2edc41c2ad9
transformer.encoder.layer.10.attention.output.LayerNorm.bias FLOAT[768] 50ccc22cb959
transformer.encoder.layer.10.attention.output.LayerNorm.weight FLOAT[768] 20b898e63b7c
transformer.encoder.layer.10.attention.output.dense.bias FLOAT[768] 7b6a0cd8fc67
transformer.encoder.layer.10.attention.self.key.bias FLOAT[768] 7e8fd389d18f
transformer.encoder.layer.10.attention.self.query.bias FLOAT[768] 37e9a813d710
transformer.encoder.layer.10.intermediate.dense.bias FLOAT[3072] 6686753c9794
transformer.encoder.layer.10.output.LayerNorm.bias FLOAT[768] 95aad92b15de
transformer.encoder.layer.10.output.LayerNorm.weight FLOAT[768] cfe49e7af5f2
transformer.encoder.layer.10.output.dense.bias FLOAT[768] 611c09a727a4
transformer.encoder.layer.11.attention.output.LayerNorm.bias FLOAT[768] 585fb5b5dff2
transformer.encoder.layer.11.attention.output.LayerNorm.weight FLOAT[768] e54986a4b1b3
transformer.encoder.layer.11.attention.output.dense.bias FLOAT[768] f1caec1101f9
transformer.encoder.layer.11.attention.self.key.bias FLOAT[768] c7f74cbf89d1
transformer.encoder.layer.11.attention.self.query.bias FLOAT[768] 27c354de9d38
transformer.encoder.layer.11.intermediate.dense.bias FLOAT[3072] 999feffbf822
transformer.encoder.layer.11.output.LayerNorm.bias FLOAT[768] 84cec22061cd
transformer.encoder.layer.11.output.LayerNorm.weight FLOAT[768] f39f82c5ebe8
transformer.encoder.layer.11.output.dense.bias FLOAT[768] 6726a36c1ed4
transformer.encoder.layer.2.attention.output.LayerNorm.bias FLOAT[768] c6a0e8ab4b1d
transformer.encoder.layer.2.attention.output.LayerNorm.weight FLOAT[768] 420ee406e0d7
transformer.encoder.layer.2.attention.output.dense.bias FLOAT[768] ee667fcc5c67
transformer.encoder.layer.2.attention.self.key.bias FLOAT[768] adb9ba148c45
transformer.encoder.layer.2.attention.self.query.bias FLOAT[768] 18515c5b9695
transformer.encoder.layer.2.intermediate.dense.bias FLOAT[3072] be93d707fad1
transformer.encoder.layer.2.output.LayerNorm.bias FLOAT[768] 35de51d69ed4
transformer.encoder.layer.2.output.LayerNorm.weight FLOAT[768] 71b7d83f6185
transformer.encoder.layer.2.output.dense.bias FLOAT[768] 893ca7e4fc23
transformer.encoder.layer.3.attention.output.LayerNorm.bias FLOAT[768] 238c5478084d
transformer.encoder.layer.3.attention.output.LayerNorm.weight FLOAT[768] 676a5fe7a590
transformer.encoder.layer.3.attention.output.dense.bias FLOAT[768] 64d26b31ba21
transformer.encoder.layer.3.attention.self.key.bias FLOAT[768] 150d8a28d726
transformer.encoder.layer.3.attention.self.query.bias FLOAT[768] 77024d900301
transformer.encoder.layer.3.intermediate.dense.bias FLOAT[3072] 26a1b33a2f03
transformer.encoder.layer.3.output.LayerNorm.bias FLOAT[768] 8f8914137b4c
transformer.encoder.layer.3.output.LayerNorm.weight FLOAT[768] 88379f8668df
transformer.encoder.layer.3.output.dense.bias FLOAT[768] 5ffd98a20d9a
transformer.encoder.layer.4.attention.output.LayerNorm.bias FLOAT[768] c8f0bec42c50
transformer.encoder.layer.4.attention.output.LayerNorm.weight FLOAT[768] c7929f939f05
transformer.encoder.layer.4.attention.output.dense.bias FLOAT[768] 194649f1c828
transformer.encoder.layer.4.attention.self.key.bias FLOAT[768] 396bf8165473
transformer.encoder.layer.4.attention.self.query.bias FLOAT[768] 1170e9fef077
transformer.encoder.layer.4.intermediate.dense.bias FLOAT[3072] 9f3b55037a52
transformer.encoder.layer.4.output.LayerNorm.bias FLOAT[768] ada5eeb4dc50
transformer.encoder.layer.4.output.LayerNorm.weight FLOAT[768] ed0abf70d601
transformer.encoder.layer.4.output.dense.bias FLOAT[768] a1ee7b662976
transformer.encoder.layer.5.attention.output.LayerNorm.bias FLOAT[768] 6ce46566e629
transformer.encoder.layer.5.attention.output.LayerNorm.weight FLOAT[768] aea2daa87763
transformer.encoder.layer.5.attention.output.dense.bias FLOAT[768] c98d1ad5cb45
transformer.encoder.layer.5.attention.self.key.bias FLOAT[768] 066610fc23d7
transformer.encoder.layer.5.attention.self.query.bias FLOAT[768] d39df304534e
transformer.encoder.layer.5.intermediate.dense.bias FLOAT[3072] 5718c358947f
transformer.encoder.layer.5.output.LayerNorm.bias FLOAT[768] 4aa05b4c1e93
transformer.encoder.layer.5.output.LayerNorm.weight FLOAT[768] 3602cf92b650
transformer.encoder.layer.5.output.dense.bias FLOAT[768] 8ffa213a8127
transformer.encoder.layer.6.attention.output.LayerNorm.bias FLOAT[768] 8735ae81cd24
transformer.encoder.layer.6.attention.output.LayerNorm.weight FLOAT[768] 99d4cb15053a
transformer.encoder.layer.6.attention.output.dense.bias FLOAT[768] 4341136f43af
transformer.encoder.layer.6.attention.self.key.bias FLOAT[768] 730c7acd4dad
transformer.encoder.layer.6.attention.self.query.bias FLOAT[768] c89df2062367
transformer.encoder.layer.6.intermediate.dense.bias FLOAT[3072] 48deebdc55fe
transformer.encoder.layer.6.output.LayerNorm.bias FLOAT[768] 44d4c0398d41
transformer.encoder.layer.6.output.LayerNorm.weight FLOAT[768] 2170f44592ad
transformer.encoder.layer.6.output.dense.bias FLOAT[768] c1e084f394dd
transformer.encoder.layer.7.attention.output.LayerNorm.bias FLOAT[768] 3e64331f045b
transformer.encoder.layer.7.attention.output.LayerNorm.weight FLOAT[768] aabd8762628e
transformer.encoder.layer.7.attention.output.dense.bias FLOAT[768] 0ad915b1fd28
transformer.encoder.layer.7.attention.self.key.bias FLOAT[768] f0c952b320c0
transformer.encoder.layer.7.attention.self.query.bias FLOAT[768] 9595f729b23a
transformer.encoder.layer.7.intermediate.dense.bias FLOAT[3072] 67299c94dc82
transformer.encoder.layer.7.output.LayerNorm.bias FLOAT[768] 07b33c05dc03
transformer.encoder.layer.7.output.LayerNorm.weight FLOAT[768] 95defac0b480
transformer.encoder.layer.7.output.dense.bias FLOAT[768] 521559b1d2bb
transformer.encoder.layer.8.attention.output.LayerNorm.bias FLOAT[768] d64447965a7a
transformer.encoder.layer.8.attention.output.LayerNorm.weight FLOAT[768] c09329fadd86
transformer.encoder.layer.8.attention.output.dense.bias FLOAT[768] b0206c87ed43
transformer.encoder.layer.8.attention.self.key.bias FLOAT[768] 8134f412d205
transformer.encoder.layer.8.attention.self.query.bias FLOAT[768] a1d15204e139
transformer.encoder.layer.8.intermediate.dense.bias FLOAT[3072] becd40562a49
transformer.encoder.layer.8.output.LayerNorm.bias FLOAT[768] b14f88fe1ada
transformer.encoder.layer.8.output.LayerNorm.weight FLOAT[768] 6f7c15a9c199
transformer.encoder.layer.8.output.dense.bias FLOAT[768] 26e872e931a2
transformer.encoder.layer.9.attention.output.LayerNorm.bias FLOAT[768] 0308d500b354
transformer.encoder.layer.9.attention.output.LayerNorm.weight FLOAT[768] 8bd6ed07649c
transformer.encoder.layer.9.attention.output.dense.bias FLOAT[768] 454f1556a730
transformer.encoder.layer.9.attention.self.key.bias FLOAT[768] 7aa4256d1822
transformer.encoder.layer.9.attention.self.query.bias FLOAT[768] 75615a97ed05
transformer.encoder.layer.9.intermediate.dense.bias FLOAT[3072] 7739f2ec19f4
transformer.encoder.layer.9.output.LayerNorm.bias FLOAT[768] 9bb78011f5eb
transformer.encoder.layer.9.output.LayerNorm.weight FLOAT[768] 0d164d0c9b46
transformer.encoder.layer.9.output.dense.bias FLOAT[768] 59b1fe21ad10
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,768] dc51669539ec
val_11 FLOAT[768,768] 6b4db1547204
val_12 FLOAT[768,3072] 94c731afa60d
val_13 FLOAT[3072,768] ec0c89ec42f3
val_14 FLOAT[768,768] 4e7020ba8705
val_15 FLOAT[768,768] 84198695e160
val_16 FLOAT[768,768] 769b1a4f755e
val_17 FLOAT[768,768] 07ef48fa126f
val_18 FLOAT[768,3072] 560dbac7e928
val_19 FLOAT[3072,768] 8c4bb6a1ddf5
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,768] 8acb955950ec
val_21 FLOAT[768,768] ec1d3ab9be90
val_22 FLOAT[768,768] 474badf4435f
val_23 FLOAT[768,768] fcfa4f7c31fc
val_24 FLOAT[768,3072] c2f429bbe8ac
val_25 FLOAT[3072,768] 755e0d0205dc
val_26 FLOAT[768,768] df5def83bb9a
val_27 FLOAT[768,768] d29b3cb6a98d
val_28 FLOAT[768,768] 9de308fdc2b7
val_29 FLOAT[768,768] 5475e5f5cf70
val_3 INT64[1] d86e8112f3c4
val_30 FLOAT[768,3072] fe6eb476b5a5
val_31 FLOAT[3072,768] d4d4831c8eab
val_32 FLOAT[768,768] 404c5f418cb2
val_33 FLOAT[768,768] 988f2ab53122
val_34 FLOAT[768,768] 18b2329bda74
val_35 FLOAT[768,768] 145be2eabecb
val_36 FLOAT[768,3072] 4f77d8182460
val_37 FLOAT[3072,768] ecd96561e0c3
val_38 FLOAT[768,768] 0ff99e5c6a7e
val_39 FLOAT[768,768] 93feb1a36b4c
val_4 FLOAT[] e00e5eb94441
val_40 FLOAT[768,768] a0be98ea04cc
val_41 FLOAT[768,768] 18cac241bc7e
val_42 FLOAT[768,3072] 7ba761d7e4ad
val_43 FLOAT[3072,768] e21044a369f7
val_44 FLOAT[768,768] 66ff0828aac2
val_45 FLOAT[768,768] 00ac8b950d31
val_46 FLOAT[768,768] 85148676f612
val_47 FLOAT[768,768] 7ea0dc6ee333
val_48 FLOAT[768,3072] 7315f5b7cc8d
val_49 FLOAT[3072,768] 95cb8269aa9b
val_5 FLOAT[] e401200e5808
val_50 FLOAT[768,768] 2db9c3b76325
val_51 FLOAT[768,768] ee00a79a4c49
val_52 FLOAT[768,768] 4a2c4b88ab59
val_53 FLOAT[768,768] 6146ca0813d7
val_54 FLOAT[768,3072] 7013a7ce30ac
val_55 FLOAT[3072,768] c6b13e6034c1
val_56 FLOAT[768,768] 100319279ac8
val_57 FLOAT[768,768] eb2edc5d6a26
val_58 FLOAT[768,768] 0d9e74347b8b
val_59 FLOAT[768,768] 07f2f1346dff
val_6 INT64[2] 0c730b69905c
val_60 FLOAT[768,3072] 436475190aef
val_61 FLOAT[3072,768] 208f19ed01af
val_62 FLOAT[768,768] 581dc4a7d185
val_63 FLOAT[768,768] fb058321f506
val_64 FLOAT[768,768] 37a7a34911ad
val_65 FLOAT[768,768] a95d35e1e358
val_66 FLOAT[768,3072] 8bd76acb7d14
val_67 FLOAT[3072,768] b6f4d1bfd769
val_68 FLOAT[768,768] 718faa41fb59
val_69 FLOAT[768,768] 7351e2f40432
val_7 FLOAT[77,1] 9575b2125169
val_70 FLOAT[768,768] 5475d4326e93
val_71 FLOAT[768,768] 19146945d88b
val_72 FLOAT[768,3072] d0e8b7a9dbf6
val_73 FLOAT[3072,768] 40013d7a3fa8
val_74 FLOAT[768,768] 5dc83ee78105
val_75 FLOAT[768,768] 3adc89f64099
val_76 FLOAT[768,768] b30dc3f61594
val_77 FLOAT[768,768] 1ee76758b41a
val_78 FLOAT[768,3072] adf8cb03e4e3
val_79 FLOAT[3072,768] 8b366e101e4a
val_8 FLOAT[768,768] eb3cf99b9ef3
val_9 FLOAT[768,768] 2a3777632125
File diff suppressed because it is too large Load Diff
+625
View File
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,512] add_1012
float[batch,77,512] add_1127
float[batch,77,512] add_1156
float[batch,77,512] add_119
float[batch,77,512] add_1271
float[batch,77,512] add_1300
float[batch,77,512] add_1415
float[batch,77,512] add_1444
float[batch,77,512] add_148
float[batch,77,512] add_1559
float[batch,77,512] add_1588
float[batch,1,512] add_1588_pooled
float[batch,1,512] add_1703
float[batch,1,512] add_1732
float[batch,77,512] add_263
float[batch,77,512] add_292
float[batch,77,512] add_4
float[batch,77,512] add_407
float[batch,77,512] add_436
float[batch,77,512] add_551
float[batch,77,512] add_580
float[batch,77,512] add_695
float[batch,77,512] add_724
float[batch,77,512] add_839
float[batch,77,512] add_868
float[batch,77,512] add_983
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,512] matmul
float[batch,77,2048] mul_101
float[batch,77,2048] mul_106
float[batch,77,2048] mul_1064
float[batch,77,2048] mul_1069
float[batch,77,2048] mul_1171
float[batch,77,2048] mul_1176
float[batch,1,2048] mul_1278
float[batch,1,2048] mul_1283
float[batch,77,2048] mul_208
float[batch,77,2048] mul_213
float[batch,77,2048] mul_315
float[batch,77,2048] mul_320
float[batch,77,2048] mul_422
float[batch,77,2048] mul_427
float[batch,77,2048] mul_529
float[batch,77,2048] mul_534
float[batch,77,2048] mul_636
float[batch,77,2048] mul_641
float[batch,77,2048] mul_743
float[batch,77,2048] mul_748
float[batch,77,2048] mul_850
float[batch,77,2048] mul_855
float[batch,77,2048] mul_957
float[batch,77,2048] mul_962
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] sigmoid
float[batch,77,2048] sigmoid_1
float[batch,77,2048] sigmoid_10
float[batch,1,2048] sigmoid_11
float[batch,77,2048] sigmoid_2
float[batch,77,2048] sigmoid_3
float[batch,77,2048] sigmoid_4
float[batch,77,2048] sigmoid_5
float[batch,77,2048] sigmoid_6
float[batch,77,2048] sigmoid_7
float[batch,77,2048] sigmoid_8
float[batch,77,2048] sigmoid_9
float[batch,77,2048] val_40
float[batch,77,512] val_41
float[batch,77,2048] val_42
float[batch,77,512] val_43
float[batch,77,2048] val_44
float[batch,77,512] val_45
float[batch,77,2048] val_46
float[batch,77,512] val_47
float[batch,77,2048] val_48
float[batch,77,512] val_49
float[batch,77,2048] val_50
float[batch,77,512] val_51
float[batch,77,2048] val_52
float[batch,77,512] val_53
float[batch,77,2048] val_54
float[batch,77,512] val_55
float[batch,77,2048] val_56
float[batch,77,512] val_57
float[batch,77,2048] val_58
float[batch,77,512] val_59
float[batch,77,2048] val_60
float[batch,77,512] val_61
float[batch,77] val_62
float[batch,1,77] val_63
float[batch,1,2048] val_64
float[batch,1,512] val_65
float[batch,1,512] val_66
float[batch,512] val_67
>
{
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_39)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_40 = MatMul (layer_norm_1, val_4)
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
mul_101 = Mul (linear_2, val_2)
[node_sigmoid] sigmoid = Sigmoid (mul_101)
mul_106 = Mul (linear_2, sigmoid)
val_41 = MatMul (mul_106, val_5)
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
add_148 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_42 = MatMul (layer_norm_3, val_7)
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
mul_208 = Mul (linear_6, val_2)
sigmoid_1 = Sigmoid (mul_208)
mul_213 = Mul (linear_6, sigmoid_1)
val_43 = MatMul (mul_213, val_8)
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
add_292 = Add (add_263, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_44 = MatMul (layer_norm_5, val_10)
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
mul_315 = Mul (linear_10, val_2)
sigmoid_2 = Sigmoid (mul_315)
mul_320 = Mul (linear_10, sigmoid_2)
val_45 = MatMul (mul_320, val_11)
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
add_436 = Add (add_407, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_46 = MatMul (layer_norm_7, val_13)
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
mul_422 = Mul (linear_14, val_2)
sigmoid_3 = Sigmoid (mul_422)
mul_427 = Mul (linear_14, sigmoid_3)
val_47 = MatMul (mul_427, val_14)
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
add_580 = Add (add_551, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_48 = MatMul (layer_norm_9, val_16)
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
mul_529 = Mul (linear_18, val_2)
sigmoid_4 = Sigmoid (mul_529)
mul_534 = Mul (linear_18, sigmoid_4)
val_49 = MatMul (mul_534, val_17)
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
add_724 = Add (add_695, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_50 = MatMul (layer_norm_11, val_19)
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
mul_636 = Mul (linear_22, val_2)
sigmoid_5 = Sigmoid (mul_636)
mul_641 = Mul (linear_22, sigmoid_5)
val_51 = MatMul (mul_641, val_20)
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
add_868 = Add (add_839, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_52 = MatMul (layer_norm_13, val_22)
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
mul_743 = Mul (linear_26, val_2)
sigmoid_6 = Sigmoid (mul_743)
mul_748 = Mul (linear_26, sigmoid_6)
val_53 = MatMul (mul_748, val_23)
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
add_1012 = Add (add_983, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_54 = MatMul (layer_norm_15, val_25)
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
mul_850 = Mul (linear_30, val_2)
sigmoid_7 = Sigmoid (mul_850)
mul_855 = Mul (linear_30, sigmoid_7)
val_55 = MatMul (mul_855, val_26)
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
add_1156 = Add (add_1127, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_56 = MatMul (layer_norm_17, val_28)
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
mul_957 = Mul (linear_34, val_2)
sigmoid_8 = Sigmoid (mul_957)
mul_962 = Mul (linear_34, sigmoid_8)
val_57 = MatMul (mul_962, val_29)
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
add_1300 = Add (add_1271, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_58 = MatMul (layer_norm_19, val_31)
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
mul_1064 = Mul (linear_38, val_2)
sigmoid_9 = Sigmoid (mul_1064)
mul_1069 = Mul (linear_38, sigmoid_9)
val_59 = MatMul (mul_1069, val_32)
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
add_1444 = Add (add_1415, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_60 = MatMul (layer_norm_21, val_34)
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
mul_1171 = Mul (linear_42, val_2)
sigmoid_10 = Sigmoid (mul_1171)
mul_1176 = Mul (linear_42, sigmoid_10)
val_61 = MatMul (mul_1176, val_35)
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
add_1588 = Add (add_1559, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
val_63 = Unsqueeze (val_62, val_756_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_64 = MatMul (layer_norm_23, val_37)
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
mul_1278 = Mul (linear_46, val_2)
sigmoid_11 = Sigmoid (mul_1278)
mul_1283 = Mul (linear_46, sigmoid_11)
val_65 = MatMul (mul_1283, val_38)
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
add_1732 = Add (add_1703, linear_47)
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
val_67 = Squeeze (val_66, val_756_axes1)
[node_matmul] matmul = MatMul (val_67, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] f173f61cad24
ln_final.weight FLOAT[512] e7a7d8e8f82b
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] d30a74061332
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] f01cf8e6542d
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] b5da25f5c318
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 80aba553f05a
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 992e261dc66b
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] a5c753f14e96
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] e83f68ed2703
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 15fd5148edf9
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] a9764976c9cc
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 2c8c94a5d6f4
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 9e13e70f74e1
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 45ba6b345d72
positional_embedding FLOAT[77,512] d3bc2b064352
text_projection FLOAT[512,512] c1977bd62e40
token_embedding.weight_fp16 FLOAT16[49408,512] bb41a98127d8
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] f48887f36416
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] 178385ebbe75
transformer.resblocks.0.ln_1.bias FLOAT[512] ce241c434ffc
transformer.resblocks.0.ln_1.weight FLOAT[512] f9c12781f8b4
transformer.resblocks.0.ln_2.bias FLOAT[512] 2421c70491c2
transformer.resblocks.0.ln_2.weight FLOAT[512] 3c79fe829f2e
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 0c8634b6c746
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] dc05c9c36ff8
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 48335defed0b
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 3f7505d3df46
transformer.resblocks.1.ln_1.bias FLOAT[512] a53bd529b84a
transformer.resblocks.1.ln_1.weight FLOAT[512] ca35ec4bf2da
transformer.resblocks.1.ln_2.bias FLOAT[512] 772afead8a31
transformer.resblocks.1.ln_2.weight FLOAT[512] 7bc50ea32f7a
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 9691279240e4
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] 510a3cf7932a
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] e51aa8c7d351
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 73b6ec9e91f4
transformer.resblocks.10.ln_1.bias FLOAT[512] eaad0d4300e7
transformer.resblocks.10.ln_1.weight FLOAT[512] cd77a219520c
transformer.resblocks.10.ln_2.bias FLOAT[512] c43b16a230f6
transformer.resblocks.10.ln_2.weight FLOAT[512] 8ec19003808f
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 3b1ba96a3ca1
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 014078edeb2b
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] cffa2e90539f
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] e6bcde1fdb65
transformer.resblocks.11.ln_1.bias FLOAT[512] c1c786504db7
transformer.resblocks.11.ln_1.weight FLOAT[512] 4b78d9f9f254
transformer.resblocks.11.ln_2.bias FLOAT[512] 15ef76f743f8
transformer.resblocks.11.ln_2.weight FLOAT[512] c9f130c9b95c
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] bb69e456cf6a
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] ba5f47e9df05
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 89c8b08dc3f7
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 0d5df080f174
transformer.resblocks.2.ln_1.bias FLOAT[512] 00a8eaff7470
transformer.resblocks.2.ln_1.weight FLOAT[512] a4d72070a344
transformer.resblocks.2.ln_2.bias FLOAT[512] f0dd20576629
transformer.resblocks.2.ln_2.weight FLOAT[512] 6c710234e471
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] fe09c34aa4f6
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 0de17059eef9
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 9c98d781f0e3
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 64d05b7ea9db
transformer.resblocks.3.ln_1.bias FLOAT[512] e80bd9c1d859
transformer.resblocks.3.ln_1.weight FLOAT[512] cfccef898078
transformer.resblocks.3.ln_2.bias FLOAT[512] 511fc0dacd0c
transformer.resblocks.3.ln_2.weight FLOAT[512] e0b370b08d85
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] 79832c4cb971
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] acaa4db18315
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] a31086b2e062
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 9cc4d8d9d261
transformer.resblocks.4.ln_1.bias FLOAT[512] c1dc753ff5d5
transformer.resblocks.4.ln_1.weight FLOAT[512] 1d3972029283
transformer.resblocks.4.ln_2.bias FLOAT[512] 5bac05cb1775
transformer.resblocks.4.ln_2.weight FLOAT[512] f0719f4b99ff
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 20caf2b8fa67
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 2bedff1aa3c5
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 1ffbf1bd32e2
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 2a4cf9482a28
transformer.resblocks.5.ln_1.bias FLOAT[512] 57199e0a02d2
transformer.resblocks.5.ln_1.weight FLOAT[512] 5104f4029294
transformer.resblocks.5.ln_2.bias FLOAT[512] 30f72c31a612
transformer.resblocks.5.ln_2.weight FLOAT[512] f3d14782939d
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] e96ccd76dbae
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] ae97654dac34
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 60abe019789b
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 80bf14875655
transformer.resblocks.6.ln_1.bias FLOAT[512] 5d16fdcf3935
transformer.resblocks.6.ln_1.weight FLOAT[512] eb504b415069
transformer.resblocks.6.ln_2.bias FLOAT[512] 0f0d463444c5
transformer.resblocks.6.ln_2.weight FLOAT[512] 827ea9216744
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] b3d06570efcc
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] f9e4530f9b4e
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] fe09d339e6c4
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] ab4d455924c4
transformer.resblocks.7.ln_1.bias FLOAT[512] 30044f31b4b2
transformer.resblocks.7.ln_1.weight FLOAT[512] a129c2736641
transformer.resblocks.7.ln_2.bias FLOAT[512] 0e6afc34e50e
transformer.resblocks.7.ln_2.weight FLOAT[512] 5a76c14bb07b
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 4c9a52b8b06a
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 9384c4454978
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] e05802dd9873
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 12a49a952111
transformer.resblocks.8.ln_1.bias FLOAT[512] 0d2b12e3cbc1
transformer.resblocks.8.ln_1.weight FLOAT[512] ded4665e1996
transformer.resblocks.8.ln_2.bias FLOAT[512] f1fc312cb5b8
transformer.resblocks.8.ln_2.weight FLOAT[512] d759939bd64f
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 03945a486d31
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 30d12dfc9fb2
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 59ab4218f5f5
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] c4849c975d1d
transformer.resblocks.9.ln_1.bias FLOAT[512] cc7abd276c78
transformer.resblocks.9.ln_1.weight FLOAT[512] 3536bf0becd2
transformer.resblocks.9.ln_2.bias FLOAT[512] 4e16b2b5aad8
transformer.resblocks.9.ln_2.weight FLOAT[512] b88982167009
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] b4b757f5dd73
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 10df9a17e342
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[512,2048] 5d8101895e1f
val_11 FLOAT[2048,512] 0c31db53c77e
val_12 FLOAT[512,1536] e9634a433916
val_13 FLOAT[512,2048] ad9938d20e5b
val_14 FLOAT[2048,512] 19e753b1f278
val_15 FLOAT[512,1536] c9439a6f9523
val_16 FLOAT[512,2048] 680928a3bf80
val_17 FLOAT[2048,512] d205e352fb87
val_18 FLOAT[512,1536] 601a5e8d41cf
val_19 FLOAT[512,2048] adce3c25adba
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[2048,512] 665890114d57
val_21 FLOAT[512,1536] f3bbad119083
val_22 FLOAT[512,2048] d68d4d39d6d4
val_23 FLOAT[2048,512] 00a33dd02b37
val_24 FLOAT[512,1536] db213e402035
val_25 FLOAT[512,2048] 0c259e2b5bc8
val_26 FLOAT[2048,512] a5886985c61e
val_27 FLOAT[512,1536] 077a05f550b1
val_28 FLOAT[512,2048] 6c01feacab94
val_29 FLOAT[2048,512] b2b7d4450f81
val_3 FLOAT[512,1536] f4daf3a48124
val_30 FLOAT[512,1536] 0193edb65769
val_31 FLOAT[512,2048] 0f5553c9df56
val_32 FLOAT[2048,512] 847e30f5298e
val_33 FLOAT[512,1536] 3ece1f9adcdc
val_34 FLOAT[512,2048] cd0d88ef07d6
val_35 FLOAT[2048,512] 057488ada746
val_36 FLOAT[512,1536] eb7327436e92
val_37 FLOAT[512,2048] fe43f34ef732
val_38 FLOAT[2048,512] 9fb9fcfac016
val_4 FLOAT[512,2048] 64ec3fe6b6a1
val_5 FLOAT[2048,512] a02ae135104f
val_6 FLOAT[512,1536] e3463b8fbe67
val_7 FLOAT[512,2048] b5d30e877f5b
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[2048,512] c4805e8a5b81
val_9 FLOAT[512,1536] 000901cf4f94
+810
View File
@@ -0,0 +1,810 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,1024,14,14] add_1016
float[batch,1024,14,14] add_1092
float[batch,1024,14,14] add_1168
float[batch,1024,14,14] add_1244
float[batch,1024,14,14] add_1320
float[batch,1024,14,14] add_1396
float[batch,256,56,56] add_140
float[batch,1024,14,14] add_1472
float[batch,1024,14,14] add_1548
float[batch,1024,14,14] add_1624
float[batch,1024,14,14] add_1700
float[batch,1024,14,14] add_1776
float[batch,1024,14,14] add_1852
float[batch,1024,14,14] add_1928
float[batch,1024,14,14] add_2004
float[batch,1024,14,14] add_2080
float[batch,1024,14,14] add_2156
float[batch,256,56,56] add_216
float[batch,1024,14,14] add_2232
float[batch,1024,14,14] add_2308
float[batch,1024,14,14] add_2384
float[batch,2048,7,7] add_2480
float[batch,2048,7,7] add_2556
float[batch,2048,7,7] add_2632
float[50,batch,2048] add_2662
float[batch,256,56,56] add_292
float[batch,512,28,28] add_388
float[batch,512,28,28] add_464
float[batch,512,28,28] add_540
float[batch,512,28,28] add_616
float[batch,1024,14,14] add_712
float[batch,1024,14,14] add_788
float[batch,1024,14,14] add_864
float[batch,1024,14,14] add_940
float[batch,64,56,56] avg_pool2d
float[batch,128,28,28] avg_pool2d_2
float[batch,256,28,28] avg_pool2d_3
float[batch,256,14,14] avg_pool2d_4
float[batch,512,14,14] avg_pool2d_5
float[batch,512,7,7] avg_pool2d_6
float[batch,1024,7,7] avg_pool2d_7
float[50,batch,2048] cat
float[batch,1] clamp_min
float[batch,32,112,112] getitem
float[batch,256,14,14] getitem_102
float[batch,1024,14,14] getitem_105
float[batch,256,14,14] getitem_108
float[batch,256,14,14] getitem_111
float[batch,1024,14,14] getitem_114
float[batch,256,14,14] getitem_117
float[batch,64,56,56] getitem_12
float[batch,256,14,14] getitem_120
float[batch,1024,14,14] getitem_123
float[batch,256,14,14] getitem_126
float[batch,256,14,14] getitem_129
float[batch,1024,14,14] getitem_132
float[batch,256,14,14] getitem_135
float[batch,256,14,14] getitem_138
float[batch,1024,14,14] getitem_141
float[batch,256,14,14] getitem_144
float[batch,256,14,14] getitem_147
float[batch,256,56,56] getitem_15
float[batch,1024,14,14] getitem_150
float[batch,256,14,14] getitem_153
float[batch,256,14,14] getitem_156
float[batch,1024,14,14] getitem_159
float[batch,256,14,14] getitem_162
float[batch,256,14,14] getitem_165
float[batch,1024,14,14] getitem_168
float[batch,256,14,14] getitem_171
float[batch,256,14,14] getitem_174
float[batch,1024,14,14] getitem_177
float[batch,256,56,56] getitem_18
float[batch,256,14,14] getitem_180
float[batch,256,14,14] getitem_183
float[batch,1024,14,14] getitem_186
float[batch,256,14,14] getitem_189
float[batch,256,14,14] getitem_192
float[batch,1024,14,14] getitem_195
float[batch,256,14,14] getitem_198
float[batch,256,14,14] getitem_201
float[batch,1024,14,14] getitem_204
float[batch,256,14,14] getitem_207
float[batch,64,56,56] getitem_21
float[batch,256,14,14] getitem_210
float[batch,1024,14,14] getitem_213
float[batch,256,14,14] getitem_216
float[batch,256,14,14] getitem_219
float[batch,1024,14,14] getitem_222
float[batch,256,14,14] getitem_225
float[batch,256,14,14] getitem_228
float[batch,1024,14,14] getitem_231
float[batch,256,14,14] getitem_234
float[batch,256,14,14] getitem_237
float[batch,64,56,56] getitem_24
float[batch,1024,14,14] getitem_240
float[batch,256,14,14] getitem_243
float[batch,256,14,14] getitem_246
float[batch,1024,14,14] getitem_249
float[batch,256,14,14] getitem_252
float[batch,256,14,14] getitem_255
float[batch,1024,14,14] getitem_258
float[batch,256,14,14] getitem_261
float[batch,256,14,14] getitem_264
float[batch,1024,14,14] getitem_267
float[batch,256,56,56] getitem_27
float[batch,256,14,14] getitem_270
float[batch,256,14,14] getitem_273
float[batch,1024,14,14] getitem_276
float[batch,256,14,14] getitem_279
float[batch,256,14,14] getitem_282
float[batch,1024,14,14] getitem_285
float[batch,512,14,14] getitem_288
float[batch,512,14,14] getitem_291
float[batch,2048,7,7] getitem_294
float[batch,2048,7,7] getitem_297
float[batch,32,112,112] getitem_3
float[batch,64,56,56] getitem_30
float[batch,512,7,7] getitem_300
float[batch,512,7,7] getitem_303
float[batch,2048,7,7] getitem_306
float[batch,512,7,7] getitem_309
float[batch,512,7,7] getitem_312
float[batch,2048,7,7] getitem_315
float[batch,64,56,56] getitem_33
float[batch,256,56,56] getitem_36
float[batch,128,56,56] getitem_39
float[batch,128,56,56] getitem_42
float[batch,512,28,28] getitem_45
float[batch,512,28,28] getitem_48
float[batch,128,28,28] getitem_51
float[batch,128,28,28] getitem_54
float[batch,512,28,28] getitem_57
float[batch,64,112,112] getitem_6
float[batch,128,28,28] getitem_60
float[batch,128,28,28] getitem_63
float[batch,512,28,28] getitem_66
float[batch,128,28,28] getitem_69
float[batch,128,28,28] getitem_72
float[batch,512,28,28] getitem_75
float[batch,256,28,28] getitem_78
float[batch,256,28,28] getitem_81
float[batch,1024,14,14] getitem_84
float[batch,1024,14,14] getitem_87
float[batch,64,56,56] getitem_9
float[batch,256,14,14] getitem_90
float[batch,256,14,14] getitem_93
float[batch,1024,14,14] getitem_96
float[batch,256,14,14] getitem_99
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,224,224,3] image_shifted
float[batch,1] linalg_vector_norm
float[1,batch,2048] linear
float[50,batch,2048] linear_1
float[50,batch,2048] linear_2
float[batch,512] linear_3
float[1,batch,2048] mean
float[1,batch,2048] node_scaled_dot_product_attention_q_row
float[49,batch,2048] permute_1
float[1,batch,32,64] permute_2
float[batch,32,112,112] relu
float[batch,32,112,112] relu_1
float[batch,64,56,56] relu_10
float[batch,512,7,7] relu_100
float[batch,2048,7,7] relu_101
float[batch,256,56,56] relu_11
float[batch,128,56,56] relu_12
float[batch,128,56,56] relu_13
float[batch,512,28,28] relu_14
float[batch,128,28,28] relu_15
float[batch,128,28,28] relu_16
float[batch,512,28,28] relu_17
float[batch,128,28,28] relu_18
float[batch,128,28,28] relu_19
float[batch,64,112,112] relu_2
float[batch,512,28,28] relu_20
float[batch,128,28,28] relu_21
float[batch,128,28,28] relu_22
float[batch,512,28,28] relu_23
float[batch,256,28,28] relu_24
float[batch,256,28,28] relu_25
float[batch,1024,14,14] relu_26
float[batch,256,14,14] relu_27
float[batch,256,14,14] relu_28
float[batch,1024,14,14] relu_29
float[batch,64,56,56] relu_3
float[batch,256,14,14] relu_30
float[batch,256,14,14] relu_31
float[batch,1024,14,14] relu_32
float[batch,256,14,14] relu_33
float[batch,256,14,14] relu_34
float[batch,1024,14,14] relu_35
float[batch,256,14,14] relu_36
float[batch,256,14,14] relu_37
float[batch,1024,14,14] relu_38
float[batch,256,14,14] relu_39
float[batch,64,56,56] relu_4
float[batch,256,14,14] relu_40
float[batch,1024,14,14] relu_41
float[batch,256,14,14] relu_42
float[batch,256,14,14] relu_43
float[batch,1024,14,14] relu_44
float[batch,256,14,14] relu_45
float[batch,256,14,14] relu_46
float[batch,1024,14,14] relu_47
float[batch,256,14,14] relu_48
float[batch,256,14,14] relu_49
float[batch,256,56,56] relu_5
float[batch,1024,14,14] relu_50
float[batch,256,14,14] relu_51
float[batch,256,14,14] relu_52
float[batch,1024,14,14] relu_53
float[batch,256,14,14] relu_54
float[batch,256,14,14] relu_55
float[batch,1024,14,14] relu_56
float[batch,256,14,14] relu_57
float[batch,256,14,14] relu_58
float[batch,1024,14,14] relu_59
float[batch,64,56,56] relu_6
float[batch,256,14,14] relu_60
float[batch,256,14,14] relu_61
float[batch,1024,14,14] relu_62
float[batch,256,14,14] relu_63
float[batch,256,14,14] relu_64
float[batch,1024,14,14] relu_65
float[batch,256,14,14] relu_66
float[batch,256,14,14] relu_67
float[batch,1024,14,14] relu_68
float[batch,256,14,14] relu_69
float[batch,64,56,56] relu_7
float[batch,256,14,14] relu_70
float[batch,1024,14,14] relu_71
float[batch,256,14,14] relu_72
float[batch,256,14,14] relu_73
float[batch,1024,14,14] relu_74
float[batch,256,14,14] relu_75
float[batch,256,14,14] relu_76
float[batch,1024,14,14] relu_77
float[batch,256,14,14] relu_78
float[batch,256,14,14] relu_79
float[batch,256,56,56] relu_8
float[batch,1024,14,14] relu_80
float[batch,256,14,14] relu_81
float[batch,256,14,14] relu_82
float[batch,1024,14,14] relu_83
float[batch,256,14,14] relu_84
float[batch,256,14,14] relu_85
float[batch,1024,14,14] relu_86
float[batch,256,14,14] relu_87
float[batch,256,14,14] relu_88
float[batch,1024,14,14] relu_89
float[batch,64,56,56] relu_9
float[batch,256,14,14] relu_90
float[batch,256,14,14] relu_91
float[batch,1024,14,14] relu_92
float[batch,512,14,14] relu_93
float[batch,512,14,14] relu_94
float[batch,2048,7,7] relu_95
float[batch,512,7,7] relu_96
float[batch,512,7,7] relu_97
float[batch,2048,7,7] relu_98
float[batch,512,7,7] relu_99
float[batch,32,1,64] scaled_dot_product_attention
float[batch,512] select
float[2048] split_split_0
float[2048] split_split_1
float[2048] split_split_2
float[unk__1,1,64] transpose
float[unk__1,50,64] transpose_1
float[unk__1,50,64] transpose_2
float[50,1,2048] unsqueeze
float[1,batch,2048] val_7
float[50,batch,2048] val_8
float[50,batch,2048] val_9
float[1,batch,512] view_10
float[batch,2048,49] view_2
float[1,unk__1,64] view_3
float[50,unk__1,64] view_4
float[50,unk__1,64] view_5
float[batch,32,1,64] view_6
float[batch,32,50,64] view_7
float[batch,32,50,64] view_8
float[batch,2048] view_9
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_shift] image_shifted = Sub (image_f32, image_shift)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
[node_relu] relu = Relu (getitem)
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
relu_1 = Relu (getitem_3)
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
relu_2 = Relu (getitem_6)
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
relu_3 = Relu (getitem_9)
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
relu_4 = Relu (getitem_12)
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
add_140 = Add (getitem_15, getitem_18)
relu_5 = Relu (add_140)
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
relu_6 = Relu (getitem_21)
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
relu_7 = Relu (getitem_24)
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
add_216 = Add (getitem_27, relu_5)
relu_8 = Relu (add_216)
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
relu_9 = Relu (getitem_30)
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
relu_10 = Relu (getitem_33)
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
add_292 = Add (getitem_36, relu_8)
relu_11 = Relu (add_292)
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
relu_12 = Relu (getitem_39)
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
relu_13 = Relu (getitem_42)
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_13)
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_11)
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
add_388 = Add (getitem_45, getitem_48)
relu_14 = Relu (add_388)
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
relu_15 = Relu (getitem_51)
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
relu_16 = Relu (getitem_54)
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
add_464 = Add (getitem_57, relu_14)
relu_17 = Relu (add_464)
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
relu_18 = Relu (getitem_60)
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
relu_19 = Relu (getitem_63)
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
add_540 = Add (getitem_66, relu_17)
relu_20 = Relu (add_540)
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
relu_21 = Relu (getitem_69)
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
relu_22 = Relu (getitem_72)
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
add_616 = Add (getitem_75, relu_20)
relu_23 = Relu (add_616)
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
relu_24 = Relu (getitem_78)
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
relu_25 = Relu (getitem_81)
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_25)
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_23)
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
add_712 = Add (getitem_84, getitem_87)
relu_26 = Relu (add_712)
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
relu_27 = Relu (getitem_90)
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
relu_28 = Relu (getitem_93)
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
add_788 = Add (getitem_96, relu_26)
relu_29 = Relu (add_788)
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
relu_30 = Relu (getitem_99)
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
relu_31 = Relu (getitem_102)
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
add_864 = Add (getitem_105, relu_29)
relu_32 = Relu (add_864)
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
relu_33 = Relu (getitem_108)
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
relu_34 = Relu (getitem_111)
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
add_940 = Add (getitem_114, relu_32)
relu_35 = Relu (add_940)
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
relu_36 = Relu (getitem_117)
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
relu_37 = Relu (getitem_120)
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
add_1016 = Add (getitem_123, relu_35)
relu_38 = Relu (add_1016)
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
relu_39 = Relu (getitem_126)
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
relu_40 = Relu (getitem_129)
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
add_1092 = Add (getitem_132, relu_38)
relu_41 = Relu (add_1092)
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer3.6.conv1.weight", "visual.layer3.6.conv1.weight_bias")
relu_42 = Relu (getitem_135)
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer3.6.conv2.weight", "visual.layer3.6.conv2.weight_bias")
relu_43 = Relu (getitem_138)
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_43, "visual.layer3.6.conv3.weight", "visual.layer3.6.conv3.weight_bias")
add_1168 = Add (getitem_141, relu_41)
relu_44 = Relu (add_1168)
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer3.7.conv1.weight", "visual.layer3.7.conv1.weight_bias")
relu_45 = Relu (getitem_144)
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer3.7.conv2.weight", "visual.layer3.7.conv2.weight_bias")
relu_46 = Relu (getitem_147)
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer3.7.conv3.weight", "visual.layer3.7.conv3.weight_bias")
add_1244 = Add (getitem_150, relu_44)
relu_47 = Relu (add_1244)
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer3.8.conv1.weight", "visual.layer3.8.conv1.weight_bias")
relu_48 = Relu (getitem_153)
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer3.8.conv2.weight", "visual.layer3.8.conv2.weight_bias")
relu_49 = Relu (getitem_156)
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer3.8.conv3.weight", "visual.layer3.8.conv3.weight_bias")
add_1320 = Add (getitem_159, relu_47)
relu_50 = Relu (add_1320)
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_50, "visual.layer3.9.conv1.weight", "visual.layer3.9.conv1.weight_bias")
relu_51 = Relu (getitem_162)
getitem_165 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_51, "visual.layer3.9.conv2.weight", "visual.layer3.9.conv2.weight_bias")
relu_52 = Relu (getitem_165)
getitem_168 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_52, "visual.layer3.9.conv3.weight", "visual.layer3.9.conv3.weight_bias")
add_1396 = Add (getitem_168, relu_50)
relu_53 = Relu (add_1396)
getitem_171 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_53, "visual.layer3.10.conv1.weight", "visual.layer3.10.conv1.weight_bias")
relu_54 = Relu (getitem_171)
getitem_174 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_54, "visual.layer3.10.conv2.weight", "visual.layer3.10.conv2.weight_bias")
relu_55 = Relu (getitem_174)
getitem_177 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_55, "visual.layer3.10.conv3.weight", "visual.layer3.10.conv3.weight_bias")
add_1472 = Add (getitem_177, relu_53)
relu_56 = Relu (add_1472)
getitem_180 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_56, "visual.layer3.11.conv1.weight", "visual.layer3.11.conv1.weight_bias")
relu_57 = Relu (getitem_180)
getitem_183 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_57, "visual.layer3.11.conv2.weight", "visual.layer3.11.conv2.weight_bias")
relu_58 = Relu (getitem_183)
getitem_186 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_58, "visual.layer3.11.conv3.weight", "visual.layer3.11.conv3.weight_bias")
add_1548 = Add (getitem_186, relu_56)
relu_59 = Relu (add_1548)
getitem_189 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_59, "visual.layer3.12.conv1.weight", "visual.layer3.12.conv1.weight_bias")
relu_60 = Relu (getitem_189)
getitem_192 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_60, "visual.layer3.12.conv2.weight", "visual.layer3.12.conv2.weight_bias")
relu_61 = Relu (getitem_192)
getitem_195 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_61, "visual.layer3.12.conv3.weight", "visual.layer3.12.conv3.weight_bias")
add_1624 = Add (getitem_195, relu_59)
relu_62 = Relu (add_1624)
getitem_198 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_62, "visual.layer3.13.conv1.weight", "visual.layer3.13.conv1.weight_bias")
relu_63 = Relu (getitem_198)
getitem_201 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_63, "visual.layer3.13.conv2.weight", "visual.layer3.13.conv2.weight_bias")
relu_64 = Relu (getitem_201)
getitem_204 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_64, "visual.layer3.13.conv3.weight", "visual.layer3.13.conv3.weight_bias")
add_1700 = Add (getitem_204, relu_62)
relu_65 = Relu (add_1700)
getitem_207 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_65, "visual.layer3.14.conv1.weight", "visual.layer3.14.conv1.weight_bias")
relu_66 = Relu (getitem_207)
getitem_210 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_66, "visual.layer3.14.conv2.weight", "visual.layer3.14.conv2.weight_bias")
relu_67 = Relu (getitem_210)
getitem_213 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_67, "visual.layer3.14.conv3.weight", "visual.layer3.14.conv3.weight_bias")
add_1776 = Add (getitem_213, relu_65)
relu_68 = Relu (add_1776)
getitem_216 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_68, "visual.layer3.15.conv1.weight", "visual.layer3.15.conv1.weight_bias")
relu_69 = Relu (getitem_216)
getitem_219 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_69, "visual.layer3.15.conv2.weight", "visual.layer3.15.conv2.weight_bias")
relu_70 = Relu (getitem_219)
getitem_222 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_70, "visual.layer3.15.conv3.weight", "visual.layer3.15.conv3.weight_bias")
add_1852 = Add (getitem_222, relu_68)
relu_71 = Relu (add_1852)
getitem_225 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_71, "visual.layer3.16.conv1.weight", "visual.layer3.16.conv1.weight_bias")
relu_72 = Relu (getitem_225)
getitem_228 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_72, "visual.layer3.16.conv2.weight", "visual.layer3.16.conv2.weight_bias")
relu_73 = Relu (getitem_228)
getitem_231 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_73, "visual.layer3.16.conv3.weight", "visual.layer3.16.conv3.weight_bias")
add_1928 = Add (getitem_231, relu_71)
relu_74 = Relu (add_1928)
getitem_234 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_74, "visual.layer3.17.conv1.weight", "visual.layer3.17.conv1.weight_bias")
relu_75 = Relu (getitem_234)
getitem_237 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_75, "visual.layer3.17.conv2.weight", "visual.layer3.17.conv2.weight_bias")
relu_76 = Relu (getitem_237)
getitem_240 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_76, "visual.layer3.17.conv3.weight", "visual.layer3.17.conv3.weight_bias")
add_2004 = Add (getitem_240, relu_74)
relu_77 = Relu (add_2004)
getitem_243 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_77, "visual.layer3.18.conv1.weight", "visual.layer3.18.conv1.weight_bias")
relu_78 = Relu (getitem_243)
getitem_246 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_78, "visual.layer3.18.conv2.weight", "visual.layer3.18.conv2.weight_bias")
relu_79 = Relu (getitem_246)
getitem_249 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_79, "visual.layer3.18.conv3.weight", "visual.layer3.18.conv3.weight_bias")
add_2080 = Add (getitem_249, relu_77)
relu_80 = Relu (add_2080)
getitem_252 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_80, "visual.layer3.19.conv1.weight", "visual.layer3.19.conv1.weight_bias")
relu_81 = Relu (getitem_252)
getitem_255 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_81, "visual.layer3.19.conv2.weight", "visual.layer3.19.conv2.weight_bias")
relu_82 = Relu (getitem_255)
getitem_258 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_82, "visual.layer3.19.conv3.weight", "visual.layer3.19.conv3.weight_bias")
add_2156 = Add (getitem_258, relu_80)
relu_83 = Relu (add_2156)
getitem_261 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_83, "visual.layer3.20.conv1.weight", "visual.layer3.20.conv1.weight_bias")
relu_84 = Relu (getitem_261)
getitem_264 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_84, "visual.layer3.20.conv2.weight", "visual.layer3.20.conv2.weight_bias")
relu_85 = Relu (getitem_264)
getitem_267 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_85, "visual.layer3.20.conv3.weight", "visual.layer3.20.conv3.weight_bias")
add_2232 = Add (getitem_267, relu_83)
relu_86 = Relu (add_2232)
getitem_270 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_86, "visual.layer3.21.conv1.weight", "visual.layer3.21.conv1.weight_bias")
relu_87 = Relu (getitem_270)
getitem_273 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_87, "visual.layer3.21.conv2.weight", "visual.layer3.21.conv2.weight_bias")
relu_88 = Relu (getitem_273)
getitem_276 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_88, "visual.layer3.21.conv3.weight", "visual.layer3.21.conv3.weight_bias")
add_2308 = Add (getitem_276, relu_86)
relu_89 = Relu (add_2308)
getitem_279 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_89, "visual.layer3.22.conv1.weight", "visual.layer3.22.conv1.weight_bias")
relu_90 = Relu (getitem_279)
getitem_282 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_90, "visual.layer3.22.conv2.weight", "visual.layer3.22.conv2.weight_bias")
relu_91 = Relu (getitem_282)
getitem_285 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_91, "visual.layer3.22.conv3.weight", "visual.layer3.22.conv3.weight_bias")
add_2384 = Add (getitem_285, relu_89)
relu_92 = Relu (add_2384)
getitem_288 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_92, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
relu_93 = Relu (getitem_288)
getitem_291 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_93, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
relu_94 = Relu (getitem_291)
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_94)
getitem_294 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_92)
getitem_297 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
add_2480 = Add (getitem_294, getitem_297)
relu_95 = Relu (add_2480)
getitem_300 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_95, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
relu_96 = Relu (getitem_300)
getitem_303 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_96, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
relu_97 = Relu (getitem_303)
getitem_306 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_97, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
add_2556 = Add (getitem_306, relu_95)
relu_98 = Relu (add_2556)
getitem_309 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_98, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
relu_99 = Relu (getitem_309)
getitem_312 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_99, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
relu_100 = Relu (getitem_312)
getitem_315 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_100, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
add_2632 = Add (getitem_315, relu_98)
relu_101 = Relu (add_2632)
view_2 = Reshape <allowzero: int = 1> (relu_101, view_2_target)
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
add_2662 = Add (cat, unsqueeze)
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
node_scaled_dot_product_attention_q_row = Slice (add_2662, val_0, val_3, val_0)
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
[node_linear] linear = Add (val_7, split_split_0)
val_8 = MatMul (add_2662, val_5)
linear_1 = Add (val_8, split_split_1)
val_9 = MatMul (add_2662, val_6)
linear_2 = Add (val_9, split_split_2)
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
select = Squeeze (view_10, val_0)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
cat_1 FLOAT[6144] 9612b463fd18
image_shift FLOAT[3] 2f7a50e604ad
node_scaled_dot_product_attention_out_1 INT64[3] b6639c8d94ec
node_scaled_dot_product_attention_q_pack_1 INT64[4] f7b9b5620534
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
val_0 INT64[1] af5570f5a181
val_1 INT64[1] 12a3ae445661
val_2 FLOAT[] 6708d9be4956
val_3 INT64[1] 7c9fa136d441
val_4 FLOAT[2048,2048] f49f22a8d0d8
val_5 FLOAT[2048,2048] 457ada9eb2d1
val_6 FLOAT[2048,2048] 0e8a5b13c951
view_2_target INT64[3] 68ffb9ecb5ec
view_4_target INT64[3] c7a3d94c4eb2
view_7_target INT64[4] e0ea1841387b
view_9_target INT64[2] 76aecb4697fd
visual.attnpool.c_proj.bias FLOAT[512] 98e8b869a687
visual.attnpool.c_proj.weight FLOAT[512,2048] 944a12dec126
visual.attnpool.positional_embedding FLOAT[50,2048] 55d39d84cefc
visual.conv1.weight FLOAT[32,3,3,3] 5e7ba945a006
visual.conv1.weight_bias FLOAT[32] 52637aaf43d8
visual.conv2.weight FLOAT[32,32,3,3] d36eefdb938f
visual.conv2.weight_bias FLOAT[32] adc45ce4c237
visual.conv3.weight FLOAT[64,32,3,3] e5791fd33889
visual.conv3.weight_bias FLOAT[64] c56c3812a1a4
visual.layer1.0.conv1.weight FLOAT[64,64,1,1] e1b663b66c67
visual.layer1.0.conv1.weight_bias FLOAT[64] b726e5a0c77f
visual.layer1.0.conv2.weight FLOAT[64,64,3,3] c686312f24da
visual.layer1.0.conv2.weight_bias FLOAT[64] d9e7ed04a69f
visual.layer1.0.conv3.weight FLOAT[256,64,1,1] d4e03f1cfd56
visual.layer1.0.conv3.weight_bias FLOAT[256] f45cb5734d5e
visual.layer1.0.downsample.0.weight FLOAT[256,64,1,1] 16a01f38eaad
visual.layer1.0.downsample.0.weight_bias FLOAT[256] 5e729a38e7da
visual.layer1.1.conv1.weight FLOAT[64,256,1,1] aa7f561a446d
visual.layer1.1.conv1.weight_bias FLOAT[64] 0a59d6df5a74
visual.layer1.1.conv2.weight FLOAT[64,64,3,3] 0367fb9328b9
visual.layer1.1.conv2.weight_bias FLOAT[64] b53f76f67606
visual.layer1.1.conv3.weight FLOAT[256,64,1,1] 6a1a12bc395f
visual.layer1.1.conv3.weight_bias FLOAT[256] ac60b5e5c569
visual.layer1.2.conv1.weight FLOAT[64,256,1,1] e7828bc5f0ee
visual.layer1.2.conv1.weight_bias FLOAT[64] 0561c6ca68e7
visual.layer1.2.conv2.weight FLOAT[64,64,3,3] 98ab5cdcecc6
visual.layer1.2.conv2.weight_bias FLOAT[64] 3bb6933213cd
visual.layer1.2.conv3.weight FLOAT[256,64,1,1] 625465368498
visual.layer1.2.conv3.weight_bias FLOAT[256] 207071d90d23
visual.layer2.0.conv1.weight FLOAT[128,256,1,1] c14f6619adbc
visual.layer2.0.conv1.weight_bias FLOAT[128] d1bad324aaeb
visual.layer2.0.conv2.weight FLOAT[128,128,3,3] 87278d03cedc
visual.layer2.0.conv2.weight_bias FLOAT[128] 791077d8b4d8
visual.layer2.0.conv3.weight FLOAT[512,128,1,1] 2363a34d5577
visual.layer2.0.conv3.weight_bias FLOAT[512] e84d9fdb7be7
visual.layer2.0.downsample.0.weight FLOAT[512,256,1,1] 437d06047db7
visual.layer2.0.downsample.0.weight_bias FLOAT[512] 2cfd5737e175
visual.layer2.1.conv1.weight FLOAT[128,512,1,1] 16ab309d8f57
visual.layer2.1.conv1.weight_bias FLOAT[128] d939ad25a1d7
visual.layer2.1.conv2.weight FLOAT[128,128,3,3] fb7765f84fb8
visual.layer2.1.conv2.weight_bias FLOAT[128] b66ccc90092d
visual.layer2.1.conv3.weight FLOAT[512,128,1,1] bd1e0396f2d7
visual.layer2.1.conv3.weight_bias FLOAT[512] 4b4ffac018ff
visual.layer2.2.conv1.weight FLOAT[128,512,1,1] 68015521b270
visual.layer2.2.conv1.weight_bias FLOAT[128] 7f965766b6f9
visual.layer2.2.conv2.weight FLOAT[128,128,3,3] 306b50e42a19
visual.layer2.2.conv2.weight_bias FLOAT[128] 74f794024a5f
visual.layer2.2.conv3.weight FLOAT[512,128,1,1] c24ae32d7efa
visual.layer2.2.conv3.weight_bias FLOAT[512] b1ecdee8f9f1
visual.layer2.3.conv1.weight FLOAT[128,512,1,1] 9d019c735f9e
visual.layer2.3.conv1.weight_bias FLOAT[128] f3b68bbf8413
visual.layer2.3.conv2.weight FLOAT[128,128,3,3] 4e8f1b2e7adf
visual.layer2.3.conv2.weight_bias FLOAT[128] 27ed6a9331c3
visual.layer2.3.conv3.weight FLOAT[512,128,1,1] 218bf38825c3
visual.layer2.3.conv3.weight_bias FLOAT[512] b5c4e40e66bc
visual.layer3.0.conv1.weight FLOAT[256,512,1,1] 6971f638b8b7
visual.layer3.0.conv1.weight_bias FLOAT[256] 1e884cb4e64d
visual.layer3.0.conv2.weight FLOAT[256,256,3,3] c72686fe10ca
visual.layer3.0.conv2.weight_bias FLOAT[256] 25aa32eee05c
visual.layer3.0.conv3.weight FLOAT[1024,256,1,1] 91a246d8bee3
visual.layer3.0.conv3.weight_bias FLOAT[1024] 37a29de5d160
visual.layer3.0.downsample.0.weight FLOAT[1024,512,1,1] 702e936a9c4c
visual.layer3.0.downsample.0.weight_bias FLOAT[1024] 53fab83f909e
visual.layer3.1.conv1.weight FLOAT[256,1024,1,1] fb5ade6b09d7
visual.layer3.1.conv1.weight_bias FLOAT[256] 11b7c26987fc
visual.layer3.1.conv2.weight FLOAT[256,256,3,3] d789bb2e551a
visual.layer3.1.conv2.weight_bias FLOAT[256] 1a43fcb586c9
visual.layer3.1.conv3.weight FLOAT[1024,256,1,1] 235bdc66f12a
visual.layer3.1.conv3.weight_bias FLOAT[1024] 5c3bccb3ae68
visual.layer3.10.conv1.weight FLOAT[256,1024,1,1] e8e6f879e2be
visual.layer3.10.conv1.weight_bias FLOAT[256] b03fb9be4fe7
visual.layer3.10.conv2.weight FLOAT[256,256,3,3] 6070f6e66896
visual.layer3.10.conv2.weight_bias FLOAT[256] cfbd87a56179
visual.layer3.10.conv3.weight FLOAT[1024,256,1,1] a02ddea2b46a
visual.layer3.10.conv3.weight_bias FLOAT[1024] 306c6dce28a8
visual.layer3.11.conv1.weight FLOAT[256,1024,1,1] 29ff281dbc08
visual.layer3.11.conv1.weight_bias FLOAT[256] 414b934d17f0
visual.layer3.11.conv2.weight FLOAT[256,256,3,3] a02ff7d48bb1
visual.layer3.11.conv2.weight_bias FLOAT[256] 75ae38f2c447
visual.layer3.11.conv3.weight FLOAT[1024,256,1,1] d7c7702018cb
visual.layer3.11.conv3.weight_bias FLOAT[1024] 192bd3629674
visual.layer3.12.conv1.weight FLOAT[256,1024,1,1] 51b2792eea64
visual.layer3.12.conv1.weight_bias FLOAT[256] be1cf24f231f
visual.layer3.12.conv2.weight FLOAT[256,256,3,3] 407841877316
visual.layer3.12.conv2.weight_bias FLOAT[256] a1b2fc0588a8
visual.layer3.12.conv3.weight FLOAT[1024,256,1,1] 04813f5116ef
visual.layer3.12.conv3.weight_bias FLOAT[1024] 8015eeb62551
visual.layer3.13.conv1.weight FLOAT[256,1024,1,1] 16ff148df6cb
visual.layer3.13.conv1.weight_bias FLOAT[256] 19f89d6481c2
visual.layer3.13.conv2.weight FLOAT[256,256,3,3] 9905d32aa32b
visual.layer3.13.conv2.weight_bias FLOAT[256] 180570d29509
visual.layer3.13.conv3.weight FLOAT[1024,256,1,1] 60bc5d334e72
visual.layer3.13.conv3.weight_bias FLOAT[1024] d51e9b12e5e3
visual.layer3.14.conv1.weight FLOAT[256,1024,1,1] 0fb72ec74c5b
visual.layer3.14.conv1.weight_bias FLOAT[256] ce3b2e50c015
visual.layer3.14.conv2.weight FLOAT[256,256,3,3] 2597ef4dfc7a
visual.layer3.14.conv2.weight_bias FLOAT[256] e0f47ec89b43
visual.layer3.14.conv3.weight FLOAT[1024,256,1,1] def2713ab223
visual.layer3.14.conv3.weight_bias FLOAT[1024] 2955fd10127b
visual.layer3.15.conv1.weight FLOAT[256,1024,1,1] 5a9dc9a33247
visual.layer3.15.conv1.weight_bias FLOAT[256] 792ef30f9685
visual.layer3.15.conv2.weight FLOAT[256,256,3,3] d51d2405c19f
visual.layer3.15.conv2.weight_bias FLOAT[256] 4b9e17fcc5fb
visual.layer3.15.conv3.weight FLOAT[1024,256,1,1] 4163687c91ad
visual.layer3.15.conv3.weight_bias FLOAT[1024] e7551c650a35
visual.layer3.16.conv1.weight FLOAT[256,1024,1,1] 2060bfbcfbd8
visual.layer3.16.conv1.weight_bias FLOAT[256] cc43e4d97f58
visual.layer3.16.conv2.weight FLOAT[256,256,3,3] 1c22c821d6fd
visual.layer3.16.conv2.weight_bias FLOAT[256] 0180a5118487
visual.layer3.16.conv3.weight FLOAT[1024,256,1,1] 6f57fc02ed1f
visual.layer3.16.conv3.weight_bias FLOAT[1024] c7a7f70a744a
visual.layer3.17.conv1.weight FLOAT[256,1024,1,1] 5001c1df66c1
visual.layer3.17.conv1.weight_bias FLOAT[256] debaf8c9525a
visual.layer3.17.conv2.weight FLOAT[256,256,3,3] 6e6135a19b75
visual.layer3.17.conv2.weight_bias FLOAT[256] 7e7431e1565d
visual.layer3.17.conv3.weight FLOAT[1024,256,1,1] 5b698c6dd0a4
visual.layer3.17.conv3.weight_bias FLOAT[1024] 89df3c6008d0
visual.layer3.18.conv1.weight FLOAT[256,1024,1,1] fea1f6eb83f6
visual.layer3.18.conv1.weight_bias FLOAT[256] 320653825471
visual.layer3.18.conv2.weight FLOAT[256,256,3,3] 53a2558f13a8
visual.layer3.18.conv2.weight_bias FLOAT[256] 9e0e88b0b7e0
visual.layer3.18.conv3.weight FLOAT[1024,256,1,1] b44a2fc58c75
visual.layer3.18.conv3.weight_bias FLOAT[1024] 9eb1d94cb99a
visual.layer3.19.conv1.weight FLOAT[256,1024,1,1] 8d9426da01ad
visual.layer3.19.conv1.weight_bias FLOAT[256] d68d077a4297
visual.layer3.19.conv2.weight FLOAT[256,256,3,3] 4e886f415e9e
visual.layer3.19.conv2.weight_bias FLOAT[256] d2e3337d426c
visual.layer3.19.conv3.weight FLOAT[1024,256,1,1] 45213b589c09
visual.layer3.19.conv3.weight_bias FLOAT[1024] d1cb410c0993
visual.layer3.2.conv1.weight FLOAT[256,1024,1,1] bd67497c4dfa
visual.layer3.2.conv1.weight_bias FLOAT[256] 510501d2aec0
visual.layer3.2.conv2.weight FLOAT[256,256,3,3] 6d93297577e4
visual.layer3.2.conv2.weight_bias FLOAT[256] 7e982e23a847
visual.layer3.2.conv3.weight FLOAT[1024,256,1,1] c7f23210bb5e
visual.layer3.2.conv3.weight_bias FLOAT[1024] 71b001083c0d
visual.layer3.20.conv1.weight FLOAT[256,1024,1,1] 381e59f70d1d
visual.layer3.20.conv1.weight_bias FLOAT[256] a8f9db9a019b
visual.layer3.20.conv2.weight FLOAT[256,256,3,3] a5c7950b5315
visual.layer3.20.conv2.weight_bias FLOAT[256] 00a93bfbe25c
visual.layer3.20.conv3.weight FLOAT[1024,256,1,1] 6e66a6ce7ea6
visual.layer3.20.conv3.weight_bias FLOAT[1024] 35d53ffd9b95
visual.layer3.21.conv1.weight FLOAT[256,1024,1,1] da3747036382
visual.layer3.21.conv1.weight_bias FLOAT[256] 932c6bb8cb3b
visual.layer3.21.conv2.weight FLOAT[256,256,3,3] 9dbaa6d07eca
visual.layer3.21.conv2.weight_bias FLOAT[256] 92aa45e5539b
visual.layer3.21.conv3.weight FLOAT[1024,256,1,1] 4eeff2dff81a
visual.layer3.21.conv3.weight_bias FLOAT[1024] 04c310dcf1a9
visual.layer3.22.conv1.weight FLOAT[256,1024,1,1] 9934f4aaad30
visual.layer3.22.conv1.weight_bias FLOAT[256] e1ac95aac5cc
visual.layer3.22.conv2.weight FLOAT[256,256,3,3] cd630f34f5a7
visual.layer3.22.conv2.weight_bias FLOAT[256] 009facf9c140
visual.layer3.22.conv3.weight FLOAT[1024,256,1,1] e0507f110232
visual.layer3.22.conv3.weight_bias FLOAT[1024] 9059e46c9da6
visual.layer3.3.conv1.weight FLOAT[256,1024,1,1] ea14645b1587
visual.layer3.3.conv1.weight_bias FLOAT[256] 789e1e22aa72
visual.layer3.3.conv2.weight FLOAT[256,256,3,3] 36d892d38b50
visual.layer3.3.conv2.weight_bias FLOAT[256] 11ba01a9545e
visual.layer3.3.conv3.weight FLOAT[1024,256,1,1] d75e980adc7e
visual.layer3.3.conv3.weight_bias FLOAT[1024] a731d23e448d
visual.layer3.4.conv1.weight FLOAT[256,1024,1,1] 310a4cace619
visual.layer3.4.conv1.weight_bias FLOAT[256] da93399edc8d
visual.layer3.4.conv2.weight FLOAT[256,256,3,3] 025bd6c5f50b
visual.layer3.4.conv2.weight_bias FLOAT[256] 13c9b2a27f72
visual.layer3.4.conv3.weight FLOAT[1024,256,1,1] 5a128ba1790b
visual.layer3.4.conv3.weight_bias FLOAT[1024] bea4ab6b39ad
visual.layer3.5.conv1.weight FLOAT[256,1024,1,1] 2f52c17a0470
visual.layer3.5.conv1.weight_bias FLOAT[256] 85ce7edaffa2
visual.layer3.5.conv2.weight FLOAT[256,256,3,3] d01b8837ef01
visual.layer3.5.conv2.weight_bias FLOAT[256] 0acf7935803f
visual.layer3.5.conv3.weight FLOAT[1024,256,1,1] b4570892e3b1
visual.layer3.5.conv3.weight_bias FLOAT[1024] 02621123f513
visual.layer3.6.conv1.weight FLOAT[256,1024,1,1] eca133e06836
visual.layer3.6.conv1.weight_bias FLOAT[256] be77c60bab95
visual.layer3.6.conv2.weight FLOAT[256,256,3,3] ca7098373492
visual.layer3.6.conv2.weight_bias FLOAT[256] 568a9ab98c11
visual.layer3.6.conv3.weight FLOAT[1024,256,1,1] 2dfea6802d54
visual.layer3.6.conv3.weight_bias FLOAT[1024] 16e449a6b86f
visual.layer3.7.conv1.weight FLOAT[256,1024,1,1] 0cd4069d54fa
visual.layer3.7.conv1.weight_bias FLOAT[256] ab046df1a0f5
visual.layer3.7.conv2.weight FLOAT[256,256,3,3] 55460eeaf278
visual.layer3.7.conv2.weight_bias FLOAT[256] 4c44ad24f0cc
visual.layer3.7.conv3.weight FLOAT[1024,256,1,1] 3a4cc6e7ae7e
visual.layer3.7.conv3.weight_bias FLOAT[1024] b27a7a0ab8c3
visual.layer3.8.conv1.weight FLOAT[256,1024,1,1] 4d0a734410e7
visual.layer3.8.conv1.weight_bias FLOAT[256] 922c1387d0cd
visual.layer3.8.conv2.weight FLOAT[256,256,3,3] e732c80b3eb3
visual.layer3.8.conv2.weight_bias FLOAT[256] 8016c2524139
visual.layer3.8.conv3.weight FLOAT[1024,256,1,1] 09b1c27aaf55
visual.layer3.8.conv3.weight_bias FLOAT[1024] dbd014898c5f
visual.layer3.9.conv1.weight FLOAT[256,1024,1,1] e156280776f1
visual.layer3.9.conv1.weight_bias FLOAT[256] 598bba2580b8
visual.layer3.9.conv2.weight FLOAT[256,256,3,3] 3427bb7ce5df
visual.layer3.9.conv2.weight_bias FLOAT[256] 845c3092fa97
visual.layer3.9.conv3.weight FLOAT[1024,256,1,1] a0ae4eabd466
visual.layer3.9.conv3.weight_bias FLOAT[1024] feee6a22f859
visual.layer4.0.conv1.weight FLOAT[512,1024,1,1] 7c20088d271c
visual.layer4.0.conv1.weight_bias FLOAT[512] 155b439fc2df
visual.layer4.0.conv2.weight FLOAT[512,512,3,3] f4a451ed000d
visual.layer4.0.conv2.weight_bias FLOAT[512] d8948b957813
visual.layer4.0.conv3.weight FLOAT[2048,512,1,1] a4fa70482ac0
visual.layer4.0.conv3.weight_bias FLOAT[2048] ee8c8df1992e
visual.layer4.0.downsample.0.weight FLOAT[2048,1024,1,1] b5d0df16ca16
visual.layer4.0.downsample.0.weight_bias FLOAT[2048] e9f1e9265a87
visual.layer4.1.conv1.weight FLOAT[512,2048,1,1] bc476358f1b8
visual.layer4.1.conv1.weight_bias FLOAT[512] 27e66be27409
visual.layer4.1.conv2.weight FLOAT[512,512,3,3] 669f4c60c4ae
visual.layer4.1.conv2.weight_bias FLOAT[512] a2024e571421
visual.layer4.1.conv3.weight FLOAT[2048,512,1,1] e45dca4c527a
visual.layer4.1.conv3.weight_bias FLOAT[2048] 4cdb2c8a7871
visual.layer4.2.conv1.weight FLOAT[512,2048,1,1] c714b494454e
visual.layer4.2.conv1.weight_bias FLOAT[512] bf66220dbc93
visual.layer4.2.conv2.weight FLOAT[512,512,3,3] 048014de9879
visual.layer4.2.conv2.weight_bias FLOAT[512] 57378db285d8
visual.layer4.2.conv3.weight FLOAT[2048,512,1,1] 1c1d2c9b3895
visual.layer4.2.conv3.weight_bias FLOAT[2048] 8d1cfc70902c
+576
View File
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,512] add_1071
float[batch,77,512] add_1092
float[batch,77,512] add_119
float[batch,77,512] add_1207
float[batch,77,512] add_1228
float[batch,77,512] add_1343
float[batch,77,512] add_1364
float[batch,77,512] add_140
float[batch,77,512] add_1479
float[batch,77,512] add_1500
float[batch,1,512] add_1500_pooled
float[batch,1,512] add_1615
float[batch,1,512] add_1636
float[batch,77,512] add_255
float[batch,77,512] add_276
float[batch,77,512] add_391
float[batch,77,512] add_4
float[batch,77,512] add_412
float[batch,77,512] add_527
float[batch,77,512] add_548
float[batch,77,512] add_663
float[batch,77,512] add_684
float[batch,77,512] add_799
float[batch,77,512] add_820
float[batch,77,512] add_935
float[batch,77,512] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,2048] gelu
float[batch,77,2048] gelu_1
float[batch,77,2048] gelu_10
float[batch,1,2048] gelu_11
float[batch,77,2048] gelu_2
float[batch,77,2048] gelu_3
float[batch,77,2048] gelu_4
float[batch,77,2048] gelu_5
float[batch,77,2048] gelu_6
float[batch,77,2048] gelu_7
float[batch,77,2048] gelu_8
float[batch,77,2048] gelu_9
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,512] matmul
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] val_39
float[batch,77,512] val_40
float[batch,77,2048] val_41
float[batch,77,512] val_42
float[batch,77,2048] val_43
float[batch,77,512] val_44
float[batch,77,2048] val_45
float[batch,77,512] val_46
float[batch,77,2048] val_47
float[batch,77,512] val_48
float[batch,77,2048] val_49
float[batch,77,512] val_50
float[batch,77,2048] val_51
float[batch,77,512] val_52
float[batch,77,2048] val_53
float[batch,77,512] val_54
float[batch,77,2048] val_55
float[batch,77,512] val_56
float[batch,77,2048] val_57
float[batch,77,512] val_58
float[batch,77,2048] val_59
float[batch,77,512] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2048] val_63
float[batch,1,512] val_64
float[batch,1,512] val_65
float[batch,512] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] df5297638f99
ln_final.weight FLOAT[512] 3404812580e2
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] 6a7a7526c1af
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 57f3781aa4fe
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] d2d87b406424
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 29767e5e85a4
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 2a1ad5567af4
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] fc5226f9bc5f
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 7543a2b0a008
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] bbdf1c8cabd6
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 0182e11c47f4
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 08ed08b71750
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 6fcd6c679ce8
node_scaled_dot_product_attention_wo_t FLOAT[512,512] d041de2c7c2c
positional_embedding FLOAT[77,512] 3baa7b9d4fe9
text_projection FLOAT[512,512] af807e41ad49
token_embedding.weight_fp16 FLOAT16[49408,512] 4c784728015d
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 398d5bbef923
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] b6ee5f998bfb
transformer.resblocks.0.ln_1.bias FLOAT[512] 504fe800c4c2
transformer.resblocks.0.ln_1.weight FLOAT[512] 55c135edf109
transformer.resblocks.0.ln_2.bias FLOAT[512] c5ad3b6eca3e
transformer.resblocks.0.ln_2.weight FLOAT[512] 711bdaf89252
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] e22601115007
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] fb36ca24177d
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] fca32520f96b
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] be06b172dbc6
transformer.resblocks.1.ln_1.bias FLOAT[512] 115278405742
transformer.resblocks.1.ln_1.weight FLOAT[512] abeede809a1d
transformer.resblocks.1.ln_2.bias FLOAT[512] 1d037748c399
transformer.resblocks.1.ln_2.weight FLOAT[512] 2fe3e4d96eeb
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] e4f1de72a7d0
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] 62928f55c12d
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 0f35eb9b94fc
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 56944e0d71df
transformer.resblocks.10.ln_1.bias FLOAT[512] 4dc996cabcd6
transformer.resblocks.10.ln_1.weight FLOAT[512] 6dca1dfe571a
transformer.resblocks.10.ln_2.bias FLOAT[512] 26af835c8710
transformer.resblocks.10.ln_2.weight FLOAT[512] 04cbfebbd74e
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 9945efcb871c
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 7ad332c26395
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] e172bb582cbb
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 9b3c07eb1557
transformer.resblocks.11.ln_1.bias FLOAT[512] cb861a9577d5
transformer.resblocks.11.ln_1.weight FLOAT[512] 27ed5a91e0df
transformer.resblocks.11.ln_2.bias FLOAT[512] bb2e5ed22909
transformer.resblocks.11.ln_2.weight FLOAT[512] f8531fa50cdf
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] 5861d556660e
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 4837e5c98371
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 4e841a3c86b9
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] fde4765e4762
transformer.resblocks.2.ln_1.bias FLOAT[512] 03b060576f44
transformer.resblocks.2.ln_1.weight FLOAT[512] 574d3843c375
transformer.resblocks.2.ln_2.bias FLOAT[512] 6fc2a9e29e60
transformer.resblocks.2.ln_2.weight FLOAT[512] b26507d84d2a
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] ec5d23c19821
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 80924b3a7d7e
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 84051974a34a
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 48214a148da5
transformer.resblocks.3.ln_1.bias FLOAT[512] aa19c81a88c0
transformer.resblocks.3.ln_1.weight FLOAT[512] f4d81a796a14
transformer.resblocks.3.ln_2.bias FLOAT[512] 8eddbb4cfb73
transformer.resblocks.3.ln_2.weight FLOAT[512] 51809a7e748e
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] ee426ecfe6c0
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 7082381d47bc
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] ad8c78ca0dc4
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 1a4fc8fd96c7
transformer.resblocks.4.ln_1.bias FLOAT[512] e107e980c3b6
transformer.resblocks.4.ln_1.weight FLOAT[512] 78def23a938f
transformer.resblocks.4.ln_2.bias FLOAT[512] 3f084eda79f7
transformer.resblocks.4.ln_2.weight FLOAT[512] 26c1773189f9
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] cf31ad14f38d
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] e72f239899de
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 2516b49a1d9b
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 57802a3e9c19
transformer.resblocks.5.ln_1.bias FLOAT[512] 01d552d57911
transformer.resblocks.5.ln_1.weight FLOAT[512] 9402669cdf27
transformer.resblocks.5.ln_2.bias FLOAT[512] 37a2b0827f1b
transformer.resblocks.5.ln_2.weight FLOAT[512] 4b7a369c973c
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] e0c26619d733
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] a340f2bebd9c
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 5f2ad0e05023
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 76611b485791
transformer.resblocks.6.ln_1.bias FLOAT[512] eeaedc865560
transformer.resblocks.6.ln_1.weight FLOAT[512] b843b277cfd1
transformer.resblocks.6.ln_2.bias FLOAT[512] b70de77d4636
transformer.resblocks.6.ln_2.weight FLOAT[512] ca8de3e5a498
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] a33a1031a456
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] c8e701244ad4
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 27b7ab5b0c0a
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] c09667a28397
transformer.resblocks.7.ln_1.bias FLOAT[512] 8ce68fb13f79
transformer.resblocks.7.ln_1.weight FLOAT[512] 61b0de288a89
transformer.resblocks.7.ln_2.bias FLOAT[512] a38b04aaa2e8
transformer.resblocks.7.ln_2.weight FLOAT[512] 06faac3e5536
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] c88023cd5eb6
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 4a1deddacab9
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] c934894f298d
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 037f8a993dd2
transformer.resblocks.8.ln_1.bias FLOAT[512] fedfb9623631
transformer.resblocks.8.ln_1.weight FLOAT[512] c45070cd77ca
transformer.resblocks.8.ln_2.bias FLOAT[512] 86185bef383f
transformer.resblocks.8.ln_2.weight FLOAT[512] 997d7368da64
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 449bf1e311d6
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] fd9834ba0bb7
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] d6d4213f704a
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] c6d5cb8cd033
transformer.resblocks.9.ln_1.bias FLOAT[512] 2f744d6a9e98
transformer.resblocks.9.ln_1.weight FLOAT[512] 21d45260ad4e
transformer.resblocks.9.ln_2.bias FLOAT[512] a16e29855e7f
transformer.resblocks.9.ln_2.weight FLOAT[512] 0c53137ead2b
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 18cf1bc59b7e
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 3c76ac816334
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2048,512] e56df071d38b
val_11 FLOAT[512,1536] 1480e04ca6c6
val_12 FLOAT[512,2048] dc6b0c1d5b26
val_13 FLOAT[2048,512] 9033f3f78ae2
val_14 FLOAT[512,1536] a13f220ecee2
val_15 FLOAT[512,2048] 22ca2ab7a588
val_16 FLOAT[2048,512] 41027b8a8491
val_17 FLOAT[512,1536] 36385e62122b
val_18 FLOAT[512,2048] 0e2e8ab8eaf8
val_19 FLOAT[2048,512] 8c1896a4b911
val_2 FLOAT[512,1536] 901a9e767321
val_20 FLOAT[512,1536] 552f28cfa6cb
val_21 FLOAT[512,2048] e8087ba27400
val_22 FLOAT[2048,512] 2bd883a349b4
val_23 FLOAT[512,1536] 372106397fdf
val_24 FLOAT[512,2048] 0aec1ee99352
val_25 FLOAT[2048,512] 2b4caaa5a0c5
val_26 FLOAT[512,1536] dc40256cf82a
val_27 FLOAT[512,2048] 29bb709b7951
val_28 FLOAT[2048,512] fda3bb3e7129
val_29 FLOAT[512,1536] e1012784cbc5
val_3 FLOAT[512,2048] 790b80dc3775
val_30 FLOAT[512,2048] e690475b30e7
val_31 FLOAT[2048,512] e7047af54237
val_32 FLOAT[512,1536] ace20266d8a8
val_33 FLOAT[512,2048] 4c089438f6d8
val_34 FLOAT[2048,512] 51134218304e
val_35 FLOAT[512,1536] d579c15a4fc3
val_36 FLOAT[512,2048] 0a8a2c8dab02
val_37 FLOAT[2048,512] d49839f870c0
val_4 FLOAT[2048,512] 0c7f2ec26951
val_5 FLOAT[512,1536] e3b427c9de83
val_6 FLOAT[512,2048] 9a5989c2a163
val_7 FLOAT[2048,512] 8f247c373e5d
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[512,1536] 1dbdba123df1
val_9 FLOAT[512,2048] c9dadd47945e
+810
View File
@@ -0,0 +1,810 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,1024,14,14] add_1016
float[batch,1024,14,14] add_1092
float[batch,1024,14,14] add_1168
float[batch,1024,14,14] add_1244
float[batch,1024,14,14] add_1320
float[batch,1024,14,14] add_1396
float[batch,256,56,56] add_140
float[batch,1024,14,14] add_1472
float[batch,1024,14,14] add_1548
float[batch,1024,14,14] add_1624
float[batch,1024,14,14] add_1700
float[batch,1024,14,14] add_1776
float[batch,1024,14,14] add_1852
float[batch,1024,14,14] add_1928
float[batch,1024,14,14] add_2004
float[batch,1024,14,14] add_2080
float[batch,1024,14,14] add_2156
float[batch,256,56,56] add_216
float[batch,1024,14,14] add_2232
float[batch,1024,14,14] add_2308
float[batch,1024,14,14] add_2384
float[batch,2048,7,7] add_2480
float[batch,2048,7,7] add_2556
float[batch,2048,7,7] add_2632
float[50,batch,2048] add_2662
float[batch,256,56,56] add_292
float[batch,512,28,28] add_388
float[batch,512,28,28] add_464
float[batch,512,28,28] add_540
float[batch,512,28,28] add_616
float[batch,1024,14,14] add_712
float[batch,1024,14,14] add_788
float[batch,1024,14,14] add_864
float[batch,1024,14,14] add_940
float[batch,64,56,56] avg_pool2d
float[batch,128,28,28] avg_pool2d_2
float[batch,256,28,28] avg_pool2d_3
float[batch,256,14,14] avg_pool2d_4
float[batch,512,14,14] avg_pool2d_5
float[batch,512,7,7] avg_pool2d_6
float[batch,1024,7,7] avg_pool2d_7
float[50,batch,2048] cat
float[batch,1] clamp_min
float[batch,32,112,112] getitem
float[batch,256,14,14] getitem_102
float[batch,1024,14,14] getitem_105
float[batch,256,14,14] getitem_108
float[batch,256,14,14] getitem_111
float[batch,1024,14,14] getitem_114
float[batch,256,14,14] getitem_117
float[batch,64,56,56] getitem_12
float[batch,256,14,14] getitem_120
float[batch,1024,14,14] getitem_123
float[batch,256,14,14] getitem_126
float[batch,256,14,14] getitem_129
float[batch,1024,14,14] getitem_132
float[batch,256,14,14] getitem_135
float[batch,256,14,14] getitem_138
float[batch,1024,14,14] getitem_141
float[batch,256,14,14] getitem_144
float[batch,256,14,14] getitem_147
float[batch,256,56,56] getitem_15
float[batch,1024,14,14] getitem_150
float[batch,256,14,14] getitem_153
float[batch,256,14,14] getitem_156
float[batch,1024,14,14] getitem_159
float[batch,256,14,14] getitem_162
float[batch,256,14,14] getitem_165
float[batch,1024,14,14] getitem_168
float[batch,256,14,14] getitem_171
float[batch,256,14,14] getitem_174
float[batch,1024,14,14] getitem_177
float[batch,256,56,56] getitem_18
float[batch,256,14,14] getitem_180
float[batch,256,14,14] getitem_183
float[batch,1024,14,14] getitem_186
float[batch,256,14,14] getitem_189
float[batch,256,14,14] getitem_192
float[batch,1024,14,14] getitem_195
float[batch,256,14,14] getitem_198
float[batch,256,14,14] getitem_201
float[batch,1024,14,14] getitem_204
float[batch,256,14,14] getitem_207
float[batch,64,56,56] getitem_21
float[batch,256,14,14] getitem_210
float[batch,1024,14,14] getitem_213
float[batch,256,14,14] getitem_216
float[batch,256,14,14] getitem_219
float[batch,1024,14,14] getitem_222
float[batch,256,14,14] getitem_225
float[batch,256,14,14] getitem_228
float[batch,1024,14,14] getitem_231
float[batch,256,14,14] getitem_234
float[batch,256,14,14] getitem_237
float[batch,64,56,56] getitem_24
float[batch,1024,14,14] getitem_240
float[batch,256,14,14] getitem_243
float[batch,256,14,14] getitem_246
float[batch,1024,14,14] getitem_249
float[batch,256,14,14] getitem_252
float[batch,256,14,14] getitem_255
float[batch,1024,14,14] getitem_258
float[batch,256,14,14] getitem_261
float[batch,256,14,14] getitem_264
float[batch,1024,14,14] getitem_267
float[batch,256,56,56] getitem_27
float[batch,256,14,14] getitem_270
float[batch,256,14,14] getitem_273
float[batch,1024,14,14] getitem_276
float[batch,256,14,14] getitem_279
float[batch,256,14,14] getitem_282
float[batch,1024,14,14] getitem_285
float[batch,512,14,14] getitem_288
float[batch,512,14,14] getitem_291
float[batch,2048,7,7] getitem_294
float[batch,2048,7,7] getitem_297
float[batch,32,112,112] getitem_3
float[batch,64,56,56] getitem_30
float[batch,512,7,7] getitem_300
float[batch,512,7,7] getitem_303
float[batch,2048,7,7] getitem_306
float[batch,512,7,7] getitem_309
float[batch,512,7,7] getitem_312
float[batch,2048,7,7] getitem_315
float[batch,64,56,56] getitem_33
float[batch,256,56,56] getitem_36
float[batch,128,56,56] getitem_39
float[batch,128,56,56] getitem_42
float[batch,512,28,28] getitem_45
float[batch,512,28,28] getitem_48
float[batch,128,28,28] getitem_51
float[batch,128,28,28] getitem_54
float[batch,512,28,28] getitem_57
float[batch,64,112,112] getitem_6
float[batch,128,28,28] getitem_60
float[batch,128,28,28] getitem_63
float[batch,512,28,28] getitem_66
float[batch,128,28,28] getitem_69
float[batch,128,28,28] getitem_72
float[batch,512,28,28] getitem_75
float[batch,256,28,28] getitem_78
float[batch,256,28,28] getitem_81
float[batch,1024,14,14] getitem_84
float[batch,1024,14,14] getitem_87
float[batch,64,56,56] getitem_9
float[batch,256,14,14] getitem_90
float[batch,256,14,14] getitem_93
float[batch,1024,14,14] getitem_96
float[batch,256,14,14] getitem_99
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,224,224,3] image_shifted
float[batch,1] linalg_vector_norm
float[1,batch,2048] linear
float[50,batch,2048] linear_1
float[50,batch,2048] linear_2
float[batch,512] linear_3
float[1,batch,2048] mean
float[1,batch,2048] node_scaled_dot_product_attention_q_row
float[49,batch,2048] permute_1
float[1,batch,32,64] permute_2
float[batch,32,112,112] relu
float[batch,32,112,112] relu_1
float[batch,64,56,56] relu_10
float[batch,512,7,7] relu_100
float[batch,2048,7,7] relu_101
float[batch,256,56,56] relu_11
float[batch,128,56,56] relu_12
float[batch,128,56,56] relu_13
float[batch,512,28,28] relu_14
float[batch,128,28,28] relu_15
float[batch,128,28,28] relu_16
float[batch,512,28,28] relu_17
float[batch,128,28,28] relu_18
float[batch,128,28,28] relu_19
float[batch,64,112,112] relu_2
float[batch,512,28,28] relu_20
float[batch,128,28,28] relu_21
float[batch,128,28,28] relu_22
float[batch,512,28,28] relu_23
float[batch,256,28,28] relu_24
float[batch,256,28,28] relu_25
float[batch,1024,14,14] relu_26
float[batch,256,14,14] relu_27
float[batch,256,14,14] relu_28
float[batch,1024,14,14] relu_29
float[batch,64,56,56] relu_3
float[batch,256,14,14] relu_30
float[batch,256,14,14] relu_31
float[batch,1024,14,14] relu_32
float[batch,256,14,14] relu_33
float[batch,256,14,14] relu_34
float[batch,1024,14,14] relu_35
float[batch,256,14,14] relu_36
float[batch,256,14,14] relu_37
float[batch,1024,14,14] relu_38
float[batch,256,14,14] relu_39
float[batch,64,56,56] relu_4
float[batch,256,14,14] relu_40
float[batch,1024,14,14] relu_41
float[batch,256,14,14] relu_42
float[batch,256,14,14] relu_43
float[batch,1024,14,14] relu_44
float[batch,256,14,14] relu_45
float[batch,256,14,14] relu_46
float[batch,1024,14,14] relu_47
float[batch,256,14,14] relu_48
float[batch,256,14,14] relu_49
float[batch,256,56,56] relu_5
float[batch,1024,14,14] relu_50
float[batch,256,14,14] relu_51
float[batch,256,14,14] relu_52
float[batch,1024,14,14] relu_53
float[batch,256,14,14] relu_54
float[batch,256,14,14] relu_55
float[batch,1024,14,14] relu_56
float[batch,256,14,14] relu_57
float[batch,256,14,14] relu_58
float[batch,1024,14,14] relu_59
float[batch,64,56,56] relu_6
float[batch,256,14,14] relu_60
float[batch,256,14,14] relu_61
float[batch,1024,14,14] relu_62
float[batch,256,14,14] relu_63
float[batch,256,14,14] relu_64
float[batch,1024,14,14] relu_65
float[batch,256,14,14] relu_66
float[batch,256,14,14] relu_67
float[batch,1024,14,14] relu_68
float[batch,256,14,14] relu_69
float[batch,64,56,56] relu_7
float[batch,256,14,14] relu_70
float[batch,1024,14,14] relu_71
float[batch,256,14,14] relu_72
float[batch,256,14,14] relu_73
float[batch,1024,14,14] relu_74
float[batch,256,14,14] relu_75
float[batch,256,14,14] relu_76
float[batch,1024,14,14] relu_77
float[batch,256,14,14] relu_78
float[batch,256,14,14] relu_79
float[batch,256,56,56] relu_8
float[batch,1024,14,14] relu_80
float[batch,256,14,14] relu_81
float[batch,256,14,14] relu_82
float[batch,1024,14,14] relu_83
float[batch,256,14,14] relu_84
float[batch,256,14,14] relu_85
float[batch,1024,14,14] relu_86
float[batch,256,14,14] relu_87
float[batch,256,14,14] relu_88
float[batch,1024,14,14] relu_89
float[batch,64,56,56] relu_9
float[batch,256,14,14] relu_90
float[batch,256,14,14] relu_91
float[batch,1024,14,14] relu_92
float[batch,512,14,14] relu_93
float[batch,512,14,14] relu_94
float[batch,2048,7,7] relu_95
float[batch,512,7,7] relu_96
float[batch,512,7,7] relu_97
float[batch,2048,7,7] relu_98
float[batch,512,7,7] relu_99
float[batch,32,1,64] scaled_dot_product_attention
float[batch,512] select
float[2048] split_split_0
float[2048] split_split_1
float[2048] split_split_2
float[unk__1,1,64] transpose
float[unk__1,50,64] transpose_1
float[unk__1,50,64] transpose_2
float[50,1,2048] unsqueeze
float[1,batch,2048] val_7
float[50,batch,2048] val_8
float[50,batch,2048] val_9
float[1,batch,512] view_10
float[batch,2048,49] view_2
float[1,unk__1,64] view_3
float[50,unk__1,64] view_4
float[50,unk__1,64] view_5
float[batch,32,1,64] view_6
float[batch,32,50,64] view_7
float[batch,32,50,64] view_8
float[batch,2048] view_9
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_shift] image_shifted = Sub (image_f32, image_shift)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
[node_relu] relu = Relu (getitem)
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
relu_1 = Relu (getitem_3)
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
relu_2 = Relu (getitem_6)
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
relu_3 = Relu (getitem_9)
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
relu_4 = Relu (getitem_12)
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
add_140 = Add (getitem_15, getitem_18)
relu_5 = Relu (add_140)
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
relu_6 = Relu (getitem_21)
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
relu_7 = Relu (getitem_24)
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
add_216 = Add (getitem_27, relu_5)
relu_8 = Relu (add_216)
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
relu_9 = Relu (getitem_30)
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
relu_10 = Relu (getitem_33)
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
add_292 = Add (getitem_36, relu_8)
relu_11 = Relu (add_292)
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
relu_12 = Relu (getitem_39)
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
relu_13 = Relu (getitem_42)
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_13)
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_11)
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
add_388 = Add (getitem_45, getitem_48)
relu_14 = Relu (add_388)
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
relu_15 = Relu (getitem_51)
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
relu_16 = Relu (getitem_54)
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
add_464 = Add (getitem_57, relu_14)
relu_17 = Relu (add_464)
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
relu_18 = Relu (getitem_60)
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
relu_19 = Relu (getitem_63)
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
add_540 = Add (getitem_66, relu_17)
relu_20 = Relu (add_540)
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
relu_21 = Relu (getitem_69)
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
relu_22 = Relu (getitem_72)
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
add_616 = Add (getitem_75, relu_20)
relu_23 = Relu (add_616)
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
relu_24 = Relu (getitem_78)
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
relu_25 = Relu (getitem_81)
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_25)
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_23)
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
add_712 = Add (getitem_84, getitem_87)
relu_26 = Relu (add_712)
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
relu_27 = Relu (getitem_90)
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
relu_28 = Relu (getitem_93)
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
add_788 = Add (getitem_96, relu_26)
relu_29 = Relu (add_788)
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
relu_30 = Relu (getitem_99)
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
relu_31 = Relu (getitem_102)
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
add_864 = Add (getitem_105, relu_29)
relu_32 = Relu (add_864)
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
relu_33 = Relu (getitem_108)
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
relu_34 = Relu (getitem_111)
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
add_940 = Add (getitem_114, relu_32)
relu_35 = Relu (add_940)
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
relu_36 = Relu (getitem_117)
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
relu_37 = Relu (getitem_120)
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
add_1016 = Add (getitem_123, relu_35)
relu_38 = Relu (add_1016)
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
relu_39 = Relu (getitem_126)
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
relu_40 = Relu (getitem_129)
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
add_1092 = Add (getitem_132, relu_38)
relu_41 = Relu (add_1092)
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer3.6.conv1.weight", "visual.layer3.6.conv1.weight_bias")
relu_42 = Relu (getitem_135)
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer3.6.conv2.weight", "visual.layer3.6.conv2.weight_bias")
relu_43 = Relu (getitem_138)
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_43, "visual.layer3.6.conv3.weight", "visual.layer3.6.conv3.weight_bias")
add_1168 = Add (getitem_141, relu_41)
relu_44 = Relu (add_1168)
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer3.7.conv1.weight", "visual.layer3.7.conv1.weight_bias")
relu_45 = Relu (getitem_144)
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer3.7.conv2.weight", "visual.layer3.7.conv2.weight_bias")
relu_46 = Relu (getitem_147)
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer3.7.conv3.weight", "visual.layer3.7.conv3.weight_bias")
add_1244 = Add (getitem_150, relu_44)
relu_47 = Relu (add_1244)
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer3.8.conv1.weight", "visual.layer3.8.conv1.weight_bias")
relu_48 = Relu (getitem_153)
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer3.8.conv2.weight", "visual.layer3.8.conv2.weight_bias")
relu_49 = Relu (getitem_156)
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer3.8.conv3.weight", "visual.layer3.8.conv3.weight_bias")
add_1320 = Add (getitem_159, relu_47)
relu_50 = Relu (add_1320)
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_50, "visual.layer3.9.conv1.weight", "visual.layer3.9.conv1.weight_bias")
relu_51 = Relu (getitem_162)
getitem_165 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_51, "visual.layer3.9.conv2.weight", "visual.layer3.9.conv2.weight_bias")
relu_52 = Relu (getitem_165)
getitem_168 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_52, "visual.layer3.9.conv3.weight", "visual.layer3.9.conv3.weight_bias")
add_1396 = Add (getitem_168, relu_50)
relu_53 = Relu (add_1396)
getitem_171 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_53, "visual.layer3.10.conv1.weight", "visual.layer3.10.conv1.weight_bias")
relu_54 = Relu (getitem_171)
getitem_174 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_54, "visual.layer3.10.conv2.weight", "visual.layer3.10.conv2.weight_bias")
relu_55 = Relu (getitem_174)
getitem_177 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_55, "visual.layer3.10.conv3.weight", "visual.layer3.10.conv3.weight_bias")
add_1472 = Add (getitem_177, relu_53)
relu_56 = Relu (add_1472)
getitem_180 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_56, "visual.layer3.11.conv1.weight", "visual.layer3.11.conv1.weight_bias")
relu_57 = Relu (getitem_180)
getitem_183 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_57, "visual.layer3.11.conv2.weight", "visual.layer3.11.conv2.weight_bias")
relu_58 = Relu (getitem_183)
getitem_186 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_58, "visual.layer3.11.conv3.weight", "visual.layer3.11.conv3.weight_bias")
add_1548 = Add (getitem_186, relu_56)
relu_59 = Relu (add_1548)
getitem_189 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_59, "visual.layer3.12.conv1.weight", "visual.layer3.12.conv1.weight_bias")
relu_60 = Relu (getitem_189)
getitem_192 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_60, "visual.layer3.12.conv2.weight", "visual.layer3.12.conv2.weight_bias")
relu_61 = Relu (getitem_192)
getitem_195 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_61, "visual.layer3.12.conv3.weight", "visual.layer3.12.conv3.weight_bias")
add_1624 = Add (getitem_195, relu_59)
relu_62 = Relu (add_1624)
getitem_198 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_62, "visual.layer3.13.conv1.weight", "visual.layer3.13.conv1.weight_bias")
relu_63 = Relu (getitem_198)
getitem_201 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_63, "visual.layer3.13.conv2.weight", "visual.layer3.13.conv2.weight_bias")
relu_64 = Relu (getitem_201)
getitem_204 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_64, "visual.layer3.13.conv3.weight", "visual.layer3.13.conv3.weight_bias")
add_1700 = Add (getitem_204, relu_62)
relu_65 = Relu (add_1700)
getitem_207 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_65, "visual.layer3.14.conv1.weight", "visual.layer3.14.conv1.weight_bias")
relu_66 = Relu (getitem_207)
getitem_210 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_66, "visual.layer3.14.conv2.weight", "visual.layer3.14.conv2.weight_bias")
relu_67 = Relu (getitem_210)
getitem_213 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_67, "visual.layer3.14.conv3.weight", "visual.layer3.14.conv3.weight_bias")
add_1776 = Add (getitem_213, relu_65)
relu_68 = Relu (add_1776)
getitem_216 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_68, "visual.layer3.15.conv1.weight", "visual.layer3.15.conv1.weight_bias")
relu_69 = Relu (getitem_216)
getitem_219 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_69, "visual.layer3.15.conv2.weight", "visual.layer3.15.conv2.weight_bias")
relu_70 = Relu (getitem_219)
getitem_222 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_70, "visual.layer3.15.conv3.weight", "visual.layer3.15.conv3.weight_bias")
add_1852 = Add (getitem_222, relu_68)
relu_71 = Relu (add_1852)
getitem_225 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_71, "visual.layer3.16.conv1.weight", "visual.layer3.16.conv1.weight_bias")
relu_72 = Relu (getitem_225)
getitem_228 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_72, "visual.layer3.16.conv2.weight", "visual.layer3.16.conv2.weight_bias")
relu_73 = Relu (getitem_228)
getitem_231 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_73, "visual.layer3.16.conv3.weight", "visual.layer3.16.conv3.weight_bias")
add_1928 = Add (getitem_231, relu_71)
relu_74 = Relu (add_1928)
getitem_234 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_74, "visual.layer3.17.conv1.weight", "visual.layer3.17.conv1.weight_bias")
relu_75 = Relu (getitem_234)
getitem_237 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_75, "visual.layer3.17.conv2.weight", "visual.layer3.17.conv2.weight_bias")
relu_76 = Relu (getitem_237)
getitem_240 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_76, "visual.layer3.17.conv3.weight", "visual.layer3.17.conv3.weight_bias")
add_2004 = Add (getitem_240, relu_74)
relu_77 = Relu (add_2004)
getitem_243 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_77, "visual.layer3.18.conv1.weight", "visual.layer3.18.conv1.weight_bias")
relu_78 = Relu (getitem_243)
getitem_246 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_78, "visual.layer3.18.conv2.weight", "visual.layer3.18.conv2.weight_bias")
relu_79 = Relu (getitem_246)
getitem_249 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_79, "visual.layer3.18.conv3.weight", "visual.layer3.18.conv3.weight_bias")
add_2080 = Add (getitem_249, relu_77)
relu_80 = Relu (add_2080)
getitem_252 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_80, "visual.layer3.19.conv1.weight", "visual.layer3.19.conv1.weight_bias")
relu_81 = Relu (getitem_252)
getitem_255 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_81, "visual.layer3.19.conv2.weight", "visual.layer3.19.conv2.weight_bias")
relu_82 = Relu (getitem_255)
getitem_258 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_82, "visual.layer3.19.conv3.weight", "visual.layer3.19.conv3.weight_bias")
add_2156 = Add (getitem_258, relu_80)
relu_83 = Relu (add_2156)
getitem_261 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_83, "visual.layer3.20.conv1.weight", "visual.layer3.20.conv1.weight_bias")
relu_84 = Relu (getitem_261)
getitem_264 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_84, "visual.layer3.20.conv2.weight", "visual.layer3.20.conv2.weight_bias")
relu_85 = Relu (getitem_264)
getitem_267 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_85, "visual.layer3.20.conv3.weight", "visual.layer3.20.conv3.weight_bias")
add_2232 = Add (getitem_267, relu_83)
relu_86 = Relu (add_2232)
getitem_270 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_86, "visual.layer3.21.conv1.weight", "visual.layer3.21.conv1.weight_bias")
relu_87 = Relu (getitem_270)
getitem_273 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_87, "visual.layer3.21.conv2.weight", "visual.layer3.21.conv2.weight_bias")
relu_88 = Relu (getitem_273)
getitem_276 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_88, "visual.layer3.21.conv3.weight", "visual.layer3.21.conv3.weight_bias")
add_2308 = Add (getitem_276, relu_86)
relu_89 = Relu (add_2308)
getitem_279 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_89, "visual.layer3.22.conv1.weight", "visual.layer3.22.conv1.weight_bias")
relu_90 = Relu (getitem_279)
getitem_282 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_90, "visual.layer3.22.conv2.weight", "visual.layer3.22.conv2.weight_bias")
relu_91 = Relu (getitem_282)
getitem_285 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_91, "visual.layer3.22.conv3.weight", "visual.layer3.22.conv3.weight_bias")
add_2384 = Add (getitem_285, relu_89)
relu_92 = Relu (add_2384)
getitem_288 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_92, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
relu_93 = Relu (getitem_288)
getitem_291 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_93, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
relu_94 = Relu (getitem_291)
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_94)
getitem_294 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_92)
getitem_297 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
add_2480 = Add (getitem_294, getitem_297)
relu_95 = Relu (add_2480)
getitem_300 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_95, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
relu_96 = Relu (getitem_300)
getitem_303 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_96, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
relu_97 = Relu (getitem_303)
getitem_306 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_97, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
add_2556 = Add (getitem_306, relu_95)
relu_98 = Relu (add_2556)
getitem_309 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_98, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
relu_99 = Relu (getitem_309)
getitem_312 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_99, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
relu_100 = Relu (getitem_312)
getitem_315 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_100, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
add_2632 = Add (getitem_315, relu_98)
relu_101 = Relu (add_2632)
view_2 = Reshape <allowzero: int = 1> (relu_101, view_2_target)
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
add_2662 = Add (cat, unsqueeze)
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
node_scaled_dot_product_attention_q_row = Slice (add_2662, val_0, val_3, val_0)
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
[node_linear] linear = Add (val_7, split_split_0)
val_8 = MatMul (add_2662, val_5)
linear_1 = Add (val_8, split_split_1)
val_9 = MatMul (add_2662, val_6)
linear_2 = Add (val_9, split_split_2)
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
select = Squeeze (view_10, val_0)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
cat_1 FLOAT[6144] 43b166ed7897
image_shift FLOAT[3] 2f7a50e604ad
node_scaled_dot_product_attention_out_1 INT64[3] b6639c8d94ec
node_scaled_dot_product_attention_q_pack_1 INT64[4] f7b9b5620534
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
val_0 INT64[1] af5570f5a181
val_1 INT64[1] 12a3ae445661
val_2 FLOAT[] 6708d9be4956
val_3 INT64[1] 7c9fa136d441
val_4 FLOAT[2048,2048] 1830071595a0
val_5 FLOAT[2048,2048] 0d0c88316b4a
val_6 FLOAT[2048,2048] 2715735c2c1a
view_2_target INT64[3] 68ffb9ecb5ec
view_4_target INT64[3] c7a3d94c4eb2
view_7_target INT64[4] e0ea1841387b
view_9_target INT64[2] 76aecb4697fd
visual.attnpool.c_proj.bias FLOAT[512] e318e3e8d1b8
visual.attnpool.c_proj.weight FLOAT[512,2048] d9262bb69358
visual.attnpool.positional_embedding FLOAT[50,2048] 34fb1db035ae
visual.conv1.weight FLOAT[32,3,3,3] 64abe16c2280
visual.conv1.weight_bias FLOAT[32] 124e690ec767
visual.conv2.weight FLOAT[32,32,3,3] a105b19f5ae3
visual.conv2.weight_bias FLOAT[32] dacb7232414b
visual.conv3.weight FLOAT[64,32,3,3] 60b15252b92e
visual.conv3.weight_bias FLOAT[64] f226ddd0b29f
visual.layer1.0.conv1.weight FLOAT[64,64,1,1] e195c32f5591
visual.layer1.0.conv1.weight_bias FLOAT[64] d2ca9824261c
visual.layer1.0.conv2.weight FLOAT[64,64,3,3] 7b7759b1f908
visual.layer1.0.conv2.weight_bias FLOAT[64] 24675ace9379
visual.layer1.0.conv3.weight FLOAT[256,64,1,1] 164ee686902a
visual.layer1.0.conv3.weight_bias FLOAT[256] 1fcd5d5e8c80
visual.layer1.0.downsample.0.weight FLOAT[256,64,1,1] bef1164339fd
visual.layer1.0.downsample.0.weight_bias FLOAT[256] 8e2c9e8ee01f
visual.layer1.1.conv1.weight FLOAT[64,256,1,1] a15a64b1292f
visual.layer1.1.conv1.weight_bias FLOAT[64] 98e61e621efc
visual.layer1.1.conv2.weight FLOAT[64,64,3,3] 144c8d32188c
visual.layer1.1.conv2.weight_bias FLOAT[64] e00a89dbf4f0
visual.layer1.1.conv3.weight FLOAT[256,64,1,1] 542aae81da85
visual.layer1.1.conv3.weight_bias FLOAT[256] 2827aa5546c4
visual.layer1.2.conv1.weight FLOAT[64,256,1,1] 538f399c5716
visual.layer1.2.conv1.weight_bias FLOAT[64] 96d99ca66fa7
visual.layer1.2.conv2.weight FLOAT[64,64,3,3] e58a9c4314b7
visual.layer1.2.conv2.weight_bias FLOAT[64] 365d8479aaaa
visual.layer1.2.conv3.weight FLOAT[256,64,1,1] 20fae160bef4
visual.layer1.2.conv3.weight_bias FLOAT[256] 180418939541
visual.layer2.0.conv1.weight FLOAT[128,256,1,1] bf7f3546e69f
visual.layer2.0.conv1.weight_bias FLOAT[128] 19ae59f827a0
visual.layer2.0.conv2.weight FLOAT[128,128,3,3] 9abd5129aeba
visual.layer2.0.conv2.weight_bias FLOAT[128] 943d4fcd74bc
visual.layer2.0.conv3.weight FLOAT[512,128,1,1] 9707078edbd2
visual.layer2.0.conv3.weight_bias FLOAT[512] c4d81efc28ca
visual.layer2.0.downsample.0.weight FLOAT[512,256,1,1] c6caa02d8537
visual.layer2.0.downsample.0.weight_bias FLOAT[512] 3966ec107a2b
visual.layer2.1.conv1.weight FLOAT[128,512,1,1] 0aa4b8b16d09
visual.layer2.1.conv1.weight_bias FLOAT[128] 0fc98e7d30d0
visual.layer2.1.conv2.weight FLOAT[128,128,3,3] e74d0ce70e23
visual.layer2.1.conv2.weight_bias FLOAT[128] 3fb8c3c32826
visual.layer2.1.conv3.weight FLOAT[512,128,1,1] 07522ea89d64
visual.layer2.1.conv3.weight_bias FLOAT[512] fe4778ae2f35
visual.layer2.2.conv1.weight FLOAT[128,512,1,1] 27f8d8b63847
visual.layer2.2.conv1.weight_bias FLOAT[128] 8c848b272f84
visual.layer2.2.conv2.weight FLOAT[128,128,3,3] 6e3d210305b6
visual.layer2.2.conv2.weight_bias FLOAT[128] d786b710ee57
visual.layer2.2.conv3.weight FLOAT[512,128,1,1] 61088d0c1408
visual.layer2.2.conv3.weight_bias FLOAT[512] 8f3ac9629094
visual.layer2.3.conv1.weight FLOAT[128,512,1,1] 83c0d544ba19
visual.layer2.3.conv1.weight_bias FLOAT[128] 9139c65714bb
visual.layer2.3.conv2.weight FLOAT[128,128,3,3] 5a92a46b0f7f
visual.layer2.3.conv2.weight_bias FLOAT[128] 56179726dc82
visual.layer2.3.conv3.weight FLOAT[512,128,1,1] 3935cdc24cc8
visual.layer2.3.conv3.weight_bias FLOAT[512] ec827bd45606
visual.layer3.0.conv1.weight FLOAT[256,512,1,1] e37983058e82
visual.layer3.0.conv1.weight_bias FLOAT[256] d91a009e585b
visual.layer3.0.conv2.weight FLOAT[256,256,3,3] d42d6104446d
visual.layer3.0.conv2.weight_bias FLOAT[256] 8b9969e0c8c0
visual.layer3.0.conv3.weight FLOAT[1024,256,1,1] d8c78ce9ef74
visual.layer3.0.conv3.weight_bias FLOAT[1024] 950b201ba19f
visual.layer3.0.downsample.0.weight FLOAT[1024,512,1,1] 3747fbb0d7dd
visual.layer3.0.downsample.0.weight_bias FLOAT[1024] 81cf7a0d5bcf
visual.layer3.1.conv1.weight FLOAT[256,1024,1,1] 0f7cbb3ccbc5
visual.layer3.1.conv1.weight_bias FLOAT[256] 468421dc2fe0
visual.layer3.1.conv2.weight FLOAT[256,256,3,3] 8799b1c2a315
visual.layer3.1.conv2.weight_bias FLOAT[256] f848659b7ccb
visual.layer3.1.conv3.weight FLOAT[1024,256,1,1] cc3a04bd880a
visual.layer3.1.conv3.weight_bias FLOAT[1024] 0d490e7cd4de
visual.layer3.10.conv1.weight FLOAT[256,1024,1,1] eff05ebef0a6
visual.layer3.10.conv1.weight_bias FLOAT[256] 557f1b79b311
visual.layer3.10.conv2.weight FLOAT[256,256,3,3] dd8271cac6e0
visual.layer3.10.conv2.weight_bias FLOAT[256] 7ab27b1d6e2b
visual.layer3.10.conv3.weight FLOAT[1024,256,1,1] 19617be1cb83
visual.layer3.10.conv3.weight_bias FLOAT[1024] e8475a5e9427
visual.layer3.11.conv1.weight FLOAT[256,1024,1,1] d7258f7f9ecf
visual.layer3.11.conv1.weight_bias FLOAT[256] 022250d83dc7
visual.layer3.11.conv2.weight FLOAT[256,256,3,3] b76ac1b5f4db
visual.layer3.11.conv2.weight_bias FLOAT[256] 066f410cc1e9
visual.layer3.11.conv3.weight FLOAT[1024,256,1,1] 9ab6c7fcf594
visual.layer3.11.conv3.weight_bias FLOAT[1024] d28e5671632e
visual.layer3.12.conv1.weight FLOAT[256,1024,1,1] f101d8db595a
visual.layer3.12.conv1.weight_bias FLOAT[256] 00683f611205
visual.layer3.12.conv2.weight FLOAT[256,256,3,3] a249af066395
visual.layer3.12.conv2.weight_bias FLOAT[256] 5341715541bf
visual.layer3.12.conv3.weight FLOAT[1024,256,1,1] 715a68d9f254
visual.layer3.12.conv3.weight_bias FLOAT[1024] 79464a731dbd
visual.layer3.13.conv1.weight FLOAT[256,1024,1,1] 238fee3e9b7e
visual.layer3.13.conv1.weight_bias FLOAT[256] 509670797ab2
visual.layer3.13.conv2.weight FLOAT[256,256,3,3] 8b429266d488
visual.layer3.13.conv2.weight_bias FLOAT[256] a966c4c47166
visual.layer3.13.conv3.weight FLOAT[1024,256,1,1] 60d4a61f3178
visual.layer3.13.conv3.weight_bias FLOAT[1024] 65cdf2f53817
visual.layer3.14.conv1.weight FLOAT[256,1024,1,1] 93e604164188
visual.layer3.14.conv1.weight_bias FLOAT[256] 90c272f28259
visual.layer3.14.conv2.weight FLOAT[256,256,3,3] bbbe57156768
visual.layer3.14.conv2.weight_bias FLOAT[256] da20369c55fc
visual.layer3.14.conv3.weight FLOAT[1024,256,1,1] 9965e4ec1ac6
visual.layer3.14.conv3.weight_bias FLOAT[1024] cf494f7d6c3f
visual.layer3.15.conv1.weight FLOAT[256,1024,1,1] b65355538dff
visual.layer3.15.conv1.weight_bias FLOAT[256] 47dfeaeddae8
visual.layer3.15.conv2.weight FLOAT[256,256,3,3] d746daee990d
visual.layer3.15.conv2.weight_bias FLOAT[256] 7775c1101726
visual.layer3.15.conv3.weight FLOAT[1024,256,1,1] 7bd988155a96
visual.layer3.15.conv3.weight_bias FLOAT[1024] 635de314fbe5
visual.layer3.16.conv1.weight FLOAT[256,1024,1,1] 8c72a7f5d24b
visual.layer3.16.conv1.weight_bias FLOAT[256] 46c5adcf8919
visual.layer3.16.conv2.weight FLOAT[256,256,3,3] 628024376db8
visual.layer3.16.conv2.weight_bias FLOAT[256] 53625854e635
visual.layer3.16.conv3.weight FLOAT[1024,256,1,1] c40c4360ee14
visual.layer3.16.conv3.weight_bias FLOAT[1024] e2578a7bc679
visual.layer3.17.conv1.weight FLOAT[256,1024,1,1] 35a2ad37cfe6
visual.layer3.17.conv1.weight_bias FLOAT[256] 01ad0ebee036
visual.layer3.17.conv2.weight FLOAT[256,256,3,3] 20754130d77a
visual.layer3.17.conv2.weight_bias FLOAT[256] ec196fda11dc
visual.layer3.17.conv3.weight FLOAT[1024,256,1,1] ceb74147d09d
visual.layer3.17.conv3.weight_bias FLOAT[1024] ffd9373f84f1
visual.layer3.18.conv1.weight FLOAT[256,1024,1,1] e581d085e34f
visual.layer3.18.conv1.weight_bias FLOAT[256] 796dc15ab13e
visual.layer3.18.conv2.weight FLOAT[256,256,3,3] 217efcfbc758
visual.layer3.18.conv2.weight_bias FLOAT[256] 24b7c2693aff
visual.layer3.18.conv3.weight FLOAT[1024,256,1,1] 03aecbb7da0a
visual.layer3.18.conv3.weight_bias FLOAT[1024] 5243e4ecba01
visual.layer3.19.conv1.weight FLOAT[256,1024,1,1] fb40a9ec919a
visual.layer3.19.conv1.weight_bias FLOAT[256] 9f51e9ac974a
visual.layer3.19.conv2.weight FLOAT[256,256,3,3] b536cb636767
visual.layer3.19.conv2.weight_bias FLOAT[256] 0cd34046767f
visual.layer3.19.conv3.weight FLOAT[1024,256,1,1] f6704ecf40c0
visual.layer3.19.conv3.weight_bias FLOAT[1024] 46e4d6f9abd7
visual.layer3.2.conv1.weight FLOAT[256,1024,1,1] 1f90bd499f45
visual.layer3.2.conv1.weight_bias FLOAT[256] 09a5286ec62e
visual.layer3.2.conv2.weight FLOAT[256,256,3,3] a09f97660a8f
visual.layer3.2.conv2.weight_bias FLOAT[256] 99c53ca962f6
visual.layer3.2.conv3.weight FLOAT[1024,256,1,1] a03fa7438e70
visual.layer3.2.conv3.weight_bias FLOAT[1024] 96f65dbe8421
visual.layer3.20.conv1.weight FLOAT[256,1024,1,1] fad135805bd9
visual.layer3.20.conv1.weight_bias FLOAT[256] 9f1098557e68
visual.layer3.20.conv2.weight FLOAT[256,256,3,3] 4af4e544ef06
visual.layer3.20.conv2.weight_bias FLOAT[256] 9408c9056f53
visual.layer3.20.conv3.weight FLOAT[1024,256,1,1] c09d8abd8d79
visual.layer3.20.conv3.weight_bias FLOAT[1024] 403a2f85a6e7
visual.layer3.21.conv1.weight FLOAT[256,1024,1,1] 70ed3d7dd6c3
visual.layer3.21.conv1.weight_bias FLOAT[256] 67f9a835b1a1
visual.layer3.21.conv2.weight FLOAT[256,256,3,3] 22a4046e56c8
visual.layer3.21.conv2.weight_bias FLOAT[256] f4a8ac66782e
visual.layer3.21.conv3.weight FLOAT[1024,256,1,1] 921266e3a333
visual.layer3.21.conv3.weight_bias FLOAT[1024] 0f7a77a240b7
visual.layer3.22.conv1.weight FLOAT[256,1024,1,1] 51db9c477eb4
visual.layer3.22.conv1.weight_bias FLOAT[256] e72f2f703304
visual.layer3.22.conv2.weight FLOAT[256,256,3,3] cf532b522d69
visual.layer3.22.conv2.weight_bias FLOAT[256] 9d7c283fd588
visual.layer3.22.conv3.weight FLOAT[1024,256,1,1] 60bb6dc64dc7
visual.layer3.22.conv3.weight_bias FLOAT[1024] 2e10a4198e5a
visual.layer3.3.conv1.weight FLOAT[256,1024,1,1] 2f57a087c91f
visual.layer3.3.conv1.weight_bias FLOAT[256] 1f5077976f1b
visual.layer3.3.conv2.weight FLOAT[256,256,3,3] 1df6c8bf38f2
visual.layer3.3.conv2.weight_bias FLOAT[256] 7d9ea29abb45
visual.layer3.3.conv3.weight FLOAT[1024,256,1,1] ffaf486bb7c8
visual.layer3.3.conv3.weight_bias FLOAT[1024] 93c38aedf8a0
visual.layer3.4.conv1.weight FLOAT[256,1024,1,1] 74e3d9b7ef6e
visual.layer3.4.conv1.weight_bias FLOAT[256] 7c605256b20c
visual.layer3.4.conv2.weight FLOAT[256,256,3,3] 0b54cb2cc3fa
visual.layer3.4.conv2.weight_bias FLOAT[256] 73afb3b55285
visual.layer3.4.conv3.weight FLOAT[1024,256,1,1] 21febd1efa28
visual.layer3.4.conv3.weight_bias FLOAT[1024] 0e1d6645ebeb
visual.layer3.5.conv1.weight FLOAT[256,1024,1,1] 700b495bc5d9
visual.layer3.5.conv1.weight_bias FLOAT[256] 155d6dcdabc7
visual.layer3.5.conv2.weight FLOAT[256,256,3,3] 8700f45735bd
visual.layer3.5.conv2.weight_bias FLOAT[256] f9efbf55a305
visual.layer3.5.conv3.weight FLOAT[1024,256,1,1] 6de7a56c5ac3
visual.layer3.5.conv3.weight_bias FLOAT[1024] 8d3ce2b31a6b
visual.layer3.6.conv1.weight FLOAT[256,1024,1,1] 28b798e5d978
visual.layer3.6.conv1.weight_bias FLOAT[256] fef76cc29c73
visual.layer3.6.conv2.weight FLOAT[256,256,3,3] abeebafcf6e1
visual.layer3.6.conv2.weight_bias FLOAT[256] 9ff63eb59206
visual.layer3.6.conv3.weight FLOAT[1024,256,1,1] 9d43ccaac3af
visual.layer3.6.conv3.weight_bias FLOAT[1024] b4037171de0e
visual.layer3.7.conv1.weight FLOAT[256,1024,1,1] 1ab932ba181a
visual.layer3.7.conv1.weight_bias FLOAT[256] ca2b5f101456
visual.layer3.7.conv2.weight FLOAT[256,256,3,3] ec7c7a4462b9
visual.layer3.7.conv2.weight_bias FLOAT[256] 6602c75c4b54
visual.layer3.7.conv3.weight FLOAT[1024,256,1,1] a2a816ebebd4
visual.layer3.7.conv3.weight_bias FLOAT[1024] 42ead0570f3f
visual.layer3.8.conv1.weight FLOAT[256,1024,1,1] 65a1e6e2a9ac
visual.layer3.8.conv1.weight_bias FLOAT[256] f3ce23615022
visual.layer3.8.conv2.weight FLOAT[256,256,3,3] daa5a1a4aec1
visual.layer3.8.conv2.weight_bias FLOAT[256] 6dbb5cf51f67
visual.layer3.8.conv3.weight FLOAT[1024,256,1,1] d68a418f835c
visual.layer3.8.conv3.weight_bias FLOAT[1024] 4eca3e4a9949
visual.layer3.9.conv1.weight FLOAT[256,1024,1,1] ab40ed895315
visual.layer3.9.conv1.weight_bias FLOAT[256] 15eaf0e90b7a
visual.layer3.9.conv2.weight FLOAT[256,256,3,3] f2766f847a2d
visual.layer3.9.conv2.weight_bias FLOAT[256] a501c342e17d
visual.layer3.9.conv3.weight FLOAT[1024,256,1,1] 682f558e1a40
visual.layer3.9.conv3.weight_bias FLOAT[1024] e12217d407a6
visual.layer4.0.conv1.weight FLOAT[512,1024,1,1] 9390c2f115e6
visual.layer4.0.conv1.weight_bias FLOAT[512] a96a15f56ea2
visual.layer4.0.conv2.weight FLOAT[512,512,3,3] 6f46f3db8786
visual.layer4.0.conv2.weight_bias FLOAT[512] bbbb373cd8fc
visual.layer4.0.conv3.weight FLOAT[2048,512,1,1] 480da506450a
visual.layer4.0.conv3.weight_bias FLOAT[2048] 45911f9d4ede
visual.layer4.0.downsample.0.weight FLOAT[2048,1024,1,1] 1dfa4209cd69
visual.layer4.0.downsample.0.weight_bias FLOAT[2048] ec264c60e9a9
visual.layer4.1.conv1.weight FLOAT[512,2048,1,1] eb2f69345705
visual.layer4.1.conv1.weight_bias FLOAT[512] 5de1b4440e4d
visual.layer4.1.conv2.weight FLOAT[512,512,3,3] 3566c6b83f7e
visual.layer4.1.conv2.weight_bias FLOAT[512] 1e250c828acc
visual.layer4.1.conv3.weight FLOAT[2048,512,1,1] 6352b196366c
visual.layer4.1.conv3.weight_bias FLOAT[2048] 15c292abf864
visual.layer4.2.conv1.weight FLOAT[512,2048,1,1] 3a5c04bc8b5d
visual.layer4.2.conv1.weight_bias FLOAT[512] 0991b62339dc
visual.layer4.2.conv2.weight FLOAT[512,512,3,3] 3c9ac30e7976
visual.layer4.2.conv2.weight_bias FLOAT[512] a4fd49beab30
visual.layer4.2.conv3.weight FLOAT[2048,512,1,1] 80801ef70ead
visual.layer4.2.conv3.weight_bias FLOAT[2048] 27f0f2f0a15a
+576
View File
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding)
<
float[batch,77,512] add_1071
float[batch,77,512] add_1092
float[batch,77,512] add_119
float[batch,77,512] add_1207
float[batch,77,512] add_1228
float[batch,77,512] add_1343
float[batch,77,512] add_1364
float[batch,77,512] add_140
float[batch,77,512] add_1479
float[batch,77,512] add_1500
float[batch,1,512] add_1500_pooled
float[batch,1,512] add_1615
float[batch,1,512] add_1636
float[batch,77,512] add_255
float[batch,77,512] add_276
float[batch,77,512] add_391
float[batch,77,512] add_4
float[batch,77,512] add_412
float[batch,77,512] add_527
float[batch,77,512] add_548
float[batch,77,512] add_663
float[batch,77,512] add_684
float[batch,77,512] add_799
float[batch,77,512] add_820
float[batch,77,512] add_935
float[batch,77,512] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,2048] gelu
float[batch,77,2048] gelu_1
float[batch,77,2048] gelu_10
float[batch,1,2048] gelu_11
float[batch,77,2048] gelu_2
float[batch,77,2048] gelu_3
float[batch,77,2048] gelu_4
float[batch,77,2048] gelu_5
float[batch,77,2048] gelu_6
float[batch,77,2048] gelu_7
float[batch,77,2048] gelu_8
float[batch,77,2048] gelu_9
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,1024] matmul
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] val_39
float[batch,77,512] val_40
float[batch,77,2048] val_41
float[batch,77,512] val_42
float[batch,77,2048] val_43
float[batch,77,512] val_44
float[batch,77,2048] val_45
float[batch,77,512] val_46
float[batch,77,2048] val_47
float[batch,77,512] val_48
float[batch,77,2048] val_49
float[batch,77,512] val_50
float[batch,77,2048] val_51
float[batch,77,512] val_52
float[batch,77,2048] val_53
float[batch,77,512] val_54
float[batch,77,2048] val_55
float[batch,77,512] val_56
float[batch,77,2048] val_57
float[batch,77,512] val_58
float[batch,77,2048] val_59
float[batch,77,512] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2048] val_63
float[batch,1,512] val_64
float[batch,1,512] val_65
float[batch,512] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] b66bb3b6694c
ln_final.weight FLOAT[512] 5518f0d25fc9
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] cb8822e85661
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 4165abdcf7ef
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 15a8520b733d
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] d82870a4c159
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 2431e782a0fa
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] a8472dded092
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 19de9b3c94a1
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 3a8353681a21
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 36c77c1dc4e7
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 70f0afe17724
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 0ea2db554784
node_scaled_dot_product_attention_wo_t FLOAT[512,512] ec3ce5c099ed
positional_embedding FLOAT[77,512] 0e0350197bdb
text_projection FLOAT[512,1024] abc39c70e972
token_embedding.weight_fp16 FLOAT16[49408,512] 6d31a485ad93
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 0c02be1837fd
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] 92b3bf665563
transformer.resblocks.0.ln_1.bias FLOAT[512] a52c19ab5a32
transformer.resblocks.0.ln_1.weight FLOAT[512] e8dbbd626f87
transformer.resblocks.0.ln_2.bias FLOAT[512] 15c0d3fa7663
transformer.resblocks.0.ln_2.weight FLOAT[512] b46676e1c309
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] c95034f4ebb9
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 92ff65b08b89
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] a8270f0e9c1a
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 05dc51835338
transformer.resblocks.1.ln_1.bias FLOAT[512] 8e757dae3794
transformer.resblocks.1.ln_1.weight FLOAT[512] 41d67322f6e2
transformer.resblocks.1.ln_2.bias FLOAT[512] b577b3ccf0ad
transformer.resblocks.1.ln_2.weight FLOAT[512] 0cefb7af121d
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] bf94aa76205d
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] d6c13f7a5ea1
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 5fa86f0196c3
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 5e13fec3b643
transformer.resblocks.10.ln_1.bias FLOAT[512] 30b26cb8fdb7
transformer.resblocks.10.ln_1.weight FLOAT[512] 4231a1f35af2
transformer.resblocks.10.ln_2.bias FLOAT[512] 8add8ca22f9d
transformer.resblocks.10.ln_2.weight FLOAT[512] 3fd41da9870c
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 2091a90c023b
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 16d89edc9fb8
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 86ce23a5e2d3
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 1f5123abae85
transformer.resblocks.11.ln_1.bias FLOAT[512] b4e2b088a66f
transformer.resblocks.11.ln_1.weight FLOAT[512] f957fc2735f0
transformer.resblocks.11.ln_2.bias FLOAT[512] 8953ff2b1e5d
transformer.resblocks.11.ln_2.weight FLOAT[512] 6d79725d33ff
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] f4845cc603b7
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 1a1797b9a7db
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] acea48f1e279
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 2deaed160804
transformer.resblocks.2.ln_1.bias FLOAT[512] 235ec92ee6ff
transformer.resblocks.2.ln_1.weight FLOAT[512] a09a839ce8e4
transformer.resblocks.2.ln_2.bias FLOAT[512] 2cd85364ffe9
transformer.resblocks.2.ln_2.weight FLOAT[512] 8a8879b32a65
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 5fc62285fc4f
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 14fbc4a22429
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 6ba28022e13f
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 7bdd3676f67f
transformer.resblocks.3.ln_1.bias FLOAT[512] 92e3c9d448f4
transformer.resblocks.3.ln_1.weight FLOAT[512] 196167c945b2
transformer.resblocks.3.ln_2.bias FLOAT[512] 8ce8b46b951b
transformer.resblocks.3.ln_2.weight FLOAT[512] d08cbefb6820
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] c1c1b1b800ac
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] ea1898f67c26
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] c61ac62b0fb0
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 672175b71928
transformer.resblocks.4.ln_1.bias FLOAT[512] 820938ec58d9
transformer.resblocks.4.ln_1.weight FLOAT[512] 46e5da9c8df3
transformer.resblocks.4.ln_2.bias FLOAT[512] b0d64c8269b0
transformer.resblocks.4.ln_2.weight FLOAT[512] a60f81c1bbd8
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 0779bae0b30b
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] b4b8df2b9a08
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 916a43e2090e
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] c2ebfb52d92d
transformer.resblocks.5.ln_1.bias FLOAT[512] 67fb3fb25d8c
transformer.resblocks.5.ln_1.weight FLOAT[512] 7c6c3b4b3374
transformer.resblocks.5.ln_2.bias FLOAT[512] 95c33bda6e47
transformer.resblocks.5.ln_2.weight FLOAT[512] 5bd1e34e75ce
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] deb7fb8932a0
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] f91bc447fc38
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] ec93fe22cc99
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 258df2d9a399
transformer.resblocks.6.ln_1.bias FLOAT[512] 4845519a545b
transformer.resblocks.6.ln_1.weight FLOAT[512] f1f48edfb582
transformer.resblocks.6.ln_2.bias FLOAT[512] c73bb1416546
transformer.resblocks.6.ln_2.weight FLOAT[512] 3c83308e9c9f
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 9100c11f330e
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] e5860a9efb66
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 1cbc69cbde0b
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] cac4ee5d5487
transformer.resblocks.7.ln_1.bias FLOAT[512] edf321502221
transformer.resblocks.7.ln_1.weight FLOAT[512] 115e6f643743
transformer.resblocks.7.ln_2.bias FLOAT[512] 9a2333958b64
transformer.resblocks.7.ln_2.weight FLOAT[512] f3c6402962af
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 209e7d191875
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 4865e3a7f6cc
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 7ac912494460
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 73dc6175731f
transformer.resblocks.8.ln_1.bias FLOAT[512] b39ca8182478
transformer.resblocks.8.ln_1.weight FLOAT[512] 7f0ce6ec8453
transformer.resblocks.8.ln_2.bias FLOAT[512] 93de3e493aed
transformer.resblocks.8.ln_2.weight FLOAT[512] e11872130818
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 1b062ca2ea17
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] ae05d4882957
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 08905f60b532
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] a44604a9b4cf
transformer.resblocks.9.ln_1.bias FLOAT[512] 8ad5da159d32
transformer.resblocks.9.ln_1.weight FLOAT[512] a7abeae90128
transformer.resblocks.9.ln_2.bias FLOAT[512] 3c34fb1685b5
transformer.resblocks.9.ln_2.weight FLOAT[512] bbaa0941699f
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 9444f60dc860
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] b092b9a8d1d9
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2048,512] 93da69febaf0
val_11 FLOAT[512,1536] 4d0ac18df8ea
val_12 FLOAT[512,2048] 982cc90ea5dd
val_13 FLOAT[2048,512] 364bde6b3d2d
val_14 FLOAT[512,1536] e0f60ca0b9d2
val_15 FLOAT[512,2048] 7fc1ff21c8b6
val_16 FLOAT[2048,512] 7527b6632bbf
val_17 FLOAT[512,1536] b216e71d5d68
val_18 FLOAT[512,2048] a3a4df60442d
val_19 FLOAT[2048,512] 07c8482c9e39
val_2 FLOAT[512,1536] 1d0cfcbb4fd3
val_20 FLOAT[512,1536] d8f5aacc662d
val_21 FLOAT[512,2048] 8a45ad9d9913
val_22 FLOAT[2048,512] e9931089ca06
val_23 FLOAT[512,1536] a5a2baffd920
val_24 FLOAT[512,2048] e573c73d90b0
val_25 FLOAT[2048,512] 1a63cd717835
val_26 FLOAT[512,1536] 751df11836b9
val_27 FLOAT[512,2048] 9811689629d2
val_28 FLOAT[2048,512] 26fe6003b539
val_29 FLOAT[512,1536] 9e9f1bcdc57e
val_3 FLOAT[512,2048] d46dbed12202
val_30 FLOAT[512,2048] 222917e9ae17
val_31 FLOAT[2048,512] 5d13ed56b5ca
val_32 FLOAT[512,1536] b5ae85efd348
val_33 FLOAT[512,2048] 27d6fd059574
val_34 FLOAT[2048,512] ffae70e7dcd3
val_35 FLOAT[512,1536] 5921daf42fe7
val_36 FLOAT[512,2048] 3bc3020048fb
val_37 FLOAT[2048,512] 1de5446c781a
val_4 FLOAT[2048,512] 7e23c1c4edf7
val_5 FLOAT[512,1536] 6ae0f139a6d6
val_6 FLOAT[512,2048] a0f14fa7e6b4
val_7 FLOAT[2048,512] 28e7f5a79df0
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[512,1536] b18996234427
val_9 FLOAT[512,2048] e6bd2dbdaa02
+470
View File
@@ -0,0 +1,470 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,1024] image_embedding)
<
float[batch,1024,14,14] add_1016
float[batch,1024,14,14] add_1092
float[batch,2048,7,7] add_1188
float[batch,2048,7,7] add_1264
float[batch,2048,7,7] add_1340
float[50,batch,2048] add_1370
float[batch,256,56,56] add_140
float[batch,256,56,56] add_216
float[batch,256,56,56] add_292
float[batch,512,28,28] add_388
float[batch,512,28,28] add_464
float[batch,512,28,28] add_540
float[batch,512,28,28] add_616
float[batch,1024,14,14] add_712
float[batch,1024,14,14] add_788
float[batch,1024,14,14] add_864
float[batch,1024,14,14] add_940
float[batch,64,56,56] avg_pool2d
float[batch,128,28,28] avg_pool2d_2
float[batch,256,28,28] avg_pool2d_3
float[batch,256,14,14] avg_pool2d_4
float[batch,512,14,14] avg_pool2d_5
float[batch,512,7,7] avg_pool2d_6
float[batch,1024,7,7] avg_pool2d_7
float[50,batch,2048] cat
float[batch,1] clamp_min
float[batch,32,112,112] getitem
float[batch,256,14,14] getitem_102
float[batch,1024,14,14] getitem_105
float[batch,256,14,14] getitem_108
float[batch,256,14,14] getitem_111
float[batch,1024,14,14] getitem_114
float[batch,256,14,14] getitem_117
float[batch,64,56,56] getitem_12
float[batch,256,14,14] getitem_120
float[batch,1024,14,14] getitem_123
float[batch,256,14,14] getitem_126
float[batch,256,14,14] getitem_129
float[batch,1024,14,14] getitem_132
float[batch,512,14,14] getitem_135
float[batch,512,14,14] getitem_138
float[batch,2048,7,7] getitem_141
float[batch,2048,7,7] getitem_144
float[batch,512,7,7] getitem_147
float[batch,256,56,56] getitem_15
float[batch,512,7,7] getitem_150
float[batch,2048,7,7] getitem_153
float[batch,512,7,7] getitem_156
float[batch,512,7,7] getitem_159
float[batch,2048,7,7] getitem_162
float[batch,256,56,56] getitem_18
float[batch,64,56,56] getitem_21
float[batch,64,56,56] getitem_24
float[batch,256,56,56] getitem_27
float[batch,32,112,112] getitem_3
float[batch,64,56,56] getitem_30
float[batch,64,56,56] getitem_33
float[batch,256,56,56] getitem_36
float[batch,128,56,56] getitem_39
float[batch,128,56,56] getitem_42
float[batch,512,28,28] getitem_45
float[batch,512,28,28] getitem_48
float[batch,128,28,28] getitem_51
float[batch,128,28,28] getitem_54
float[batch,512,28,28] getitem_57
float[batch,64,112,112] getitem_6
float[batch,128,28,28] getitem_60
float[batch,128,28,28] getitem_63
float[batch,512,28,28] getitem_66
float[batch,128,28,28] getitem_69
float[batch,128,28,28] getitem_72
float[batch,512,28,28] getitem_75
float[batch,256,28,28] getitem_78
float[batch,256,28,28] getitem_81
float[batch,1024,14,14] getitem_84
float[batch,1024,14,14] getitem_87
float[batch,64,56,56] getitem_9
float[batch,256,14,14] getitem_90
float[batch,256,14,14] getitem_93
float[batch,1024,14,14] getitem_96
float[batch,256,14,14] getitem_99
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,224,224,3] image_shifted
float[batch,1] linalg_vector_norm
float[1,batch,2048] linear
float[50,batch,2048] linear_1
float[50,batch,2048] linear_2
float[batch,1024] linear_3
float[1,batch,2048] mean
float[1,batch,2048] node_scaled_dot_product_attention_q_row
float[49,batch,2048] permute_1
float[1,batch,32,64] permute_2
float[batch,32,112,112] relu
float[batch,32,112,112] relu_1
float[batch,64,56,56] relu_10
float[batch,256,56,56] relu_11
float[batch,128,56,56] relu_12
float[batch,128,56,56] relu_13
float[batch,512,28,28] relu_14
float[batch,128,28,28] relu_15
float[batch,128,28,28] relu_16
float[batch,512,28,28] relu_17
float[batch,128,28,28] relu_18
float[batch,128,28,28] relu_19
float[batch,64,112,112] relu_2
float[batch,512,28,28] relu_20
float[batch,128,28,28] relu_21
float[batch,128,28,28] relu_22
float[batch,512,28,28] relu_23
float[batch,256,28,28] relu_24
float[batch,256,28,28] relu_25
float[batch,1024,14,14] relu_26
float[batch,256,14,14] relu_27
float[batch,256,14,14] relu_28
float[batch,1024,14,14] relu_29
float[batch,64,56,56] relu_3
float[batch,256,14,14] relu_30
float[batch,256,14,14] relu_31
float[batch,1024,14,14] relu_32
float[batch,256,14,14] relu_33
float[batch,256,14,14] relu_34
float[batch,1024,14,14] relu_35
float[batch,256,14,14] relu_36
float[batch,256,14,14] relu_37
float[batch,1024,14,14] relu_38
float[batch,256,14,14] relu_39
float[batch,64,56,56] relu_4
float[batch,256,14,14] relu_40
float[batch,1024,14,14] relu_41
float[batch,512,14,14] relu_42
float[batch,512,14,14] relu_43
float[batch,2048,7,7] relu_44
float[batch,512,7,7] relu_45
float[batch,512,7,7] relu_46
float[batch,2048,7,7] relu_47
float[batch,512,7,7] relu_48
float[batch,512,7,7] relu_49
float[batch,256,56,56] relu_5
float[batch,2048,7,7] relu_50
float[batch,64,56,56] relu_6
float[batch,64,56,56] relu_7
float[batch,256,56,56] relu_8
float[batch,64,56,56] relu_9
float[batch,32,1,64] scaled_dot_product_attention
float[batch,1024] select
float[2048] split_split_0
float[2048] split_split_1
float[2048] split_split_2
float[unk__1,1,64] transpose
float[unk__1,50,64] transpose_1
float[unk__1,50,64] transpose_2
float[50,1,2048] unsqueeze
float[1,batch,2048] val_7
float[50,batch,2048] val_8
float[50,batch,2048] val_9
float[1,batch,1024] view_10
float[batch,2048,49] view_2
float[1,unk__1,64] view_3
float[50,unk__1,64] view_4
float[50,unk__1,64] view_5
float[batch,32,1,64] view_6
float[batch,32,50,64] view_7
float[batch,32,50,64] view_8
float[batch,2048] view_9
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_shift] image_shifted = Sub (image_f32, image_shift)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
[node_relu] relu = Relu (getitem)
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
relu_1 = Relu (getitem_3)
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
relu_2 = Relu (getitem_6)
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
relu_3 = Relu (getitem_9)
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
relu_4 = Relu (getitem_12)
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
add_140 = Add (getitem_15, getitem_18)
relu_5 = Relu (add_140)
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
relu_6 = Relu (getitem_21)
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
relu_7 = Relu (getitem_24)
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
add_216 = Add (getitem_27, relu_5)
relu_8 = Relu (add_216)
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
relu_9 = Relu (getitem_30)
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
relu_10 = Relu (getitem_33)
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
add_292 = Add (getitem_36, relu_8)
relu_11 = Relu (add_292)
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
relu_12 = Relu (getitem_39)
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
relu_13 = Relu (getitem_42)
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_13)
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_11)
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
add_388 = Add (getitem_45, getitem_48)
relu_14 = Relu (add_388)
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
relu_15 = Relu (getitem_51)
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
relu_16 = Relu (getitem_54)
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
add_464 = Add (getitem_57, relu_14)
relu_17 = Relu (add_464)
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
relu_18 = Relu (getitem_60)
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
relu_19 = Relu (getitem_63)
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
add_540 = Add (getitem_66, relu_17)
relu_20 = Relu (add_540)
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
relu_21 = Relu (getitem_69)
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
relu_22 = Relu (getitem_72)
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
add_616 = Add (getitem_75, relu_20)
relu_23 = Relu (add_616)
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
relu_24 = Relu (getitem_78)
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
relu_25 = Relu (getitem_81)
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_25)
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_23)
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
add_712 = Add (getitem_84, getitem_87)
relu_26 = Relu (add_712)
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
relu_27 = Relu (getitem_90)
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
relu_28 = Relu (getitem_93)
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
add_788 = Add (getitem_96, relu_26)
relu_29 = Relu (add_788)
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
relu_30 = Relu (getitem_99)
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
relu_31 = Relu (getitem_102)
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
add_864 = Add (getitem_105, relu_29)
relu_32 = Relu (add_864)
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
relu_33 = Relu (getitem_108)
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
relu_34 = Relu (getitem_111)
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
add_940 = Add (getitem_114, relu_32)
relu_35 = Relu (add_940)
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
relu_36 = Relu (getitem_117)
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
relu_37 = Relu (getitem_120)
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
add_1016 = Add (getitem_123, relu_35)
relu_38 = Relu (add_1016)
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
relu_39 = Relu (getitem_126)
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
relu_40 = Relu (getitem_129)
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
add_1092 = Add (getitem_132, relu_38)
relu_41 = Relu (add_1092)
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
relu_42 = Relu (getitem_135)
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
relu_43 = Relu (getitem_138)
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_43)
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_41)
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
add_1188 = Add (getitem_141, getitem_144)
relu_44 = Relu (add_1188)
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
relu_45 = Relu (getitem_147)
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
relu_46 = Relu (getitem_150)
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
add_1264 = Add (getitem_153, relu_44)
relu_47 = Relu (add_1264)
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
relu_48 = Relu (getitem_156)
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
relu_49 = Relu (getitem_159)
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
add_1340 = Add (getitem_162, relu_47)
relu_50 = Relu (add_1340)
view_2 = Reshape <allowzero: int = 1> (relu_50, view_2_target)
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
add_1370 = Add (cat, unsqueeze)
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
node_scaled_dot_product_attention_q_row = Slice (add_1370, val_0, val_3, val_0)
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
[node_linear] linear = Add (val_7, split_split_0)
val_8 = MatMul (add_1370, val_5)
linear_1 = Add (val_8, split_split_1)
val_9 = MatMul (add_1370, val_6)
linear_2 = Add (val_9, split_split_2)
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
select = Squeeze (view_10, val_0)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
cat_1 FLOAT[6144] 20bc5a8dd689
image_shift FLOAT[3] 2f7a50e604ad
node_scaled_dot_product_attention_out_1 INT64[3] 7162728d1394
node_scaled_dot_product_attention_q_pack_1 INT64[4] f7b9b5620534
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
val_0 INT64[1] af5570f5a181
val_1 INT64[1] 12a3ae445661
val_2 FLOAT[] 6708d9be4956
val_3 INT64[1] 7c9fa136d441
val_4 FLOAT[2048,2048] 158a99456b3a
val_5 FLOAT[2048,2048] 7245a10cbd60
val_6 FLOAT[2048,2048] 77da6e0693f6
view_2_target INT64[3] 68ffb9ecb5ec
view_4_target INT64[3] c7a3d94c4eb2
view_7_target INT64[4] e0ea1841387b
view_9_target INT64[2] 76aecb4697fd
visual.attnpool.c_proj.bias FLOAT[1024] 4469f5077f9f
visual.attnpool.c_proj.weight FLOAT[1024,2048] f5806b78e9b4
visual.attnpool.positional_embedding FLOAT[50,2048] a86e140880f1
visual.conv1.weight FLOAT[32,3,3,3] 5bc7130f0cf2
visual.conv1.weight_bias FLOAT[32] 0b3fad76f857
visual.conv2.weight FLOAT[32,32,3,3] 2b024d19d6a0
visual.conv2.weight_bias FLOAT[32] 2492ef0f6e3a
visual.conv3.weight FLOAT[64,32,3,3] 08059865a178
visual.conv3.weight_bias FLOAT[64] b33bda9b6e02
visual.layer1.0.conv1.weight FLOAT[64,64,1,1] da768736dd70
visual.layer1.0.conv1.weight_bias FLOAT[64] 0e5259d119d6
visual.layer1.0.conv2.weight FLOAT[64,64,3,3] 9bdd6b6eff7b
visual.layer1.0.conv2.weight_bias FLOAT[64] 2c2dc9a14f7a
visual.layer1.0.conv3.weight FLOAT[256,64,1,1] 5c6d15cdc576
visual.layer1.0.conv3.weight_bias FLOAT[256] 4f5fc0a415de
visual.layer1.0.downsample.0.weight FLOAT[256,64,1,1] 44ff4939e5f8
visual.layer1.0.downsample.0.weight_bias FLOAT[256] 0cc5e46803ef
visual.layer1.1.conv1.weight FLOAT[64,256,1,1] 4bd24d6c004d
visual.layer1.1.conv1.weight_bias FLOAT[64] c99e98e3acb9
visual.layer1.1.conv2.weight FLOAT[64,64,3,3] 60d67142bb5f
visual.layer1.1.conv2.weight_bias FLOAT[64] e20bda2fae8e
visual.layer1.1.conv3.weight FLOAT[256,64,1,1] 8c15351944d9
visual.layer1.1.conv3.weight_bias FLOAT[256] 6ef768cbd6f8
visual.layer1.2.conv1.weight FLOAT[64,256,1,1] 7865eb2e5229
visual.layer1.2.conv1.weight_bias FLOAT[64] 5155da1d41da
visual.layer1.2.conv2.weight FLOAT[64,64,3,3] 3b5f0f461443
visual.layer1.2.conv2.weight_bias FLOAT[64] 2ca80ca0c72b
visual.layer1.2.conv3.weight FLOAT[256,64,1,1] a4e38059de17
visual.layer1.2.conv3.weight_bias FLOAT[256] 135be6c196c4
visual.layer2.0.conv1.weight FLOAT[128,256,1,1] 7a500d61274c
visual.layer2.0.conv1.weight_bias FLOAT[128] cbc8694db9a0
visual.layer2.0.conv2.weight FLOAT[128,128,3,3] ac357bfcad09
visual.layer2.0.conv2.weight_bias FLOAT[128] 6ba802491f62
visual.layer2.0.conv3.weight FLOAT[512,128,1,1] 73ad0c4ab14c
visual.layer2.0.conv3.weight_bias FLOAT[512] 809cdb16ecb0
visual.layer2.0.downsample.0.weight FLOAT[512,256,1,1] 5c096f787ef1
visual.layer2.0.downsample.0.weight_bias FLOAT[512] e75c66bfbc85
visual.layer2.1.conv1.weight FLOAT[128,512,1,1] 47c96eab4283
visual.layer2.1.conv1.weight_bias FLOAT[128] 7e05fe6d3760
visual.layer2.1.conv2.weight FLOAT[128,128,3,3] fb80359495a5
visual.layer2.1.conv2.weight_bias FLOAT[128] 461c1bace91a
visual.layer2.1.conv3.weight FLOAT[512,128,1,1] f4aac39e7914
visual.layer2.1.conv3.weight_bias FLOAT[512] da7ef23e865f
visual.layer2.2.conv1.weight FLOAT[128,512,1,1] be614a177d8e
visual.layer2.2.conv1.weight_bias FLOAT[128] 9f71e883e66c
visual.layer2.2.conv2.weight FLOAT[128,128,3,3] eb855d2a35a1
visual.layer2.2.conv2.weight_bias FLOAT[128] 8fa6eb483054
visual.layer2.2.conv3.weight FLOAT[512,128,1,1] 47cddd4d5ae6
visual.layer2.2.conv3.weight_bias FLOAT[512] 404824e1d26e
visual.layer2.3.conv1.weight FLOAT[128,512,1,1] facabd7a4566
visual.layer2.3.conv1.weight_bias FLOAT[128] 5f333e7a2fa9
visual.layer2.3.conv2.weight FLOAT[128,128,3,3] c78de1376217
visual.layer2.3.conv2.weight_bias FLOAT[128] 7dcfdf85554e
visual.layer2.3.conv3.weight FLOAT[512,128,1,1] 669dad2db705
visual.layer2.3.conv3.weight_bias FLOAT[512] 523c91c4b3cb
visual.layer3.0.conv1.weight FLOAT[256,512,1,1] 318e58cc0c2a
visual.layer3.0.conv1.weight_bias FLOAT[256] e5fcd815363e
visual.layer3.0.conv2.weight FLOAT[256,256,3,3] fe6d94e1b1cc
visual.layer3.0.conv2.weight_bias FLOAT[256] 26527fa5ffcc
visual.layer3.0.conv3.weight FLOAT[1024,256,1,1] 491a5b580b90
visual.layer3.0.conv3.weight_bias FLOAT[1024] 34dd85b561c6
visual.layer3.0.downsample.0.weight FLOAT[1024,512,1,1] 6d89cab0243e
visual.layer3.0.downsample.0.weight_bias FLOAT[1024] 611a979c0eaf
visual.layer3.1.conv1.weight FLOAT[256,1024,1,1] 5afca0f35018
visual.layer3.1.conv1.weight_bias FLOAT[256] 25dffea10f72
visual.layer3.1.conv2.weight FLOAT[256,256,3,3] 83e301f46c44
visual.layer3.1.conv2.weight_bias FLOAT[256] 5a99a9803974
visual.layer3.1.conv3.weight FLOAT[1024,256,1,1] b4b4bb1ec66a
visual.layer3.1.conv3.weight_bias FLOAT[1024] fa91301d6ee4
visual.layer3.2.conv1.weight FLOAT[256,1024,1,1] 3d3f9ed6c909
visual.layer3.2.conv1.weight_bias FLOAT[256] df315b215213
visual.layer3.2.conv2.weight FLOAT[256,256,3,3] ebb89b05092c
visual.layer3.2.conv2.weight_bias FLOAT[256] 72e8ae532e59
visual.layer3.2.conv3.weight FLOAT[1024,256,1,1] 5f3581de265e
visual.layer3.2.conv3.weight_bias FLOAT[1024] d97c48511c6f
visual.layer3.3.conv1.weight FLOAT[256,1024,1,1] 25f41a1daf77
visual.layer3.3.conv1.weight_bias FLOAT[256] 0f2888621f7c
visual.layer3.3.conv2.weight FLOAT[256,256,3,3] 8f916e928b77
visual.layer3.3.conv2.weight_bias FLOAT[256] 381239935bee
visual.layer3.3.conv3.weight FLOAT[1024,256,1,1] 7b1eb8a06889
visual.layer3.3.conv3.weight_bias FLOAT[1024] 460b313f9d15
visual.layer3.4.conv1.weight FLOAT[256,1024,1,1] b72f3f1fff81
visual.layer3.4.conv1.weight_bias FLOAT[256] a45c4609bbbb
visual.layer3.4.conv2.weight FLOAT[256,256,3,3] d9d77e016e01
visual.layer3.4.conv2.weight_bias FLOAT[256] a39e45e93278
visual.layer3.4.conv3.weight FLOAT[1024,256,1,1] 999691a0726c
visual.layer3.4.conv3.weight_bias FLOAT[1024] f249dd6fa048
visual.layer3.5.conv1.weight FLOAT[256,1024,1,1] fa677d896b0a
visual.layer3.5.conv1.weight_bias FLOAT[256] b379cf634178
visual.layer3.5.conv2.weight FLOAT[256,256,3,3] 6674459df93c
visual.layer3.5.conv2.weight_bias FLOAT[256] 9d27bbbf921f
visual.layer3.5.conv3.weight FLOAT[1024,256,1,1] 7947ecc0f364
visual.layer3.5.conv3.weight_bias FLOAT[1024] 82d838ab3b01
visual.layer4.0.conv1.weight FLOAT[512,1024,1,1] a1d81b16d954
visual.layer4.0.conv1.weight_bias FLOAT[512] e716e178e8af
visual.layer4.0.conv2.weight FLOAT[512,512,3,3] b9c740503c34
visual.layer4.0.conv2.weight_bias FLOAT[512] 3a33ef9aca49
visual.layer4.0.conv3.weight FLOAT[2048,512,1,1] 0b2ad5e0628a
visual.layer4.0.conv3.weight_bias FLOAT[2048] 816a8789c876
visual.layer4.0.downsample.0.weight FLOAT[2048,1024,1,1] 0956cb3aeee6
visual.layer4.0.downsample.0.weight_bias FLOAT[2048] 1437fe80f41b
visual.layer4.1.conv1.weight FLOAT[512,2048,1,1] b6e15f18b4bc
visual.layer4.1.conv1.weight_bias FLOAT[512] 244ed3394716
visual.layer4.1.conv2.weight FLOAT[512,512,3,3] dedeab40c1bd
visual.layer4.1.conv2.weight_bias FLOAT[512] d0cf190b3290
visual.layer4.1.conv3.weight FLOAT[2048,512,1,1] 8f6d8859aff4
visual.layer4.1.conv3.weight_bias FLOAT[2048] 4921f277cbd5
visual.layer4.2.conv1.weight FLOAT[512,2048,1,1] b91b9392b8f6
visual.layer4.2.conv1.weight_bias FLOAT[512] 7b7bcc0df14e
visual.layer4.2.conv2.weight FLOAT[512,512,3,3] e9502f4288c7
visual.layer4.2.conv2.weight_bias FLOAT[512] ec2f32f5ab4a
visual.layer4.2.conv3.weight FLOAT[2048,512,1,1] efbbf96882d3
visual.layer4.2.conv3.weight_bias FLOAT[2048] a23ebabef256
+625
View File
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding)
<
float[batch,77,512] add_1012
float[batch,77,512] add_1127
float[batch,77,512] add_1156
float[batch,77,512] add_119
float[batch,77,512] add_1271
float[batch,77,512] add_1300
float[batch,77,512] add_1415
float[batch,77,512] add_1444
float[batch,77,512] add_148
float[batch,77,512] add_1559
float[batch,77,512] add_1588
float[batch,1,512] add_1588_pooled
float[batch,1,512] add_1703
float[batch,1,512] add_1732
float[batch,77,512] add_263
float[batch,77,512] add_292
float[batch,77,512] add_4
float[batch,77,512] add_407
float[batch,77,512] add_436
float[batch,77,512] add_551
float[batch,77,512] add_580
float[batch,77,512] add_695
float[batch,77,512] add_724
float[batch,77,512] add_839
float[batch,77,512] add_868
float[batch,77,512] add_983
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,1024] matmul
float[batch,77,2048] mul_101
float[batch,77,2048] mul_106
float[batch,77,2048] mul_1064
float[batch,77,2048] mul_1069
float[batch,77,2048] mul_1171
float[batch,77,2048] mul_1176
float[batch,1,2048] mul_1278
float[batch,1,2048] mul_1283
float[batch,77,2048] mul_208
float[batch,77,2048] mul_213
float[batch,77,2048] mul_315
float[batch,77,2048] mul_320
float[batch,77,2048] mul_422
float[batch,77,2048] mul_427
float[batch,77,2048] mul_529
float[batch,77,2048] mul_534
float[batch,77,2048] mul_636
float[batch,77,2048] mul_641
float[batch,77,2048] mul_743
float[batch,77,2048] mul_748
float[batch,77,2048] mul_850
float[batch,77,2048] mul_855
float[batch,77,2048] mul_957
float[batch,77,2048] mul_962
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] sigmoid
float[batch,77,2048] sigmoid_1
float[batch,77,2048] sigmoid_10
float[batch,1,2048] sigmoid_11
float[batch,77,2048] sigmoid_2
float[batch,77,2048] sigmoid_3
float[batch,77,2048] sigmoid_4
float[batch,77,2048] sigmoid_5
float[batch,77,2048] sigmoid_6
float[batch,77,2048] sigmoid_7
float[batch,77,2048] sigmoid_8
float[batch,77,2048] sigmoid_9
float[batch,77,2048] val_40
float[batch,77,512] val_41
float[batch,77,2048] val_42
float[batch,77,512] val_43
float[batch,77,2048] val_44
float[batch,77,512] val_45
float[batch,77,2048] val_46
float[batch,77,512] val_47
float[batch,77,2048] val_48
float[batch,77,512] val_49
float[batch,77,2048] val_50
float[batch,77,512] val_51
float[batch,77,2048] val_52
float[batch,77,512] val_53
float[batch,77,2048] val_54
float[batch,77,512] val_55
float[batch,77,2048] val_56
float[batch,77,512] val_57
float[batch,77,2048] val_58
float[batch,77,512] val_59
float[batch,77,2048] val_60
float[batch,77,512] val_61
float[batch,77] val_62
float[batch,1,77] val_63
float[batch,1,2048] val_64
float[batch,1,512] val_65
float[batch,1,512] val_66
float[batch,512] val_67
>
{
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_39)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_40 = MatMul (layer_norm_1, val_4)
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
mul_101 = Mul (linear_2, val_2)
[node_sigmoid] sigmoid = Sigmoid (mul_101)
mul_106 = Mul (linear_2, sigmoid)
val_41 = MatMul (mul_106, val_5)
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
add_148 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_42 = MatMul (layer_norm_3, val_7)
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
mul_208 = Mul (linear_6, val_2)
sigmoid_1 = Sigmoid (mul_208)
mul_213 = Mul (linear_6, sigmoid_1)
val_43 = MatMul (mul_213, val_8)
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
add_292 = Add (add_263, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_44 = MatMul (layer_norm_5, val_10)
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
mul_315 = Mul (linear_10, val_2)
sigmoid_2 = Sigmoid (mul_315)
mul_320 = Mul (linear_10, sigmoid_2)
val_45 = MatMul (mul_320, val_11)
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
add_436 = Add (add_407, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_46 = MatMul (layer_norm_7, val_13)
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
mul_422 = Mul (linear_14, val_2)
sigmoid_3 = Sigmoid (mul_422)
mul_427 = Mul (linear_14, sigmoid_3)
val_47 = MatMul (mul_427, val_14)
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
add_580 = Add (add_551, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_48 = MatMul (layer_norm_9, val_16)
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
mul_529 = Mul (linear_18, val_2)
sigmoid_4 = Sigmoid (mul_529)
mul_534 = Mul (linear_18, sigmoid_4)
val_49 = MatMul (mul_534, val_17)
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
add_724 = Add (add_695, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_50 = MatMul (layer_norm_11, val_19)
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
mul_636 = Mul (linear_22, val_2)
sigmoid_5 = Sigmoid (mul_636)
mul_641 = Mul (linear_22, sigmoid_5)
val_51 = MatMul (mul_641, val_20)
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
add_868 = Add (add_839, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_52 = MatMul (layer_norm_13, val_22)
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
mul_743 = Mul (linear_26, val_2)
sigmoid_6 = Sigmoid (mul_743)
mul_748 = Mul (linear_26, sigmoid_6)
val_53 = MatMul (mul_748, val_23)
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
add_1012 = Add (add_983, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_54 = MatMul (layer_norm_15, val_25)
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
mul_850 = Mul (linear_30, val_2)
sigmoid_7 = Sigmoid (mul_850)
mul_855 = Mul (linear_30, sigmoid_7)
val_55 = MatMul (mul_855, val_26)
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
add_1156 = Add (add_1127, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_56 = MatMul (layer_norm_17, val_28)
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
mul_957 = Mul (linear_34, val_2)
sigmoid_8 = Sigmoid (mul_957)
mul_962 = Mul (linear_34, sigmoid_8)
val_57 = MatMul (mul_962, val_29)
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
add_1300 = Add (add_1271, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_58 = MatMul (layer_norm_19, val_31)
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
mul_1064 = Mul (linear_38, val_2)
sigmoid_9 = Sigmoid (mul_1064)
mul_1069 = Mul (linear_38, sigmoid_9)
val_59 = MatMul (mul_1069, val_32)
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
add_1444 = Add (add_1415, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_60 = MatMul (layer_norm_21, val_34)
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
mul_1171 = Mul (linear_42, val_2)
sigmoid_10 = Sigmoid (mul_1171)
mul_1176 = Mul (linear_42, sigmoid_10)
val_61 = MatMul (mul_1176, val_35)
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
add_1588 = Add (add_1559, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
val_63 = Unsqueeze (val_62, val_756_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_64 = MatMul (layer_norm_23, val_37)
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
mul_1278 = Mul (linear_46, val_2)
sigmoid_11 = Sigmoid (mul_1278)
mul_1283 = Mul (linear_46, sigmoid_11)
val_65 = MatMul (mul_1283, val_38)
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
add_1732 = Add (add_1703, linear_47)
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
val_67 = Squeeze (val_66, val_756_axes1)
[node_matmul] matmul = MatMul (val_67, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] af9137c263d8
ln_final.weight FLOAT[512] 8fd94c8190fe
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] e496b94a9991
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] ce22c674db1e
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] ef1095dc2d19
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 093470e9cb87
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] faa6f7164be2
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 131b1e8431cc
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] a941b7e6356b
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] c797c745cc5a
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] ebc9c1bf88eb
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 35c1c67b810b
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 484c25db231b
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 2352ffe640ca
positional_embedding FLOAT[77,512] e62f735a7274
text_projection FLOAT[512,1024] ab2c8e929f61
token_embedding.weight_fp16 FLOAT16[49408,512] 3e2572cd3b5d
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] d730a75c41d4
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] b269e3fdd27e
transformer.resblocks.0.ln_1.bias FLOAT[512] 6a999dae3058
transformer.resblocks.0.ln_1.weight FLOAT[512] 3a74859230bc
transformer.resblocks.0.ln_2.bias FLOAT[512] 28e47a487477
transformer.resblocks.0.ln_2.weight FLOAT[512] b2f8dcff46da
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] e7755427cf22
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] ec33110019d6
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 92ef423e6753
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] aee4d12bddb8
transformer.resblocks.1.ln_1.bias FLOAT[512] c3b5587c32fa
transformer.resblocks.1.ln_1.weight FLOAT[512] d94c8699ebb3
transformer.resblocks.1.ln_2.bias FLOAT[512] 8acee9b93eea
transformer.resblocks.1.ln_2.weight FLOAT[512] b5ea71117480
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 7be6005f5719
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] f10a314b03aa
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 4dc87d85f7c4
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] d39b51fd18dd
transformer.resblocks.10.ln_1.bias FLOAT[512] 86da453b51bb
transformer.resblocks.10.ln_1.weight FLOAT[512] d2262b3a94f0
transformer.resblocks.10.ln_2.bias FLOAT[512] 187ba44b04fb
transformer.resblocks.10.ln_2.weight FLOAT[512] 73644a8834b2
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 1502d44f8339
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 8aa64eb01c68
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 14e81db017bd
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] b50b2548431e
transformer.resblocks.11.ln_1.bias FLOAT[512] 3a788b9bff16
transformer.resblocks.11.ln_1.weight FLOAT[512] 524505206932
transformer.resblocks.11.ln_2.bias FLOAT[512] a2e0827dc99a
transformer.resblocks.11.ln_2.weight FLOAT[512] fe06677baf9f
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] e7fec1a14924
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 1e34319b3d14
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] e5a731bf3c55
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] bd0f166c64a7
transformer.resblocks.2.ln_1.bias FLOAT[512] 91cdba3ffa80
transformer.resblocks.2.ln_1.weight FLOAT[512] 898003303792
transformer.resblocks.2.ln_2.bias FLOAT[512] 300d55ab28b1
transformer.resblocks.2.ln_2.weight FLOAT[512] 7dc90c9853d2
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 1ef8ba071013
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 8295cee881cd
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 8c5d14408274
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 38f8385635d9
transformer.resblocks.3.ln_1.bias FLOAT[512] d57a5e4f3e6f
transformer.resblocks.3.ln_1.weight FLOAT[512] 4eee33c98d5f
transformer.resblocks.3.ln_2.bias FLOAT[512] eca6077ba15d
transformer.resblocks.3.ln_2.weight FLOAT[512] 021f1d499a3b
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] c729ebf4c42f
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 1e31d78450ac
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] db3af0586487
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 49dea084601e
transformer.resblocks.4.ln_1.bias FLOAT[512] a6af2056772e
transformer.resblocks.4.ln_1.weight FLOAT[512] 59ede921b099
transformer.resblocks.4.ln_2.bias FLOAT[512] 1cf39c1bd8f8
transformer.resblocks.4.ln_2.weight FLOAT[512] 8bc1ce282da2
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] a8fe94006bd5
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 55ecff5baeef
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] c447ca87c8ec
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] f00c49fb6304
transformer.resblocks.5.ln_1.bias FLOAT[512] adb421f1043b
transformer.resblocks.5.ln_1.weight FLOAT[512] 6dee4fac068f
transformer.resblocks.5.ln_2.bias FLOAT[512] 2e0db66b04f7
transformer.resblocks.5.ln_2.weight FLOAT[512] 4701e6b43c45
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 767ab108ca12
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] a86bf48676c6
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 50a5604730c2
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 66cdc93fcecb
transformer.resblocks.6.ln_1.bias FLOAT[512] 090881896c31
transformer.resblocks.6.ln_1.weight FLOAT[512] 58057651de4f
transformer.resblocks.6.ln_2.bias FLOAT[512] a426abab5b00
transformer.resblocks.6.ln_2.weight FLOAT[512] a6c47dd83f3c
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 36dd3525f0e9
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 078be0d4f461
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 10eb00d234d1
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 1adb12589642
transformer.resblocks.7.ln_1.bias FLOAT[512] 50844a51f1cd
transformer.resblocks.7.ln_1.weight FLOAT[512] 2bfc9b786137
transformer.resblocks.7.ln_2.bias FLOAT[512] 7cf0b036a479
transformer.resblocks.7.ln_2.weight FLOAT[512] cde8283535db
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] b1f9f471f7a2
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 7496401e4ee6
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] ac7c36c9cdaa
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 798291178d79
transformer.resblocks.8.ln_1.bias FLOAT[512] 474767f50234
transformer.resblocks.8.ln_1.weight FLOAT[512] 469598211787
transformer.resblocks.8.ln_2.bias FLOAT[512] 1b265611fb29
transformer.resblocks.8.ln_2.weight FLOAT[512] bcdbe6036a86
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 56ff08e9e310
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 462993a4cbf1
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] b8958c4ad727
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 7244d7070ecf
transformer.resblocks.9.ln_1.bias FLOAT[512] 44ae6f4b8f00
transformer.resblocks.9.ln_1.weight FLOAT[512] b89497b9ef9e
transformer.resblocks.9.ln_2.bias FLOAT[512] 34a0782bfaf1
transformer.resblocks.9.ln_2.weight FLOAT[512] 7a6751e7cab7
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 2aea9f2ee8f8
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 1449d2853de3
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[512,2048] d7d39e78f655
val_11 FLOAT[2048,512] 415ead01d224
val_12 FLOAT[512,1536] b73d909e4963
val_13 FLOAT[512,2048] 83da6fed9d36
val_14 FLOAT[2048,512] fc1d934fc32a
val_15 FLOAT[512,1536] 4a2a333c64f8
val_16 FLOAT[512,2048] 40500e6b7e20
val_17 FLOAT[2048,512] 6896b1431dac
val_18 FLOAT[512,1536] 1a7636877872
val_19 FLOAT[512,2048] 2435920c6f18
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[2048,512] 903b3f97c1fe
val_21 FLOAT[512,1536] 41ecdbc5689f
val_22 FLOAT[512,2048] 54d655ad774e
val_23 FLOAT[2048,512] d65df421f758
val_24 FLOAT[512,1536] a2623f37d7f9
val_25 FLOAT[512,2048] 551042b15636
val_26 FLOAT[2048,512] 12a0345ff182
val_27 FLOAT[512,1536] de0fffd27052
val_28 FLOAT[512,2048] a5a89ee220b6
val_29 FLOAT[2048,512] 603ac45f91be
val_3 FLOAT[512,1536] 813d339ed422
val_30 FLOAT[512,1536] 5dcde95f37d3
val_31 FLOAT[512,2048] 0d5fe4e667f5
val_32 FLOAT[2048,512] 4c02e645f954
val_33 FLOAT[512,1536] 1f527d6f3a81
val_34 FLOAT[512,2048] 65d9be2f7624
val_35 FLOAT[2048,512] 020f802ad476
val_36 FLOAT[512,1536] 572d5c646808
val_37 FLOAT[512,2048] dc638acbd602
val_38 FLOAT[2048,512] 26fb88d2592a
val_4 FLOAT[512,2048] b965975160bc
val_5 FLOAT[2048,512] f604c26d1396
val_6 FLOAT[512,1536] 6183eae5d49a
val_7 FLOAT[512,2048] 41b765cdc664
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[2048,512] 83cbb941fffa
val_9 FLOAT[512,1536] e8b22a42669a
+470
View File
@@ -0,0 +1,470 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,1024] image_embedding)
<
float[batch,1024,14,14] add_1016
float[batch,1024,14,14] add_1092
float[batch,2048,7,7] add_1188
float[batch,2048,7,7] add_1264
float[batch,2048,7,7] add_1340
float[50,batch,2048] add_1370
float[batch,256,56,56] add_140
float[batch,256,56,56] add_216
float[batch,256,56,56] add_292
float[batch,512,28,28] add_388
float[batch,512,28,28] add_464
float[batch,512,28,28] add_540
float[batch,512,28,28] add_616
float[batch,1024,14,14] add_712
float[batch,1024,14,14] add_788
float[batch,1024,14,14] add_864
float[batch,1024,14,14] add_940
float[batch,64,56,56] avg_pool2d
float[batch,128,28,28] avg_pool2d_2
float[batch,256,28,28] avg_pool2d_3
float[batch,256,14,14] avg_pool2d_4
float[batch,512,14,14] avg_pool2d_5
float[batch,512,7,7] avg_pool2d_6
float[batch,1024,7,7] avg_pool2d_7
float[50,batch,2048] cat
float[batch,1] clamp_min
float[batch,32,112,112] getitem
float[batch,256,14,14] getitem_102
float[batch,1024,14,14] getitem_105
float[batch,256,14,14] getitem_108
float[batch,256,14,14] getitem_111
float[batch,1024,14,14] getitem_114
float[batch,256,14,14] getitem_117
float[batch,64,56,56] getitem_12
float[batch,256,14,14] getitem_120
float[batch,1024,14,14] getitem_123
float[batch,256,14,14] getitem_126
float[batch,256,14,14] getitem_129
float[batch,1024,14,14] getitem_132
float[batch,512,14,14] getitem_135
float[batch,512,14,14] getitem_138
float[batch,2048,7,7] getitem_141
float[batch,2048,7,7] getitem_144
float[batch,512,7,7] getitem_147
float[batch,256,56,56] getitem_15
float[batch,512,7,7] getitem_150
float[batch,2048,7,7] getitem_153
float[batch,512,7,7] getitem_156
float[batch,512,7,7] getitem_159
float[batch,2048,7,7] getitem_162
float[batch,256,56,56] getitem_18
float[batch,64,56,56] getitem_21
float[batch,64,56,56] getitem_24
float[batch,256,56,56] getitem_27
float[batch,32,112,112] getitem_3
float[batch,64,56,56] getitem_30
float[batch,64,56,56] getitem_33
float[batch,256,56,56] getitem_36
float[batch,128,56,56] getitem_39
float[batch,128,56,56] getitem_42
float[batch,512,28,28] getitem_45
float[batch,512,28,28] getitem_48
float[batch,128,28,28] getitem_51
float[batch,128,28,28] getitem_54
float[batch,512,28,28] getitem_57
float[batch,64,112,112] getitem_6
float[batch,128,28,28] getitem_60
float[batch,128,28,28] getitem_63
float[batch,512,28,28] getitem_66
float[batch,128,28,28] getitem_69
float[batch,128,28,28] getitem_72
float[batch,512,28,28] getitem_75
float[batch,256,28,28] getitem_78
float[batch,256,28,28] getitem_81
float[batch,1024,14,14] getitem_84
float[batch,1024,14,14] getitem_87
float[batch,64,56,56] getitem_9
float[batch,256,14,14] getitem_90
float[batch,256,14,14] getitem_93
float[batch,1024,14,14] getitem_96
float[batch,256,14,14] getitem_99
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,224,224,3] image_shifted
float[batch,1] linalg_vector_norm
float[1,batch,2048] linear
float[50,batch,2048] linear_1
float[50,batch,2048] linear_2
float[batch,1024] linear_3
float[1,batch,2048] mean
float[1,batch,2048] node_scaled_dot_product_attention_q_row
float[49,batch,2048] permute_1
float[1,batch,32,64] permute_2
float[batch,32,112,112] relu
float[batch,32,112,112] relu_1
float[batch,64,56,56] relu_10
float[batch,256,56,56] relu_11
float[batch,128,56,56] relu_12
float[batch,128,56,56] relu_13
float[batch,512,28,28] relu_14
float[batch,128,28,28] relu_15
float[batch,128,28,28] relu_16
float[batch,512,28,28] relu_17
float[batch,128,28,28] relu_18
float[batch,128,28,28] relu_19
float[batch,64,112,112] relu_2
float[batch,512,28,28] relu_20
float[batch,128,28,28] relu_21
float[batch,128,28,28] relu_22
float[batch,512,28,28] relu_23
float[batch,256,28,28] relu_24
float[batch,256,28,28] relu_25
float[batch,1024,14,14] relu_26
float[batch,256,14,14] relu_27
float[batch,256,14,14] relu_28
float[batch,1024,14,14] relu_29
float[batch,64,56,56] relu_3
float[batch,256,14,14] relu_30
float[batch,256,14,14] relu_31
float[batch,1024,14,14] relu_32
float[batch,256,14,14] relu_33
float[batch,256,14,14] relu_34
float[batch,1024,14,14] relu_35
float[batch,256,14,14] relu_36
float[batch,256,14,14] relu_37
float[batch,1024,14,14] relu_38
float[batch,256,14,14] relu_39
float[batch,64,56,56] relu_4
float[batch,256,14,14] relu_40
float[batch,1024,14,14] relu_41
float[batch,512,14,14] relu_42
float[batch,512,14,14] relu_43
float[batch,2048,7,7] relu_44
float[batch,512,7,7] relu_45
float[batch,512,7,7] relu_46
float[batch,2048,7,7] relu_47
float[batch,512,7,7] relu_48
float[batch,512,7,7] relu_49
float[batch,256,56,56] relu_5
float[batch,2048,7,7] relu_50
float[batch,64,56,56] relu_6
float[batch,64,56,56] relu_7
float[batch,256,56,56] relu_8
float[batch,64,56,56] relu_9
float[batch,32,1,64] scaled_dot_product_attention
float[batch,1024] select
float[2048] split_split_0
float[2048] split_split_1
float[2048] split_split_2
float[unk__1,1,64] transpose
float[unk__1,50,64] transpose_1
float[unk__1,50,64] transpose_2
float[50,1,2048] unsqueeze
float[1,batch,2048] val_7
float[50,batch,2048] val_8
float[50,batch,2048] val_9
float[1,batch,1024] view_10
float[batch,2048,49] view_2
float[1,unk__1,64] view_3
float[50,unk__1,64] view_4
float[50,unk__1,64] view_5
float[batch,32,1,64] view_6
float[batch,32,50,64] view_7
float[batch,32,50,64] view_8
float[batch,2048] view_9
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_shift] image_shifted = Sub (image_f32, image_shift)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
[node_relu] relu = Relu (getitem)
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
relu_1 = Relu (getitem_3)
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
relu_2 = Relu (getitem_6)
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
relu_3 = Relu (getitem_9)
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
relu_4 = Relu (getitem_12)
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
add_140 = Add (getitem_15, getitem_18)
relu_5 = Relu (add_140)
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
relu_6 = Relu (getitem_21)
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
relu_7 = Relu (getitem_24)
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
add_216 = Add (getitem_27, relu_5)
relu_8 = Relu (add_216)
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
relu_9 = Relu (getitem_30)
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
relu_10 = Relu (getitem_33)
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
add_292 = Add (getitem_36, relu_8)
relu_11 = Relu (add_292)
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
relu_12 = Relu (getitem_39)
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
relu_13 = Relu (getitem_42)
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_13)
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_11)
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
add_388 = Add (getitem_45, getitem_48)
relu_14 = Relu (add_388)
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
relu_15 = Relu (getitem_51)
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
relu_16 = Relu (getitem_54)
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
add_464 = Add (getitem_57, relu_14)
relu_17 = Relu (add_464)
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
relu_18 = Relu (getitem_60)
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
relu_19 = Relu (getitem_63)
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
add_540 = Add (getitem_66, relu_17)
relu_20 = Relu (add_540)
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
relu_21 = Relu (getitem_69)
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
relu_22 = Relu (getitem_72)
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
add_616 = Add (getitem_75, relu_20)
relu_23 = Relu (add_616)
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
relu_24 = Relu (getitem_78)
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
relu_25 = Relu (getitem_81)
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_25)
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_23)
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
add_712 = Add (getitem_84, getitem_87)
relu_26 = Relu (add_712)
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
relu_27 = Relu (getitem_90)
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
relu_28 = Relu (getitem_93)
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
add_788 = Add (getitem_96, relu_26)
relu_29 = Relu (add_788)
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
relu_30 = Relu (getitem_99)
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
relu_31 = Relu (getitem_102)
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
add_864 = Add (getitem_105, relu_29)
relu_32 = Relu (add_864)
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
relu_33 = Relu (getitem_108)
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
relu_34 = Relu (getitem_111)
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
add_940 = Add (getitem_114, relu_32)
relu_35 = Relu (add_940)
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
relu_36 = Relu (getitem_117)
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
relu_37 = Relu (getitem_120)
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
add_1016 = Add (getitem_123, relu_35)
relu_38 = Relu (add_1016)
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
relu_39 = Relu (getitem_126)
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
relu_40 = Relu (getitem_129)
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
add_1092 = Add (getitem_132, relu_38)
relu_41 = Relu (add_1092)
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
relu_42 = Relu (getitem_135)
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
relu_43 = Relu (getitem_138)
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_43)
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_41)
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
add_1188 = Add (getitem_141, getitem_144)
relu_44 = Relu (add_1188)
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
relu_45 = Relu (getitem_147)
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
relu_46 = Relu (getitem_150)
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
add_1264 = Add (getitem_153, relu_44)
relu_47 = Relu (add_1264)
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
relu_48 = Relu (getitem_156)
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
relu_49 = Relu (getitem_159)
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
add_1340 = Add (getitem_162, relu_47)
relu_50 = Relu (add_1340)
view_2 = Reshape <allowzero: int = 1> (relu_50, view_2_target)
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
add_1370 = Add (cat, unsqueeze)
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
node_scaled_dot_product_attention_q_row = Slice (add_1370, val_0, val_3, val_0)
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
[node_linear] linear = Add (val_7, split_split_0)
val_8 = MatMul (add_1370, val_5)
linear_1 = Add (val_8, split_split_1)
val_9 = MatMul (add_1370, val_6)
linear_2 = Add (val_9, split_split_2)
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
select = Squeeze (view_10, val_0)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
cat_1 FLOAT[6144] a211dfbeaa31
image_shift FLOAT[3] 2f7a50e604ad
node_scaled_dot_product_attention_out_1 INT64[3] 7162728d1394
node_scaled_dot_product_attention_q_pack_1 INT64[4] f7b9b5620534
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
val_0 INT64[1] af5570f5a181
val_1 INT64[1] 12a3ae445661
val_2 FLOAT[] 6708d9be4956
val_3 INT64[1] 7c9fa136d441
val_4 FLOAT[2048,2048] 2b70cefcc885
val_5 FLOAT[2048,2048] ee5a737b87af
val_6 FLOAT[2048,2048] 34f890ff6a2d
view_2_target INT64[3] 68ffb9ecb5ec
view_4_target INT64[3] c7a3d94c4eb2
view_7_target INT64[4] e0ea1841387b
view_9_target INT64[2] 76aecb4697fd
visual.attnpool.c_proj.bias FLOAT[1024] c92df736f314
visual.attnpool.c_proj.weight FLOAT[1024,2048] b1fb51d9ce4b
visual.attnpool.positional_embedding FLOAT[50,2048] 8b84485dd347
visual.conv1.weight FLOAT[32,3,3,3] d2cc7115d426
visual.conv1.weight_bias FLOAT[32] 695b387fcc62
visual.conv2.weight FLOAT[32,32,3,3] 044e0a4e083d
visual.conv2.weight_bias FLOAT[32] 371becd9c858
visual.conv3.weight FLOAT[64,32,3,3] 340789ffde55
visual.conv3.weight_bias FLOAT[64] 61cc233f23a8
visual.layer1.0.conv1.weight FLOAT[64,64,1,1] fa178cbe4e5f
visual.layer1.0.conv1.weight_bias FLOAT[64] 4eeac23d37ce
visual.layer1.0.conv2.weight FLOAT[64,64,3,3] e095bc4eda5b
visual.layer1.0.conv2.weight_bias FLOAT[64] 606d19b8261c
visual.layer1.0.conv3.weight FLOAT[256,64,1,1] 4760a24797db
visual.layer1.0.conv3.weight_bias FLOAT[256] 59c77b9ae9dd
visual.layer1.0.downsample.0.weight FLOAT[256,64,1,1] 7d93282aaada
visual.layer1.0.downsample.0.weight_bias FLOAT[256] e94f0c9e3deb
visual.layer1.1.conv1.weight FLOAT[64,256,1,1] bd243ee08c48
visual.layer1.1.conv1.weight_bias FLOAT[64] 826820ddc106
visual.layer1.1.conv2.weight FLOAT[64,64,3,3] e7b6b45eb035
visual.layer1.1.conv2.weight_bias FLOAT[64] 452ba6c62dc2
visual.layer1.1.conv3.weight FLOAT[256,64,1,1] a02760e51a5b
visual.layer1.1.conv3.weight_bias FLOAT[256] a57e8a8f92f0
visual.layer1.2.conv1.weight FLOAT[64,256,1,1] 22d1c70a1696
visual.layer1.2.conv1.weight_bias FLOAT[64] 73017849a289
visual.layer1.2.conv2.weight FLOAT[64,64,3,3] f3e2b9166e84
visual.layer1.2.conv2.weight_bias FLOAT[64] 76e51ee6eff2
visual.layer1.2.conv3.weight FLOAT[256,64,1,1] eaaab987d273
visual.layer1.2.conv3.weight_bias FLOAT[256] 54d00b32994d
visual.layer2.0.conv1.weight FLOAT[128,256,1,1] c50c62f216b5
visual.layer2.0.conv1.weight_bias FLOAT[128] 6a244223cbe6
visual.layer2.0.conv2.weight FLOAT[128,128,3,3] dff98875cd90
visual.layer2.0.conv2.weight_bias FLOAT[128] e0e32b8526d2
visual.layer2.0.conv3.weight FLOAT[512,128,1,1] 7e152e384ea6
visual.layer2.0.conv3.weight_bias FLOAT[512] 4e69afa0af73
visual.layer2.0.downsample.0.weight FLOAT[512,256,1,1] 7ff5e4f182ce
visual.layer2.0.downsample.0.weight_bias FLOAT[512] eb385c390151
visual.layer2.1.conv1.weight FLOAT[128,512,1,1] 44ec8207910d
visual.layer2.1.conv1.weight_bias FLOAT[128] 702866a78e30
visual.layer2.1.conv2.weight FLOAT[128,128,3,3] 8de0646c8931
visual.layer2.1.conv2.weight_bias FLOAT[128] 6ec23bb9e1da
visual.layer2.1.conv3.weight FLOAT[512,128,1,1] 04197d826c8c
visual.layer2.1.conv3.weight_bias FLOAT[512] f241b8d03420
visual.layer2.2.conv1.weight FLOAT[128,512,1,1] 95dc5c6635b1
visual.layer2.2.conv1.weight_bias FLOAT[128] f0fac6025567
visual.layer2.2.conv2.weight FLOAT[128,128,3,3] 6375013414f8
visual.layer2.2.conv2.weight_bias FLOAT[128] e9c229adc89e
visual.layer2.2.conv3.weight FLOAT[512,128,1,1] 0c31f12f77c0
visual.layer2.2.conv3.weight_bias FLOAT[512] bf63039053a9
visual.layer2.3.conv1.weight FLOAT[128,512,1,1] c618a95eb085
visual.layer2.3.conv1.weight_bias FLOAT[128] 2e5648e16153
visual.layer2.3.conv2.weight FLOAT[128,128,3,3] ffd039798312
visual.layer2.3.conv2.weight_bias FLOAT[128] 4ed886f87269
visual.layer2.3.conv3.weight FLOAT[512,128,1,1] daf1d1e1acb5
visual.layer2.3.conv3.weight_bias FLOAT[512] 423d8771195e
visual.layer3.0.conv1.weight FLOAT[256,512,1,1] 03d1b441b2fe
visual.layer3.0.conv1.weight_bias FLOAT[256] 320490904373
visual.layer3.0.conv2.weight FLOAT[256,256,3,3] bf0ba36b31a5
visual.layer3.0.conv2.weight_bias FLOAT[256] 5936953c0909
visual.layer3.0.conv3.weight FLOAT[1024,256,1,1] d4fc223568d9
visual.layer3.0.conv3.weight_bias FLOAT[1024] f9b4e95210ea
visual.layer3.0.downsample.0.weight FLOAT[1024,512,1,1] f58d6ae305a7
visual.layer3.0.downsample.0.weight_bias FLOAT[1024] 6acd05f34e1a
visual.layer3.1.conv1.weight FLOAT[256,1024,1,1] a9286b47def4
visual.layer3.1.conv1.weight_bias FLOAT[256] 4a79119db266
visual.layer3.1.conv2.weight FLOAT[256,256,3,3] 39e2be9ea8ea
visual.layer3.1.conv2.weight_bias FLOAT[256] d77e1ddceac9
visual.layer3.1.conv3.weight FLOAT[1024,256,1,1] fc24820d73ef
visual.layer3.1.conv3.weight_bias FLOAT[1024] 2852a976e9de
visual.layer3.2.conv1.weight FLOAT[256,1024,1,1] 10da72685abb
visual.layer3.2.conv1.weight_bias FLOAT[256] be9cd27d2ad9
visual.layer3.2.conv2.weight FLOAT[256,256,3,3] 91ab75999e84
visual.layer3.2.conv2.weight_bias FLOAT[256] 217603ce252d
visual.layer3.2.conv3.weight FLOAT[1024,256,1,1] 77dd5fe1b228
visual.layer3.2.conv3.weight_bias FLOAT[1024] 5cceab1488ee
visual.layer3.3.conv1.weight FLOAT[256,1024,1,1] 594f943d7a4f
visual.layer3.3.conv1.weight_bias FLOAT[256] 40393b6854ae
visual.layer3.3.conv2.weight FLOAT[256,256,3,3] da5be985f1a6
visual.layer3.3.conv2.weight_bias FLOAT[256] 162b683e7fbd
visual.layer3.3.conv3.weight FLOAT[1024,256,1,1] 2668069c0532
visual.layer3.3.conv3.weight_bias FLOAT[1024] 267c2dae45b4
visual.layer3.4.conv1.weight FLOAT[256,1024,1,1] 41d365b4a0ed
visual.layer3.4.conv1.weight_bias FLOAT[256] 50d08e8e6775
visual.layer3.4.conv2.weight FLOAT[256,256,3,3] b6ff66f0a791
visual.layer3.4.conv2.weight_bias FLOAT[256] 45c2067b1c4c
visual.layer3.4.conv3.weight FLOAT[1024,256,1,1] 7cce15c37b0b
visual.layer3.4.conv3.weight_bias FLOAT[1024] 341230fbe255
visual.layer3.5.conv1.weight FLOAT[256,1024,1,1] acb072d3b4f3
visual.layer3.5.conv1.weight_bias FLOAT[256] 45282e68b6e9
visual.layer3.5.conv2.weight FLOAT[256,256,3,3] 85417aebcf05
visual.layer3.5.conv2.weight_bias FLOAT[256] 08534e693484
visual.layer3.5.conv3.weight FLOAT[1024,256,1,1] 5382d9eafe46
visual.layer3.5.conv3.weight_bias FLOAT[1024] cc8879f02347
visual.layer4.0.conv1.weight FLOAT[512,1024,1,1] 1bffc1ead8d8
visual.layer4.0.conv1.weight_bias FLOAT[512] ec9e7dc0dc3a
visual.layer4.0.conv2.weight FLOAT[512,512,3,3] d218ccb5c5cc
visual.layer4.0.conv2.weight_bias FLOAT[512] 122fb87e4d29
visual.layer4.0.conv3.weight FLOAT[2048,512,1,1] 6365ca4c0d83
visual.layer4.0.conv3.weight_bias FLOAT[2048] 25f97f110683
visual.layer4.0.downsample.0.weight FLOAT[2048,1024,1,1] 0765d2036025
visual.layer4.0.downsample.0.weight_bias FLOAT[2048] 20051736989b
visual.layer4.1.conv1.weight FLOAT[512,2048,1,1] ce0d72308d32
visual.layer4.1.conv1.weight_bias FLOAT[512] 2e921063c057
visual.layer4.1.conv2.weight FLOAT[512,512,3,3] ff5407e36069
visual.layer4.1.conv2.weight_bias FLOAT[512] 6eb91b41308f
visual.layer4.1.conv3.weight FLOAT[2048,512,1,1] 77b9eed3aa1b
visual.layer4.1.conv3.weight_bias FLOAT[2048] 092fd6e88004
visual.layer4.2.conv1.weight FLOAT[512,2048,1,1] d98cefef114c
visual.layer4.2.conv1.weight_bias FLOAT[512] d9a3a246e2e5
visual.layer4.2.conv2.weight FLOAT[512,512,3,3] 95bb518e6393
visual.layer4.2.conv2.weight_bias FLOAT[512] 20a7a637b746
visual.layer4.2.conv3.weight FLOAT[2048,512,1,1] 0e179ab51133
visual.layer4.2.conv3.weight_bias FLOAT[2048] 9da3b4ee3e83
+576
View File
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding)
<
float[batch,77,512] add_1071
float[batch,77,512] add_1092
float[batch,77,512] add_119
float[batch,77,512] add_1207
float[batch,77,512] add_1228
float[batch,77,512] add_1343
float[batch,77,512] add_1364
float[batch,77,512] add_140
float[batch,77,512] add_1479
float[batch,77,512] add_1500
float[batch,1,512] add_1500_pooled
float[batch,1,512] add_1615
float[batch,1,512] add_1636
float[batch,77,512] add_255
float[batch,77,512] add_276
float[batch,77,512] add_391
float[batch,77,512] add_4
float[batch,77,512] add_412
float[batch,77,512] add_527
float[batch,77,512] add_548
float[batch,77,512] add_663
float[batch,77,512] add_684
float[batch,77,512] add_799
float[batch,77,512] add_820
float[batch,77,512] add_935
float[batch,77,512] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,2048] gelu
float[batch,77,2048] gelu_1
float[batch,77,2048] gelu_10
float[batch,1,2048] gelu_11
float[batch,77,2048] gelu_2
float[batch,77,2048] gelu_3
float[batch,77,2048] gelu_4
float[batch,77,2048] gelu_5
float[batch,77,2048] gelu_6
float[batch,77,2048] gelu_7
float[batch,77,2048] gelu_8
float[batch,77,2048] gelu_9
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,1024] matmul
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] val_39
float[batch,77,512] val_40
float[batch,77,2048] val_41
float[batch,77,512] val_42
float[batch,77,2048] val_43
float[batch,77,512] val_44
float[batch,77,2048] val_45
float[batch,77,512] val_46
float[batch,77,2048] val_47
float[batch,77,512] val_48
float[batch,77,2048] val_49
float[batch,77,512] val_50
float[batch,77,2048] val_51
float[batch,77,512] val_52
float[batch,77,2048] val_53
float[batch,77,512] val_54
float[batch,77,2048] val_55
float[batch,77,512] val_56
float[batch,77,2048] val_57
float[batch,77,512] val_58
float[batch,77,2048] val_59
float[batch,77,512] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2048] val_63
float[batch,1,512] val_64
float[batch,1,512] val_65
float[batch,512] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] 77f071a8300b
ln_final.weight FLOAT[512] cd8e01a514c9
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] b76d27593761
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 947eb6fff5dc
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] dfdc5fe5ea80
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 47e753f9e0c6
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 79d8b36d454e
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 6b5235fe7dfb
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] b400e043133c
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 54ed308312ce
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 9db554fd7d9a
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 31429af7240e
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 12df2d945919
node_scaled_dot_product_attention_wo_t FLOAT[512,512] a12d6c2a5361
positional_embedding FLOAT[77,512] aabb6558cf65
text_projection FLOAT[512,1024] 8e4126ef2a4a
token_embedding.weight_fp16 FLOAT16[49408,512] 003611c38c61
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 388a958a6c14
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] 56a30abd2a9a
transformer.resblocks.0.ln_1.bias FLOAT[512] f28cc76dff83
transformer.resblocks.0.ln_1.weight FLOAT[512] b5f0acceabb0
transformer.resblocks.0.ln_2.bias FLOAT[512] 94ace1aab080
transformer.resblocks.0.ln_2.weight FLOAT[512] e86e4c18c8cf
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 0ac3594f5c74
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 82adb8976a14
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 00399821f7c6
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 0f12a7795681
transformer.resblocks.1.ln_1.bias FLOAT[512] d9df804bc732
transformer.resblocks.1.ln_1.weight FLOAT[512] 542d3bcd63a3
transformer.resblocks.1.ln_2.bias FLOAT[512] 168246c617ee
transformer.resblocks.1.ln_2.weight FLOAT[512] 4f66eac25f9e
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 13628889b41b
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] f78d1fbbf3b8
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 245ddd0a24c4
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 491e5cd43796
transformer.resblocks.10.ln_1.bias FLOAT[512] fe448e49aef6
transformer.resblocks.10.ln_1.weight FLOAT[512] 2d99f2062e4c
transformer.resblocks.10.ln_2.bias FLOAT[512] 89af5cc3c75d
transformer.resblocks.10.ln_2.weight FLOAT[512] d5c791d9995f
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 812e35ad9e7c
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] b1d2f3cac459
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 5a1513140992
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 30be2443e05e
transformer.resblocks.11.ln_1.bias FLOAT[512] adc15fdb4f86
transformer.resblocks.11.ln_1.weight FLOAT[512] dc535dcbaa22
transformer.resblocks.11.ln_2.bias FLOAT[512] 9ce932f04ead
transformer.resblocks.11.ln_2.weight FLOAT[512] d35ca1be9e21
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] 62d94941c02f
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 63167235da8c
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 0872e3aa2a1a
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 555cc4d59d8d
transformer.resblocks.2.ln_1.bias FLOAT[512] 064a2eb9287c
transformer.resblocks.2.ln_1.weight FLOAT[512] 9853f8a8121c
transformer.resblocks.2.ln_2.bias FLOAT[512] 9cd3394ed14c
transformer.resblocks.2.ln_2.weight FLOAT[512] 975c56688dfe
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] e294695e7b0d
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 073f320832fa
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 8ea5012f7b79
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 0b559be86543
transformer.resblocks.3.ln_1.bias FLOAT[512] e85c413f236f
transformer.resblocks.3.ln_1.weight FLOAT[512] 574d72d90032
transformer.resblocks.3.ln_2.bias FLOAT[512] 71694496145f
transformer.resblocks.3.ln_2.weight FLOAT[512] 6d3168b241bd
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] b7e337a3fa04
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 020580626755
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] cb7bc546a476
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] fea63a46e012
transformer.resblocks.4.ln_1.bias FLOAT[512] 292e49dc34b4
transformer.resblocks.4.ln_1.weight FLOAT[512] d16a74d156da
transformer.resblocks.4.ln_2.bias FLOAT[512] 1451151b0d41
transformer.resblocks.4.ln_2.weight FLOAT[512] 00c7cb88a363
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 2fa3b22dd697
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] f9401793691e
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] bb50b4960c31
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 1d31ab49e1e9
transformer.resblocks.5.ln_1.bias FLOAT[512] ac1b3d4934b2
transformer.resblocks.5.ln_1.weight FLOAT[512] 84cb4db9382b
transformer.resblocks.5.ln_2.bias FLOAT[512] 5fa9f0f34bb5
transformer.resblocks.5.ln_2.weight FLOAT[512] 8245eacca271
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 4fe53b1ebd46
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 7aa9baca69ba
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 39d074bad170
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 2dc22fd7bf88
transformer.resblocks.6.ln_1.bias FLOAT[512] 86d79baa4b6c
transformer.resblocks.6.ln_1.weight FLOAT[512] 59bd89dc926a
transformer.resblocks.6.ln_2.bias FLOAT[512] e6fee3b3929d
transformer.resblocks.6.ln_2.weight FLOAT[512] 089b2095a73d
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] aa1aef184d4a
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 6e812763d30c
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 465157abf3bd
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 782c89b99236
transformer.resblocks.7.ln_1.bias FLOAT[512] b3e3df9b1c23
transformer.resblocks.7.ln_1.weight FLOAT[512] f2e711fd3d01
transformer.resblocks.7.ln_2.bias FLOAT[512] a977e6a842e9
transformer.resblocks.7.ln_2.weight FLOAT[512] 25661f62604d
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 871a8a8655b7
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 087cbd2224e8
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 2331ea58005c
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] f7081c174fb5
transformer.resblocks.8.ln_1.bias FLOAT[512] f993dd3c02ac
transformer.resblocks.8.ln_1.weight FLOAT[512] 3c357bb987f7
transformer.resblocks.8.ln_2.bias FLOAT[512] 3d9358d69360
transformer.resblocks.8.ln_2.weight FLOAT[512] f5e0b8631d69
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 5cf45fd50fab
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] ef97cf599c40
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 57e398be6bf1
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 20df2aecc552
transformer.resblocks.9.ln_1.bias FLOAT[512] 2e1b6d15aaa9
transformer.resblocks.9.ln_1.weight FLOAT[512] 2e6979bf1b60
transformer.resblocks.9.ln_2.bias FLOAT[512] fda249c9416c
transformer.resblocks.9.ln_2.weight FLOAT[512] 5f13e5b9e7f5
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] d0197b3d008a
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 89065da77d96
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2048,512] 9d78e2cf66bf
val_11 FLOAT[512,1536] 1882376c7265
val_12 FLOAT[512,2048] 74e3b615f40d
val_13 FLOAT[2048,512] 3f5d1851be72
val_14 FLOAT[512,1536] dd22b0a36a7c
val_15 FLOAT[512,2048] 5429f3e7f1e8
val_16 FLOAT[2048,512] e54a88824bbe
val_17 FLOAT[512,1536] 21817fbf7848
val_18 FLOAT[512,2048] 058f02ff8a00
val_19 FLOAT[2048,512] e20eaa27090f
val_2 FLOAT[512,1536] 8d5813c3ecf5
val_20 FLOAT[512,1536] 6103cb9639ab
val_21 FLOAT[512,2048] 493a3edbf79c
val_22 FLOAT[2048,512] a487909e2ede
val_23 FLOAT[512,1536] fb2771eeca5c
val_24 FLOAT[512,2048] a0250d5f0e82
val_25 FLOAT[2048,512] 52994cc3d2d0
val_26 FLOAT[512,1536] bcb96730117b
val_27 FLOAT[512,2048] 4fbe975e24b3
val_28 FLOAT[2048,512] 67aea2323e9f
val_29 FLOAT[512,1536] 057346dffb95
val_3 FLOAT[512,2048] bf41135793fc
val_30 FLOAT[512,2048] 3b59f98428b9
val_31 FLOAT[2048,512] d8d1aef95aa9
val_32 FLOAT[512,1536] 7cb1deed34bc
val_33 FLOAT[512,2048] 6b6707e5f997
val_34 FLOAT[2048,512] 48c49f593011
val_35 FLOAT[512,1536] 8d5b98b73737
val_36 FLOAT[512,2048] 865779aca14f
val_37 FLOAT[2048,512] 38b36599e5b7
val_4 FLOAT[2048,512] 007d1c1bf672
val_5 FLOAT[512,1536] d284b5dd967d
val_6 FLOAT[512,2048] f3ebedf28693
val_7 FLOAT[2048,512] ff3f0e5282ca
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[512,1536] 42a7ff677da5
val_9 FLOAT[512,2048] ab6745c5433e
+470
View File
@@ -0,0 +1,470 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,1024] image_embedding)
<
float[batch,1024,14,14] add_1016
float[batch,1024,14,14] add_1092
float[batch,2048,7,7] add_1188
float[batch,2048,7,7] add_1264
float[batch,2048,7,7] add_1340
float[50,batch,2048] add_1370
float[batch,256,56,56] add_140
float[batch,256,56,56] add_216
float[batch,256,56,56] add_292
float[batch,512,28,28] add_388
float[batch,512,28,28] add_464
float[batch,512,28,28] add_540
float[batch,512,28,28] add_616
float[batch,1024,14,14] add_712
float[batch,1024,14,14] add_788
float[batch,1024,14,14] add_864
float[batch,1024,14,14] add_940
float[batch,64,56,56] avg_pool2d
float[batch,128,28,28] avg_pool2d_2
float[batch,256,28,28] avg_pool2d_3
float[batch,256,14,14] avg_pool2d_4
float[batch,512,14,14] avg_pool2d_5
float[batch,512,7,7] avg_pool2d_6
float[batch,1024,7,7] avg_pool2d_7
float[50,batch,2048] cat
float[batch,1] clamp_min
float[batch,32,112,112] getitem
float[batch,256,14,14] getitem_102
float[batch,1024,14,14] getitem_105
float[batch,256,14,14] getitem_108
float[batch,256,14,14] getitem_111
float[batch,1024,14,14] getitem_114
float[batch,256,14,14] getitem_117
float[batch,64,56,56] getitem_12
float[batch,256,14,14] getitem_120
float[batch,1024,14,14] getitem_123
float[batch,256,14,14] getitem_126
float[batch,256,14,14] getitem_129
float[batch,1024,14,14] getitem_132
float[batch,512,14,14] getitem_135
float[batch,512,14,14] getitem_138
float[batch,2048,7,7] getitem_141
float[batch,2048,7,7] getitem_144
float[batch,512,7,7] getitem_147
float[batch,256,56,56] getitem_15
float[batch,512,7,7] getitem_150
float[batch,2048,7,7] getitem_153
float[batch,512,7,7] getitem_156
float[batch,512,7,7] getitem_159
float[batch,2048,7,7] getitem_162
float[batch,256,56,56] getitem_18
float[batch,64,56,56] getitem_21
float[batch,64,56,56] getitem_24
float[batch,256,56,56] getitem_27
float[batch,32,112,112] getitem_3
float[batch,64,56,56] getitem_30
float[batch,64,56,56] getitem_33
float[batch,256,56,56] getitem_36
float[batch,128,56,56] getitem_39
float[batch,128,56,56] getitem_42
float[batch,512,28,28] getitem_45
float[batch,512,28,28] getitem_48
float[batch,128,28,28] getitem_51
float[batch,128,28,28] getitem_54
float[batch,512,28,28] getitem_57
float[batch,64,112,112] getitem_6
float[batch,128,28,28] getitem_60
float[batch,128,28,28] getitem_63
float[batch,512,28,28] getitem_66
float[batch,128,28,28] getitem_69
float[batch,128,28,28] getitem_72
float[batch,512,28,28] getitem_75
float[batch,256,28,28] getitem_78
float[batch,256,28,28] getitem_81
float[batch,1024,14,14] getitem_84
float[batch,1024,14,14] getitem_87
float[batch,64,56,56] getitem_9
float[batch,256,14,14] getitem_90
float[batch,256,14,14] getitem_93
float[batch,1024,14,14] getitem_96
float[batch,256,14,14] getitem_99
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,224,224,3] image_shifted
float[batch,1] linalg_vector_norm
float[1,batch,2048] linear
float[50,batch,2048] linear_1
float[50,batch,2048] linear_2
float[batch,1024] linear_3
float[1,batch,2048] mean
float[1,batch,2048] node_scaled_dot_product_attention_q_row
float[49,batch,2048] permute_1
float[1,batch,32,64] permute_2
float[batch,32,112,112] relu
float[batch,32,112,112] relu_1
float[batch,64,56,56] relu_10
float[batch,256,56,56] relu_11
float[batch,128,56,56] relu_12
float[batch,128,56,56] relu_13
float[batch,512,28,28] relu_14
float[batch,128,28,28] relu_15
float[batch,128,28,28] relu_16
float[batch,512,28,28] relu_17
float[batch,128,28,28] relu_18
float[batch,128,28,28] relu_19
float[batch,64,112,112] relu_2
float[batch,512,28,28] relu_20
float[batch,128,28,28] relu_21
float[batch,128,28,28] relu_22
float[batch,512,28,28] relu_23
float[batch,256,28,28] relu_24
float[batch,256,28,28] relu_25
float[batch,1024,14,14] relu_26
float[batch,256,14,14] relu_27
float[batch,256,14,14] relu_28
float[batch,1024,14,14] relu_29
float[batch,64,56,56] relu_3
float[batch,256,14,14] relu_30
float[batch,256,14,14] relu_31
float[batch,1024,14,14] relu_32
float[batch,256,14,14] relu_33
float[batch,256,14,14] relu_34
float[batch,1024,14,14] relu_35
float[batch,256,14,14] relu_36
float[batch,256,14,14] relu_37
float[batch,1024,14,14] relu_38
float[batch,256,14,14] relu_39
float[batch,64,56,56] relu_4
float[batch,256,14,14] relu_40
float[batch,1024,14,14] relu_41
float[batch,512,14,14] relu_42
float[batch,512,14,14] relu_43
float[batch,2048,7,7] relu_44
float[batch,512,7,7] relu_45
float[batch,512,7,7] relu_46
float[batch,2048,7,7] relu_47
float[batch,512,7,7] relu_48
float[batch,512,7,7] relu_49
float[batch,256,56,56] relu_5
float[batch,2048,7,7] relu_50
float[batch,64,56,56] relu_6
float[batch,64,56,56] relu_7
float[batch,256,56,56] relu_8
float[batch,64,56,56] relu_9
float[batch,32,1,64] scaled_dot_product_attention
float[batch,1024] select
float[2048] split_split_0
float[2048] split_split_1
float[2048] split_split_2
float[unk__1,1,64] transpose
float[unk__1,50,64] transpose_1
float[unk__1,50,64] transpose_2
float[50,1,2048] unsqueeze
float[1,batch,2048] val_7
float[50,batch,2048] val_8
float[50,batch,2048] val_9
float[1,batch,1024] view_10
float[batch,2048,49] view_2
float[1,unk__1,64] view_3
float[50,unk__1,64] view_4
float[50,unk__1,64] view_5
float[batch,32,1,64] view_6
float[batch,32,50,64] view_7
float[batch,32,50,64] view_8
float[batch,2048] view_9
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_shift] image_shifted = Sub (image_f32, image_shift)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
[node_relu] relu = Relu (getitem)
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
relu_1 = Relu (getitem_3)
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
relu_2 = Relu (getitem_6)
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
relu_3 = Relu (getitem_9)
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
relu_4 = Relu (getitem_12)
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
add_140 = Add (getitem_15, getitem_18)
relu_5 = Relu (add_140)
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
relu_6 = Relu (getitem_21)
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
relu_7 = Relu (getitem_24)
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
add_216 = Add (getitem_27, relu_5)
relu_8 = Relu (add_216)
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
relu_9 = Relu (getitem_30)
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
relu_10 = Relu (getitem_33)
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
add_292 = Add (getitem_36, relu_8)
relu_11 = Relu (add_292)
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
relu_12 = Relu (getitem_39)
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
relu_13 = Relu (getitem_42)
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_13)
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_11)
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
add_388 = Add (getitem_45, getitem_48)
relu_14 = Relu (add_388)
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
relu_15 = Relu (getitem_51)
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
relu_16 = Relu (getitem_54)
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
add_464 = Add (getitem_57, relu_14)
relu_17 = Relu (add_464)
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
relu_18 = Relu (getitem_60)
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
relu_19 = Relu (getitem_63)
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
add_540 = Add (getitem_66, relu_17)
relu_20 = Relu (add_540)
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
relu_21 = Relu (getitem_69)
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
relu_22 = Relu (getitem_72)
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
add_616 = Add (getitem_75, relu_20)
relu_23 = Relu (add_616)
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
relu_24 = Relu (getitem_78)
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
relu_25 = Relu (getitem_81)
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_25)
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_23)
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
add_712 = Add (getitem_84, getitem_87)
relu_26 = Relu (add_712)
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
relu_27 = Relu (getitem_90)
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
relu_28 = Relu (getitem_93)
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
add_788 = Add (getitem_96, relu_26)
relu_29 = Relu (add_788)
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
relu_30 = Relu (getitem_99)
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
relu_31 = Relu (getitem_102)
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
add_864 = Add (getitem_105, relu_29)
relu_32 = Relu (add_864)
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
relu_33 = Relu (getitem_108)
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
relu_34 = Relu (getitem_111)
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
add_940 = Add (getitem_114, relu_32)
relu_35 = Relu (add_940)
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
relu_36 = Relu (getitem_117)
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
relu_37 = Relu (getitem_120)
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
add_1016 = Add (getitem_123, relu_35)
relu_38 = Relu (add_1016)
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
relu_39 = Relu (getitem_126)
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
relu_40 = Relu (getitem_129)
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
add_1092 = Add (getitem_132, relu_38)
relu_41 = Relu (add_1092)
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
relu_42 = Relu (getitem_135)
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
relu_43 = Relu (getitem_138)
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_43)
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_41)
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
add_1188 = Add (getitem_141, getitem_144)
relu_44 = Relu (add_1188)
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
relu_45 = Relu (getitem_147)
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
relu_46 = Relu (getitem_150)
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
add_1264 = Add (getitem_153, relu_44)
relu_47 = Relu (add_1264)
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
relu_48 = Relu (getitem_156)
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
relu_49 = Relu (getitem_159)
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
add_1340 = Add (getitem_162, relu_47)
relu_50 = Relu (add_1340)
view_2 = Reshape <allowzero: int = 1> (relu_50, view_2_target)
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
add_1370 = Add (cat, unsqueeze)
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
node_scaled_dot_product_attention_q_row = Slice (add_1370, val_0, val_3, val_0)
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
[node_linear] linear = Add (val_7, split_split_0)
val_8 = MatMul (add_1370, val_5)
linear_1 = Add (val_8, split_split_1)
val_9 = MatMul (add_1370, val_6)
linear_2 = Add (val_9, split_split_2)
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
select = Squeeze (view_10, val_0)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
cat_1 FLOAT[6144] df95ca65e24e
image_shift FLOAT[3] 2f7a50e604ad
node_scaled_dot_product_attention_out_1 INT64[3] 7162728d1394
node_scaled_dot_product_attention_q_pack_1 INT64[4] f7b9b5620534
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
val_0 INT64[1] af5570f5a181
val_1 INT64[1] 12a3ae445661
val_2 FLOAT[] 6708d9be4956
val_3 INT64[1] 7c9fa136d441
val_4 FLOAT[2048,2048] 179e44aa6e8e
val_5 FLOAT[2048,2048] f35932d5b5ae
val_6 FLOAT[2048,2048] c6d6ffb858e0
view_2_target INT64[3] 68ffb9ecb5ec
view_4_target INT64[3] c7a3d94c4eb2
view_7_target INT64[4] e0ea1841387b
view_9_target INT64[2] 76aecb4697fd
visual.attnpool.c_proj.bias FLOAT[1024] df60be281db6
visual.attnpool.c_proj.weight FLOAT[1024,2048] 9d6a95272770
visual.attnpool.positional_embedding FLOAT[50,2048] 396f29e5c408
visual.conv1.weight FLOAT[32,3,3,3] 6cbbd853fa93
visual.conv1.weight_bias FLOAT[32] 0af1282746f8
visual.conv2.weight FLOAT[32,32,3,3] b71dfff28c94
visual.conv2.weight_bias FLOAT[32] 7f768051008d
visual.conv3.weight FLOAT[64,32,3,3] 30699c58b66c
visual.conv3.weight_bias FLOAT[64] 3d9c846d3dca
visual.layer1.0.conv1.weight FLOAT[64,64,1,1] f21a4f8dd380
visual.layer1.0.conv1.weight_bias FLOAT[64] fa6c16e86008
visual.layer1.0.conv2.weight FLOAT[64,64,3,3] 71f0685b7565
visual.layer1.0.conv2.weight_bias FLOAT[64] d06416d1fc00
visual.layer1.0.conv3.weight FLOAT[256,64,1,1] 90a9f40cd783
visual.layer1.0.conv3.weight_bias FLOAT[256] 840a87702de6
visual.layer1.0.downsample.0.weight FLOAT[256,64,1,1] 4ee647624411
visual.layer1.0.downsample.0.weight_bias FLOAT[256] 4251dfdb4659
visual.layer1.1.conv1.weight FLOAT[64,256,1,1] c67d7fb523ce
visual.layer1.1.conv1.weight_bias FLOAT[64] 201879906095
visual.layer1.1.conv2.weight FLOAT[64,64,3,3] f69bc81b4d27
visual.layer1.1.conv2.weight_bias FLOAT[64] b744ae7480a8
visual.layer1.1.conv3.weight FLOAT[256,64,1,1] 7ef89f3d5cb4
visual.layer1.1.conv3.weight_bias FLOAT[256] 6a541318b2e7
visual.layer1.2.conv1.weight FLOAT[64,256,1,1] 68725ac96967
visual.layer1.2.conv1.weight_bias FLOAT[64] b234b11656bf
visual.layer1.2.conv2.weight FLOAT[64,64,3,3] 6e002beb9aee
visual.layer1.2.conv2.weight_bias FLOAT[64] b6a75cff34f3
visual.layer1.2.conv3.weight FLOAT[256,64,1,1] fd0df84b85f8
visual.layer1.2.conv3.weight_bias FLOAT[256] 051d1e121440
visual.layer2.0.conv1.weight FLOAT[128,256,1,1] 3a35a76fa824
visual.layer2.0.conv1.weight_bias FLOAT[128] 693a181f82cd
visual.layer2.0.conv2.weight FLOAT[128,128,3,3] 6276b9cfefd0
visual.layer2.0.conv2.weight_bias FLOAT[128] 077dd5b7b03b
visual.layer2.0.conv3.weight FLOAT[512,128,1,1] e6ec935868ef
visual.layer2.0.conv3.weight_bias FLOAT[512] bdb303c14f86
visual.layer2.0.downsample.0.weight FLOAT[512,256,1,1] 38e737c0be64
visual.layer2.0.downsample.0.weight_bias FLOAT[512] 8c3049497503
visual.layer2.1.conv1.weight FLOAT[128,512,1,1] 36b9615baecd
visual.layer2.1.conv1.weight_bias FLOAT[128] 150c1fc0e91d
visual.layer2.1.conv2.weight FLOAT[128,128,3,3] 8288ee8e51ae
visual.layer2.1.conv2.weight_bias FLOAT[128] 0801fbee5654
visual.layer2.1.conv3.weight FLOAT[512,128,1,1] 4c67feecaa30
visual.layer2.1.conv3.weight_bias FLOAT[512] 77897dd295ec
visual.layer2.2.conv1.weight FLOAT[128,512,1,1] 85d4438ee64e
visual.layer2.2.conv1.weight_bias FLOAT[128] b0c6f9d82202
visual.layer2.2.conv2.weight FLOAT[128,128,3,3] bbd6358a15f1
visual.layer2.2.conv2.weight_bias FLOAT[128] 1ca11970a665
visual.layer2.2.conv3.weight FLOAT[512,128,1,1] 8dc18f9d6717
visual.layer2.2.conv3.weight_bias FLOAT[512] 27a2b42a78c3
visual.layer2.3.conv1.weight FLOAT[128,512,1,1] 7063a64c5dab
visual.layer2.3.conv1.weight_bias FLOAT[128] a3fe98df3283
visual.layer2.3.conv2.weight FLOAT[128,128,3,3] e37cd7fc1064
visual.layer2.3.conv2.weight_bias FLOAT[128] 715d4cfc19dd
visual.layer2.3.conv3.weight FLOAT[512,128,1,1] 67d3744f5d4d
visual.layer2.3.conv3.weight_bias FLOAT[512] 5d6ab2ebb159
visual.layer3.0.conv1.weight FLOAT[256,512,1,1] f937a3498bf7
visual.layer3.0.conv1.weight_bias FLOAT[256] e67067b8b946
visual.layer3.0.conv2.weight FLOAT[256,256,3,3] 36f578dc6761
visual.layer3.0.conv2.weight_bias FLOAT[256] 9f03347edde1
visual.layer3.0.conv3.weight FLOAT[1024,256,1,1] 3c18d3f8934e
visual.layer3.0.conv3.weight_bias FLOAT[1024] ff1254375360
visual.layer3.0.downsample.0.weight FLOAT[1024,512,1,1] 7d70d3ebb9ea
visual.layer3.0.downsample.0.weight_bias FLOAT[1024] 31e57c846476
visual.layer3.1.conv1.weight FLOAT[256,1024,1,1] bb68d98c75b8
visual.layer3.1.conv1.weight_bias FLOAT[256] 672ad936c80f
visual.layer3.1.conv2.weight FLOAT[256,256,3,3] 7d65d202b33f
visual.layer3.1.conv2.weight_bias FLOAT[256] 1f0d5dd753f8
visual.layer3.1.conv3.weight FLOAT[1024,256,1,1] ec57c49c8a44
visual.layer3.1.conv3.weight_bias FLOAT[1024] 5c1a0a0cb674
visual.layer3.2.conv1.weight FLOAT[256,1024,1,1] c8b2a6d5aee9
visual.layer3.2.conv1.weight_bias FLOAT[256] c14e26670ed2
visual.layer3.2.conv2.weight FLOAT[256,256,3,3] 0228c2e51cbd
visual.layer3.2.conv2.weight_bias FLOAT[256] 947aca8f4144
visual.layer3.2.conv3.weight FLOAT[1024,256,1,1] 66b45161a6d3
visual.layer3.2.conv3.weight_bias FLOAT[1024] 9a62bb13a675
visual.layer3.3.conv1.weight FLOAT[256,1024,1,1] d92f2d8868ba
visual.layer3.3.conv1.weight_bias FLOAT[256] 8f6c8679b428
visual.layer3.3.conv2.weight FLOAT[256,256,3,3] c3bd71a7c24f
visual.layer3.3.conv2.weight_bias FLOAT[256] 1b3e9de84fa6
visual.layer3.3.conv3.weight FLOAT[1024,256,1,1] 6e197843f1b8
visual.layer3.3.conv3.weight_bias FLOAT[1024] 07fd1c1cc381
visual.layer3.4.conv1.weight FLOAT[256,1024,1,1] 18145ec0d152
visual.layer3.4.conv1.weight_bias FLOAT[256] b15cb90641c7
visual.layer3.4.conv2.weight FLOAT[256,256,3,3] 31466f68a7e4
visual.layer3.4.conv2.weight_bias FLOAT[256] 6ef180df2257
visual.layer3.4.conv3.weight FLOAT[1024,256,1,1] 0b0fd15b7f17
visual.layer3.4.conv3.weight_bias FLOAT[1024] fcf5899fd24b
visual.layer3.5.conv1.weight FLOAT[256,1024,1,1] 3cc6d97df786
visual.layer3.5.conv1.weight_bias FLOAT[256] b0fe210a291e
visual.layer3.5.conv2.weight FLOAT[256,256,3,3] 1af08841e7b4
visual.layer3.5.conv2.weight_bias FLOAT[256] 3ea5c886bd0c
visual.layer3.5.conv3.weight FLOAT[1024,256,1,1] 7e29537c4912
visual.layer3.5.conv3.weight_bias FLOAT[1024] b5976cf2b5ce
visual.layer4.0.conv1.weight FLOAT[512,1024,1,1] cda4ceadd027
visual.layer4.0.conv1.weight_bias FLOAT[512] 0a396eb69d5a
visual.layer4.0.conv2.weight FLOAT[512,512,3,3] 06cbbd03890c
visual.layer4.0.conv2.weight_bias FLOAT[512] c716d0681863
visual.layer4.0.conv3.weight FLOAT[2048,512,1,1] 796956dbf498
visual.layer4.0.conv3.weight_bias FLOAT[2048] 1fb92fff017f
visual.layer4.0.downsample.0.weight FLOAT[2048,1024,1,1] 10f53ba633b6
visual.layer4.0.downsample.0.weight_bias FLOAT[2048] d20456dfb726
visual.layer4.1.conv1.weight FLOAT[512,2048,1,1] 17341183b2fb
visual.layer4.1.conv1.weight_bias FLOAT[512] d99a4dfbf46b
visual.layer4.1.conv2.weight FLOAT[512,512,3,3] aa4701abb392
visual.layer4.1.conv2.weight_bias FLOAT[512] 692a1605e8ce
visual.layer4.1.conv3.weight FLOAT[2048,512,1,1] 5e2c03b231c3
visual.layer4.1.conv3.weight_bias FLOAT[2048] 1031fdae7617
visual.layer4.2.conv1.weight FLOAT[512,2048,1,1] e22d4d6bb285
visual.layer4.2.conv1.weight_bias FLOAT[512] dfc8467f91e3
visual.layer4.2.conv2.weight FLOAT[512,512,3,3] f8bc17346a0a
visual.layer4.2.conv2.weight_bias FLOAT[512] 38b28dae7930
visual.layer4.2.conv3.weight FLOAT[2048,512,1,1] efa244c6cf88
visual.layer4.2.conv3.weight_bias FLOAT[2048] 6cacd19b67be
+625
View File
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
<
float[batch,77,768] add_1012
float[batch,77,768] add_1127
float[batch,77,768] add_1156
float[batch,77,768] add_119
float[batch,77,768] add_1271
float[batch,77,768] add_1300
float[batch,77,768] add_1415
float[batch,77,768] add_1444
float[batch,77,768] add_148
float[batch,77,768] add_1559
float[batch,77,768] add_1588
float[batch,1,768] add_1588_pooled
float[batch,1,768] add_1703
float[batch,1,768] add_1732
float[batch,77,768] add_263
float[batch,77,768] add_292
float[batch,77,768] add_4
float[batch,77,768] add_407
float[batch,77,768] add_436
float[batch,77,768] add_551
float[batch,77,768] add_580
float[batch,77,768] add_695
float[batch,77,768] add_724
float[batch,77,768] add_839
float[batch,77,768] add_868
float[batch,77,768] add_983
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,768] embedding
float[batch,77,768] layer_norm
float[batch,77,768] layer_norm_1
float[batch,77,768] layer_norm_10
float[batch,77,768] layer_norm_11
float[batch,77,768] layer_norm_12
float[batch,77,768] layer_norm_13
float[batch,77,768] layer_norm_14
float[batch,77,768] layer_norm_15
float[batch,77,768] layer_norm_16
float[batch,77,768] layer_norm_17
float[batch,77,768] layer_norm_18
float[batch,77,768] layer_norm_19
float[batch,77,768] layer_norm_2
float[batch,77,768] layer_norm_20
float[batch,77,768] layer_norm_21
float[batch,77,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,77,768] layer_norm_3
float[batch,77,768] layer_norm_4
float[batch,77,768] layer_norm_5
float[batch,77,768] layer_norm_6
float[batch,77,768] layer_norm_7
float[batch,77,768] layer_norm_8
float[batch,77,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,3072] linear_10
float[batch,77,768] linear_11
float[batch,77,3072] linear_14
float[batch,77,768] linear_15
float[batch,77,3072] linear_18
float[batch,77,768] linear_19
float[batch,77,3072] linear_2
float[batch,77,3072] linear_22
float[batch,77,768] linear_23
float[batch,77,3072] linear_26
float[batch,77,768] linear_27
float[batch,77,768] linear_3
float[batch,77,3072] linear_30
float[batch,77,768] linear_31
float[batch,77,3072] linear_34
float[batch,77,768] linear_35
float[batch,77,3072] linear_38
float[batch,77,768] linear_39
float[batch,77,3072] linear_42
float[batch,77,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,77,3072] linear_6
float[batch,77,768] linear_7
float[batch,768] matmul
float[batch,77,3072] mul_101
float[batch,77,3072] mul_106
float[batch,77,3072] mul_1064
float[batch,77,3072] mul_1069
float[batch,77,3072] mul_1171
float[batch,77,3072] mul_1176
float[batch,1,3072] mul_1278
float[batch,1,3072] mul_1283
float[batch,77,3072] mul_208
float[batch,77,3072] mul_213
float[batch,77,3072] mul_315
float[batch,77,3072] mul_320
float[batch,77,3072] mul_422
float[batch,77,3072] mul_427
float[batch,77,3072] mul_529
float[batch,77,3072] mul_534
float[batch,77,3072] mul_636
float[batch,77,3072] mul_641
float[batch,77,3072] mul_743
float[batch,77,3072] mul_748
float[batch,77,3072] mul_850
float[batch,77,3072] mul_855
float[batch,77,3072] mul_957
float[batch,77,3072] mul_962
float[batch,77,768] node_scaled_dot_product_attention_10_k
float[batch,77,768] node_scaled_dot_product_attention_10_out
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_q
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_v
float[batch,77,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_q
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_v
float[batch,77,768] node_scaled_dot_product_attention_1_k
float[batch,77,768] node_scaled_dot_product_attention_1_out
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_q
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_v
float[batch,77,768] node_scaled_dot_product_attention_2_k
float[batch,77,768] node_scaled_dot_product_attention_2_out
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_q
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_v
float[batch,77,768] node_scaled_dot_product_attention_3_k
float[batch,77,768] node_scaled_dot_product_attention_3_out
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_q
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_v
float[batch,77,768] node_scaled_dot_product_attention_4_k
float[batch,77,768] node_scaled_dot_product_attention_4_out
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_q
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_v
float[batch,77,768] node_scaled_dot_product_attention_5_k
float[batch,77,768] node_scaled_dot_product_attention_5_out
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_q
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_v
float[batch,77,768] node_scaled_dot_product_attention_6_k
float[batch,77,768] node_scaled_dot_product_attention_6_out
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_q
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_v
float[batch,77,768] node_scaled_dot_product_attention_7_k
float[batch,77,768] node_scaled_dot_product_attention_7_out
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_q
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_v
float[batch,77,768] node_scaled_dot_product_attention_8_k
float[batch,77,768] node_scaled_dot_product_attention_8_out
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_q
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_v
float[batch,77,768] node_scaled_dot_product_attention_9_k
float[batch,77,768] node_scaled_dot_product_attention_9_out
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_q
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_v
float[batch,77,768] node_scaled_dot_product_attention_k
float[batch,77,768] node_scaled_dot_product_attention_out
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_q
float[batch,77,2304] node_scaled_dot_product_attention_qkv
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_v
float[batch,77,768] scaled_dot_product_attention
float[batch,77,768] scaled_dot_product_attention_1
float[batch,77,768] scaled_dot_product_attention_10
float[batch,77,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_11_pooled
float[batch,77,768] scaled_dot_product_attention_2
float[batch,77,768] scaled_dot_product_attention_3
float[batch,77,768] scaled_dot_product_attention_4
float[batch,77,768] scaled_dot_product_attention_5
float[batch,77,768] scaled_dot_product_attention_6
float[batch,77,768] scaled_dot_product_attention_7
float[batch,77,768] scaled_dot_product_attention_8
float[batch,77,768] scaled_dot_product_attention_9
float[batch,77,3072] sigmoid
float[batch,77,3072] sigmoid_1
float[batch,77,3072] sigmoid_10
float[batch,1,3072] sigmoid_11
float[batch,77,3072] sigmoid_2
float[batch,77,3072] sigmoid_3
float[batch,77,3072] sigmoid_4
float[batch,77,3072] sigmoid_5
float[batch,77,3072] sigmoid_6
float[batch,77,3072] sigmoid_7
float[batch,77,3072] sigmoid_8
float[batch,77,3072] sigmoid_9
float[batch,77,3072] val_40
float[batch,77,768] val_41
float[batch,77,3072] val_42
float[batch,77,768] val_43
float[batch,77,3072] val_44
float[batch,77,768] val_45
float[batch,77,3072] val_46
float[batch,77,768] val_47
float[batch,77,3072] val_48
float[batch,77,768] val_49
float[batch,77,3072] val_50
float[batch,77,768] val_51
float[batch,77,3072] val_52
float[batch,77,768] val_53
float[batch,77,3072] val_54
float[batch,77,768] val_55
float[batch,77,3072] val_56
float[batch,77,768] val_57
float[batch,77,3072] val_58
float[batch,77,768] val_59
float[batch,77,3072] val_60
float[batch,77,768] val_61
float[batch,77] val_62
float[batch,1,77] val_63
float[batch,1,3072] val_64
float[batch,1,768] val_65
float[batch,1,768] val_66
float[batch,768] val_67
>
{
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_39)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_40 = MatMul (layer_norm_1, val_4)
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
mul_101 = Mul (linear_2, val_2)
[node_sigmoid] sigmoid = Sigmoid (mul_101)
mul_106 = Mul (linear_2, sigmoid)
val_41 = MatMul (mul_106, val_5)
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
add_148 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_42 = MatMul (layer_norm_3, val_7)
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
mul_208 = Mul (linear_6, val_2)
sigmoid_1 = Sigmoid (mul_208)
mul_213 = Mul (linear_6, sigmoid_1)
val_43 = MatMul (mul_213, val_8)
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
add_292 = Add (add_263, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_44 = MatMul (layer_norm_5, val_10)
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
mul_315 = Mul (linear_10, val_2)
sigmoid_2 = Sigmoid (mul_315)
mul_320 = Mul (linear_10, sigmoid_2)
val_45 = MatMul (mul_320, val_11)
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
add_436 = Add (add_407, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_46 = MatMul (layer_norm_7, val_13)
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
mul_422 = Mul (linear_14, val_2)
sigmoid_3 = Sigmoid (mul_422)
mul_427 = Mul (linear_14, sigmoid_3)
val_47 = MatMul (mul_427, val_14)
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
add_580 = Add (add_551, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_48 = MatMul (layer_norm_9, val_16)
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
mul_529 = Mul (linear_18, val_2)
sigmoid_4 = Sigmoid (mul_529)
mul_534 = Mul (linear_18, sigmoid_4)
val_49 = MatMul (mul_534, val_17)
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
add_724 = Add (add_695, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_50 = MatMul (layer_norm_11, val_19)
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
mul_636 = Mul (linear_22, val_2)
sigmoid_5 = Sigmoid (mul_636)
mul_641 = Mul (linear_22, sigmoid_5)
val_51 = MatMul (mul_641, val_20)
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
add_868 = Add (add_839, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_52 = MatMul (layer_norm_13, val_22)
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
mul_743 = Mul (linear_26, val_2)
sigmoid_6 = Sigmoid (mul_743)
mul_748 = Mul (linear_26, sigmoid_6)
val_53 = MatMul (mul_748, val_23)
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
add_1012 = Add (add_983, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_54 = MatMul (layer_norm_15, val_25)
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
mul_850 = Mul (linear_30, val_2)
sigmoid_7 = Sigmoid (mul_850)
mul_855 = Mul (linear_30, sigmoid_7)
val_55 = MatMul (mul_855, val_26)
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
add_1156 = Add (add_1127, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_56 = MatMul (layer_norm_17, val_28)
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
mul_957 = Mul (linear_34, val_2)
sigmoid_8 = Sigmoid (mul_957)
mul_962 = Mul (linear_34, sigmoid_8)
val_57 = MatMul (mul_962, val_29)
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
add_1300 = Add (add_1271, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_58 = MatMul (layer_norm_19, val_31)
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
mul_1064 = Mul (linear_38, val_2)
sigmoid_9 = Sigmoid (mul_1064)
mul_1069 = Mul (linear_38, sigmoid_9)
val_59 = MatMul (mul_1069, val_32)
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
add_1444 = Add (add_1415, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_60 = MatMul (layer_norm_21, val_34)
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
mul_1171 = Mul (linear_42, val_2)
sigmoid_10 = Sigmoid (mul_1171)
mul_1176 = Mul (linear_42, sigmoid_10)
val_61 = MatMul (mul_1176, val_35)
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
add_1588 = Add (add_1559, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
val_63 = Unsqueeze (val_62, val_756_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_64 = MatMul (layer_norm_23, val_37)
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
mul_1278 = Mul (linear_46, val_2)
sigmoid_11 = Sigmoid (mul_1278)
mul_1283 = Mul (linear_46, sigmoid_11)
val_65 = MatMul (mul_1283, val_38)
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
add_1732 = Add (add_1703, linear_47)
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
val_67 = Squeeze (val_66, val_756_axes1)
[node_matmul] matmul = MatMul (val_67, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
ln_final.bias FLOAT[768] 100004822950
ln_final.weight FLOAT[768] 0136c6773f00
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] e33901c0d394
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 08bca1c5803a
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 118b5da0f700
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] a8ceeef56c60
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 8645429ddbf1
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] fec1905912d4
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 21516b615050
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] fe9c56abb966
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] fc1f5d9488d4
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 18400c0082df
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 0790c3b1ab0a
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 0d2609ab524b
positional_embedding FLOAT[77,768] 59125373f895
text_projection FLOAT[768,768] 8b20833f2781
token_embedding.weight_fp16 FLOAT16[49408,768] 544b4adceddb
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] b2ccc6a11b25
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 1506b2e576e8
transformer.resblocks.0.ln_1.bias FLOAT[768] cd90f2fc3168
transformer.resblocks.0.ln_1.weight FLOAT[768] c5572dbed0af
transformer.resblocks.0.ln_2.bias FLOAT[768] 60cb1d65f713
transformer.resblocks.0.ln_2.weight FLOAT[768] f35fc416abcb
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 59618ac52420
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] a4620cf2e555
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 52c7a89931ef
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 19faba362480
transformer.resblocks.1.ln_1.bias FLOAT[768] be953e0027f7
transformer.resblocks.1.ln_1.weight FLOAT[768] 531185c092ec
transformer.resblocks.1.ln_2.bias FLOAT[768] f530bf09075f
transformer.resblocks.1.ln_2.weight FLOAT[768] 2ba898d4ec74
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 230d211c669e
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 5ccb7207f453
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] b02067f84cf0
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] eae9891ba0d3
transformer.resblocks.10.ln_1.bias FLOAT[768] 575551c7b85c
transformer.resblocks.10.ln_1.weight FLOAT[768] d33dd60ec554
transformer.resblocks.10.ln_2.bias FLOAT[768] 2856ee54ec07
transformer.resblocks.10.ln_2.weight FLOAT[768] cbca41515b2d
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 68050367d839
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] f54c970ed4b7
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] a7f19122f8b0
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 5495356d1aa4
transformer.resblocks.11.ln_1.bias FLOAT[768] b4cb7014048a
transformer.resblocks.11.ln_1.weight FLOAT[768] 63a95cc1eb7b
transformer.resblocks.11.ln_2.bias FLOAT[768] 816c193e1c68
transformer.resblocks.11.ln_2.weight FLOAT[768] f03e0e4f4ea1
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 715741b4ce08
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] d3b7f4cedac1
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 9a16f33808b1
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] c7ac1e19dc30
transformer.resblocks.2.ln_1.bias FLOAT[768] a552aa705660
transformer.resblocks.2.ln_1.weight FLOAT[768] 2cf1a5470d12
transformer.resblocks.2.ln_2.bias FLOAT[768] e8fff3724b26
transformer.resblocks.2.ln_2.weight FLOAT[768] 5b2ae4b7fb8d
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 2af65e87e7d6
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] f89e612645ac
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 6773bfabbd24
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 5cc9b7e7dbec
transformer.resblocks.3.ln_1.bias FLOAT[768] 7f82763dda12
transformer.resblocks.3.ln_1.weight FLOAT[768] 4d34fb1b9d08
transformer.resblocks.3.ln_2.bias FLOAT[768] 1130cca4387d
transformer.resblocks.3.ln_2.weight FLOAT[768] 6da67571fd1d
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 2f1507dc2465
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] fbe2b39040f2
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 27c9e5dbd233
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 5c59ece72e51
transformer.resblocks.4.ln_1.bias FLOAT[768] 2892603f8cec
transformer.resblocks.4.ln_1.weight FLOAT[768] 784fa135583a
transformer.resblocks.4.ln_2.bias FLOAT[768] 75cbac4acfa4
transformer.resblocks.4.ln_2.weight FLOAT[768] 54bcb42cb051
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] f9c55d6d7ba2
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 2c9be3ee33eb
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 88a1cd28f5a7
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 4dbc3ccea713
transformer.resblocks.5.ln_1.bias FLOAT[768] 6171b019890d
transformer.resblocks.5.ln_1.weight FLOAT[768] a73ae5068663
transformer.resblocks.5.ln_2.bias FLOAT[768] 8356224056e8
transformer.resblocks.5.ln_2.weight FLOAT[768] d34e601ebf72
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 131001196f40
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 30f5f5b86c00
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 88eafe35c826
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 91b45a1541c9
transformer.resblocks.6.ln_1.bias FLOAT[768] 3e4a46a26ab2
transformer.resblocks.6.ln_1.weight FLOAT[768] c78bb1247bfa
transformer.resblocks.6.ln_2.bias FLOAT[768] 1c52c07b5558
transformer.resblocks.6.ln_2.weight FLOAT[768] ce0c96f7a85c
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] a6d4ab9fc3e4
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 7039339849a1
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] c056c7e7be21
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 234d082ffb16
transformer.resblocks.7.ln_1.bias FLOAT[768] f2ee88be5984
transformer.resblocks.7.ln_1.weight FLOAT[768] ef2b323f1528
transformer.resblocks.7.ln_2.bias FLOAT[768] f7369db99c35
transformer.resblocks.7.ln_2.weight FLOAT[768] 24aa617c1559
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 8badc0181b92
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] ebe58dabd477
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 6c971eec6ff3
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 3e6bd5e537c3
transformer.resblocks.8.ln_1.bias FLOAT[768] 7a7818705aee
transformer.resblocks.8.ln_1.weight FLOAT[768] e742b2211383
transformer.resblocks.8.ln_2.bias FLOAT[768] ef7a1f046a51
transformer.resblocks.8.ln_2.weight FLOAT[768] e8bdc2b4fb76
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 36ffa743209b
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 53932e7fdcf7
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 7ff66762228b
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 5fccc3c382a8
transformer.resblocks.9.ln_1.bias FLOAT[768] c862cce2c7ea
transformer.resblocks.9.ln_1.weight FLOAT[768] 178a60d8c180
transformer.resblocks.9.ln_2.bias FLOAT[768] 0e98cf075b7e
transformer.resblocks.9.ln_2.weight FLOAT[768] 1b7ebd569920
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 1ab57bcff614
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] f4d2f64d8400
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] 3078a5600e65
val_11 FLOAT[3072,768] 2bbe9ddf4998
val_12 FLOAT[768,2304] 7f808ac8f09d
val_13 FLOAT[768,3072] 7b7851767c9d
val_14 FLOAT[3072,768] 1eaffc0ceec5
val_15 FLOAT[768,2304] 9ea6013d01c8
val_16 FLOAT[768,3072] c76af518ead0
val_17 FLOAT[3072,768] 3e4cd02b55d8
val_18 FLOAT[768,2304] b52a681393f8
val_19 FLOAT[768,3072] 3ecb39dc4405
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[3072,768] 07e5f3489737
val_21 FLOAT[768,2304] b2439148daa9
val_22 FLOAT[768,3072] 702a6524b67a
val_23 FLOAT[3072,768] 704ea77e87ef
val_24 FLOAT[768,2304] 82642f87d31e
val_25 FLOAT[768,3072] 8723a0af612b
val_26 FLOAT[3072,768] f157af1a2f9d
val_27 FLOAT[768,2304] b7f47f4b917a
val_28 FLOAT[768,3072] b9c379e8b542
val_29 FLOAT[3072,768] 2a037c91f58c
val_3 FLOAT[768,2304] eaa526c19027
val_30 FLOAT[768,2304] ed5ed5d1241f
val_31 FLOAT[768,3072] 15c8a9950c07
val_32 FLOAT[3072,768] 6c3551ca2fbc
val_33 FLOAT[768,2304] d05f685929ae
val_34 FLOAT[768,3072] 06f12e367cca
val_35 FLOAT[3072,768] afa44c4facfc
val_36 FLOAT[768,2304] 5a429d3c2639
val_37 FLOAT[768,3072] 97634eea06b6
val_38 FLOAT[3072,768] 7f95424ad8e1
val_4 FLOAT[768,3072] 59a26a67d437
val_5 FLOAT[3072,768] 7aa8e84e3fab
val_6 FLOAT[768,2304] fcc04993289c
val_7 FLOAT[768,3072] d4212d9539ab
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[3072,768] c4d5f2f271ca
val_9 FLOAT[768,2304] cd0d50df0edd
+950
View File
@@ -0,0 +1,950 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,384,384,3] image) => (float[batch,768] image_embedding)
<
float[batch,768,48,48] add_1072
float[batch,768,48,48] add_1148
float[batch,1536,24,24] add_1244
float[batch,1536,24,24] add_1320
float[batch,1536,24,24] add_1396
float[batch,384,96,96] add_140
float[batch,1536,24,24] add_1472
float[batch,1536,24,24] add_1548
float[batch,1536,24,24] add_1624
float[batch,1536,24,24] add_1700
float[batch,1536,24,24] add_1776
float[batch,1536,24,24] add_1852
float[batch,1536,24,24] add_1928
float[batch,1536,24,24] add_2004
float[batch,1536,24,24] add_2080
float[batch,1536,24,24] add_2156
float[batch,384,96,96] add_216
float[batch,1536,24,24] add_2232
float[batch,1536,24,24] add_2308
float[batch,1536,24,24] add_2384
float[batch,1536,24,24] add_2460
float[batch,1536,24,24] add_2536
float[batch,3072,12,12] add_2632
float[batch,3072,12,12] add_2708
float[batch,3072,12,12] add_2784
float[batch,3072,12,12] add_2860
float[batch,384,96,96] add_292
float[batch,3072,12,12] add_2936
float[batch,3072,12,12] add_3012
float[batch,3072,12,12] add_3088
float[batch,3072,12,12] add_3164
float[145,batch,3072] add_3194
float[batch,384,96,96] add_368
float[batch,384,96,96] add_444
float[batch,384,96,96] add_520
float[batch,768,48,48] add_616
float[batch,768,48,48] add_692
float[batch,768,48,48] add_768
float[batch,768,48,48] add_844
float[batch,768,48,48] add_920
float[batch,768,48,48] add_996
float[batch,96,96,96] avg_pool2d
float[batch,192,48,48] avg_pool2d_2
float[batch,384,48,48] avg_pool2d_3
float[batch,384,24,24] avg_pool2d_4
float[batch,768,24,24] avg_pool2d_5
float[batch,768,12,12] avg_pool2d_6
float[batch,1536,12,12] avg_pool2d_7
float[145,batch,3072] cat
float[batch,1] clamp_min
float[batch,48,192,192] getitem
float[batch,768,48,48] getitem_102
float[batch,192,48,48] getitem_105
float[batch,192,48,48] getitem_108
float[batch,768,48,48] getitem_111
float[batch,192,48,48] getitem_114
float[batch,192,48,48] getitem_117
float[batch,96,96,96] getitem_12
float[batch,768,48,48] getitem_120
float[batch,192,48,48] getitem_123
float[batch,192,48,48] getitem_126
float[batch,768,48,48] getitem_129
float[batch,192,48,48] getitem_132
float[batch,192,48,48] getitem_135
float[batch,768,48,48] getitem_138
float[batch,384,48,48] getitem_141
float[batch,384,48,48] getitem_144
float[batch,1536,24,24] getitem_147
float[batch,384,96,96] getitem_15
float[batch,1536,24,24] getitem_150
float[batch,384,24,24] getitem_153
float[batch,384,24,24] getitem_156
float[batch,1536,24,24] getitem_159
float[batch,384,24,24] getitem_162
float[batch,384,24,24] getitem_165
float[batch,1536,24,24] getitem_168
float[batch,384,24,24] getitem_171
float[batch,384,24,24] getitem_174
float[batch,1536,24,24] getitem_177
float[batch,384,96,96] getitem_18
float[batch,384,24,24] getitem_180
float[batch,384,24,24] getitem_183
float[batch,1536,24,24] getitem_186
float[batch,384,24,24] getitem_189
float[batch,384,24,24] getitem_192
float[batch,1536,24,24] getitem_195
float[batch,384,24,24] getitem_198
float[batch,384,24,24] getitem_201
float[batch,1536,24,24] getitem_204
float[batch,384,24,24] getitem_207
float[batch,96,96,96] getitem_21
float[batch,384,24,24] getitem_210
float[batch,1536,24,24] getitem_213
float[batch,384,24,24] getitem_216
float[batch,384,24,24] getitem_219
float[batch,1536,24,24] getitem_222
float[batch,384,24,24] getitem_225
float[batch,384,24,24] getitem_228
float[batch,1536,24,24] getitem_231
float[batch,384,24,24] getitem_234
float[batch,384,24,24] getitem_237
float[batch,96,96,96] getitem_24
float[batch,1536,24,24] getitem_240
float[batch,384,24,24] getitem_243
float[batch,384,24,24] getitem_246
float[batch,1536,24,24] getitem_249
float[batch,384,24,24] getitem_252
float[batch,384,24,24] getitem_255
float[batch,1536,24,24] getitem_258
float[batch,384,24,24] getitem_261
float[batch,384,24,24] getitem_264
float[batch,1536,24,24] getitem_267
float[batch,384,96,96] getitem_27
float[batch,384,24,24] getitem_270
float[batch,384,24,24] getitem_273
float[batch,1536,24,24] getitem_276
float[batch,384,24,24] getitem_279
float[batch,384,24,24] getitem_282
float[batch,1536,24,24] getitem_285
float[batch,384,24,24] getitem_288
float[batch,384,24,24] getitem_291
float[batch,1536,24,24] getitem_294
float[batch,384,24,24] getitem_297
float[batch,48,192,192] getitem_3
float[batch,96,96,96] getitem_30
float[batch,384,24,24] getitem_300
float[batch,1536,24,24] getitem_303
float[batch,768,24,24] getitem_306
float[batch,768,24,24] getitem_309
float[batch,3072,12,12] getitem_312
float[batch,3072,12,12] getitem_315
float[batch,768,12,12] getitem_318
float[batch,768,12,12] getitem_321
float[batch,3072,12,12] getitem_324
float[batch,768,12,12] getitem_327
float[batch,96,96,96] getitem_33
float[batch,768,12,12] getitem_330
float[batch,3072,12,12] getitem_333
float[batch,768,12,12] getitem_336
float[batch,768,12,12] getitem_339
float[batch,3072,12,12] getitem_342
float[batch,768,12,12] getitem_345
float[batch,768,12,12] getitem_348
float[batch,3072,12,12] getitem_351
float[batch,768,12,12] getitem_354
float[batch,768,12,12] getitem_357
float[batch,384,96,96] getitem_36
float[batch,3072,12,12] getitem_360
float[batch,768,12,12] getitem_363
float[batch,768,12,12] getitem_366
float[batch,3072,12,12] getitem_369
float[batch,768,12,12] getitem_372
float[batch,768,12,12] getitem_375
float[batch,3072,12,12] getitem_378
float[batch,96,96,96] getitem_39
float[batch,96,96,96] getitem_42
float[batch,384,96,96] getitem_45
float[batch,96,96,96] getitem_48
float[batch,96,96,96] getitem_51
float[batch,384,96,96] getitem_54
float[batch,96,96,96] getitem_57
float[batch,96,192,192] getitem_6
float[batch,96,96,96] getitem_60
float[batch,384,96,96] getitem_63
float[batch,192,96,96] getitem_66
float[batch,192,96,96] getitem_69
float[batch,768,48,48] getitem_72
float[batch,768,48,48] getitem_75
float[batch,192,48,48] getitem_78
float[batch,192,48,48] getitem_81
float[batch,768,48,48] getitem_84
float[batch,192,48,48] getitem_87
float[batch,96,96,96] getitem_9
float[batch,192,48,48] getitem_90
float[batch,768,48,48] getitem_93
float[batch,192,48,48] getitem_96
float[batch,192,48,48] getitem_99
float[batch,3,384,384] image_chw
float[batch,384,384,3] image_f32
float[batch,384,384,3] image_shifted
float[batch,1] linalg_vector_norm
float[1,batch,3072] linear
float[145,batch,3072] linear_1
float[145,batch,3072] linear_2
float[batch,768] linear_3
float[1,batch,3072] mean
float[1,batch,3072] node_scaled_dot_product_attention_q_row
float[144,batch,3072] permute_1
float[1,batch,48,64] permute_2
float[batch,48,192,192] relu
float[batch,48,192,192] relu_1
float[batch,96,96,96] relu_10
float[batch,768,24,24] relu_100
float[batch,3072,12,12] relu_101
float[batch,768,12,12] relu_102
float[batch,768,12,12] relu_103
float[batch,3072,12,12] relu_104
float[batch,768,12,12] relu_105
float[batch,768,12,12] relu_106
float[batch,3072,12,12] relu_107
float[batch,768,12,12] relu_108
float[batch,768,12,12] relu_109
float[batch,384,96,96] relu_11
float[batch,3072,12,12] relu_110
float[batch,768,12,12] relu_111
float[batch,768,12,12] relu_112
float[batch,3072,12,12] relu_113
float[batch,768,12,12] relu_114
float[batch,768,12,12] relu_115
float[batch,3072,12,12] relu_116
float[batch,768,12,12] relu_117
float[batch,768,12,12] relu_118
float[batch,3072,12,12] relu_119
float[batch,96,96,96] relu_12
float[batch,768,12,12] relu_120
float[batch,768,12,12] relu_121
float[batch,3072,12,12] relu_122
float[batch,96,96,96] relu_13
float[batch,384,96,96] relu_14
float[batch,96,96,96] relu_15
float[batch,96,96,96] relu_16
float[batch,384,96,96] relu_17
float[batch,96,96,96] relu_18
float[batch,96,96,96] relu_19
float[batch,96,192,192] relu_2
float[batch,384,96,96] relu_20
float[batch,192,96,96] relu_21
float[batch,192,96,96] relu_22
float[batch,768,48,48] relu_23
float[batch,192,48,48] relu_24
float[batch,192,48,48] relu_25
float[batch,768,48,48] relu_26
float[batch,192,48,48] relu_27
float[batch,192,48,48] relu_28
float[batch,768,48,48] relu_29
float[batch,96,96,96] relu_3
float[batch,192,48,48] relu_30
float[batch,192,48,48] relu_31
float[batch,768,48,48] relu_32
float[batch,192,48,48] relu_33
float[batch,192,48,48] relu_34
float[batch,768,48,48] relu_35
float[batch,192,48,48] relu_36
float[batch,192,48,48] relu_37
float[batch,768,48,48] relu_38
float[batch,192,48,48] relu_39
float[batch,96,96,96] relu_4
float[batch,192,48,48] relu_40
float[batch,768,48,48] relu_41
float[batch,192,48,48] relu_42
float[batch,192,48,48] relu_43
float[batch,768,48,48] relu_44
float[batch,384,48,48] relu_45
float[batch,384,48,48] relu_46
float[batch,1536,24,24] relu_47
float[batch,384,24,24] relu_48
float[batch,384,24,24] relu_49
float[batch,384,96,96] relu_5
float[batch,1536,24,24] relu_50
float[batch,384,24,24] relu_51
float[batch,384,24,24] relu_52
float[batch,1536,24,24] relu_53
float[batch,384,24,24] relu_54
float[batch,384,24,24] relu_55
float[batch,1536,24,24] relu_56
float[batch,384,24,24] relu_57
float[batch,384,24,24] relu_58
float[batch,1536,24,24] relu_59
float[batch,96,96,96] relu_6
float[batch,384,24,24] relu_60
float[batch,384,24,24] relu_61
float[batch,1536,24,24] relu_62
float[batch,384,24,24] relu_63
float[batch,384,24,24] relu_64
float[batch,1536,24,24] relu_65
float[batch,384,24,24] relu_66
float[batch,384,24,24] relu_67
float[batch,1536,24,24] relu_68
float[batch,384,24,24] relu_69
float[batch,96,96,96] relu_7
float[batch,384,24,24] relu_70
float[batch,1536,24,24] relu_71
float[batch,384,24,24] relu_72
float[batch,384,24,24] relu_73
float[batch,1536,24,24] relu_74
float[batch,384,24,24] relu_75
float[batch,384,24,24] relu_76
float[batch,1536,24,24] relu_77
float[batch,384,24,24] relu_78
float[batch,384,24,24] relu_79
float[batch,384,96,96] relu_8
float[batch,1536,24,24] relu_80
float[batch,384,24,24] relu_81
float[batch,384,24,24] relu_82
float[batch,1536,24,24] relu_83
float[batch,384,24,24] relu_84
float[batch,384,24,24] relu_85
float[batch,1536,24,24] relu_86
float[batch,384,24,24] relu_87
float[batch,384,24,24] relu_88
float[batch,1536,24,24] relu_89
float[batch,96,96,96] relu_9
float[batch,384,24,24] relu_90
float[batch,384,24,24] relu_91
float[batch,1536,24,24] relu_92
float[batch,384,24,24] relu_93
float[batch,384,24,24] relu_94
float[batch,1536,24,24] relu_95
float[batch,384,24,24] relu_96
float[batch,384,24,24] relu_97
float[batch,1536,24,24] relu_98
float[batch,768,24,24] relu_99
float[batch,48,1,64] scaled_dot_product_attention
float[batch,768] select
float[3072] split_split_0
float[3072] split_split_1
float[3072] split_split_2
float[unk__1,1,64] transpose
float[unk__1,145,64] transpose_1
float[unk__1,145,64] transpose_2
float[145,1,3072] unsqueeze
float[1,batch,3072] val_7
float[145,batch,3072] val_8
float[145,batch,3072] val_9
float[1,batch,768] view_10
float[batch,3072,144] view_2
float[1,unk__1,64] view_3
float[145,unk__1,64] view_4
float[145,unk__1,64] view_5
float[batch,48,1,64] view_6
float[batch,48,145,64] view_7
float[batch,48,145,64] view_8
float[batch,3072] view_9
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_shift] image_shifted = Sub (image_f32, image_shift)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
[node_relu] relu = Relu (getitem)
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
relu_1 = Relu (getitem_3)
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
relu_2 = Relu (getitem_6)
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
relu_3 = Relu (getitem_9)
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
relu_4 = Relu (getitem_12)
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
add_140 = Add (getitem_15, getitem_18)
relu_5 = Relu (add_140)
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
relu_6 = Relu (getitem_21)
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
relu_7 = Relu (getitem_24)
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
add_216 = Add (getitem_27, relu_5)
relu_8 = Relu (add_216)
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
relu_9 = Relu (getitem_30)
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
relu_10 = Relu (getitem_33)
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
add_292 = Add (getitem_36, relu_8)
relu_11 = Relu (add_292)
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer1.3.conv1.weight", "visual.layer1.3.conv1.weight_bias")
relu_12 = Relu (getitem_39)
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer1.3.conv2.weight", "visual.layer1.3.conv2.weight_bias")
relu_13 = Relu (getitem_42)
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_13, "visual.layer1.3.conv3.weight", "visual.layer1.3.conv3.weight_bias")
add_368 = Add (getitem_45, relu_11)
relu_14 = Relu (add_368)
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer1.4.conv1.weight", "visual.layer1.4.conv1.weight_bias")
relu_15 = Relu (getitem_48)
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer1.4.conv2.weight", "visual.layer1.4.conv2.weight_bias")
relu_16 = Relu (getitem_51)
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_16, "visual.layer1.4.conv3.weight", "visual.layer1.4.conv3.weight_bias")
add_444 = Add (getitem_54, relu_14)
relu_17 = Relu (add_444)
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer1.5.conv1.weight", "visual.layer1.5.conv1.weight_bias")
relu_18 = Relu (getitem_57)
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer1.5.conv2.weight", "visual.layer1.5.conv2.weight_bias")
relu_19 = Relu (getitem_60)
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer1.5.conv3.weight", "visual.layer1.5.conv3.weight_bias")
add_520 = Add (getitem_63, relu_17)
relu_20 = Relu (add_520)
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
relu_21 = Relu (getitem_66)
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
relu_22 = Relu (getitem_69)
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_22)
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_20)
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
add_616 = Add (getitem_72, getitem_75)
relu_23 = Relu (add_616)
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
relu_24 = Relu (getitem_78)
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
relu_25 = Relu (getitem_81)
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_25, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
add_692 = Add (getitem_84, relu_23)
relu_26 = Relu (add_692)
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
relu_27 = Relu (getitem_87)
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
relu_28 = Relu (getitem_90)
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
add_768 = Add (getitem_93, relu_26)
relu_29 = Relu (add_768)
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
relu_30 = Relu (getitem_96)
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
relu_31 = Relu (getitem_99)
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
add_844 = Add (getitem_102, relu_29)
relu_32 = Relu (add_844)
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer2.4.conv1.weight", "visual.layer2.4.conv1.weight_bias")
relu_33 = Relu (getitem_105)
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer2.4.conv2.weight", "visual.layer2.4.conv2.weight_bias")
relu_34 = Relu (getitem_108)
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_34, "visual.layer2.4.conv3.weight", "visual.layer2.4.conv3.weight_bias")
add_920 = Add (getitem_111, relu_32)
relu_35 = Relu (add_920)
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer2.5.conv1.weight", "visual.layer2.5.conv1.weight_bias")
relu_36 = Relu (getitem_114)
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer2.5.conv2.weight", "visual.layer2.5.conv2.weight_bias")
relu_37 = Relu (getitem_117)
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer2.5.conv3.weight", "visual.layer2.5.conv3.weight_bias")
add_996 = Add (getitem_120, relu_35)
relu_38 = Relu (add_996)
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer2.6.conv1.weight", "visual.layer2.6.conv1.weight_bias")
relu_39 = Relu (getitem_123)
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer2.6.conv2.weight", "visual.layer2.6.conv2.weight_bias")
relu_40 = Relu (getitem_126)
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer2.6.conv3.weight", "visual.layer2.6.conv3.weight_bias")
add_1072 = Add (getitem_129, relu_38)
relu_41 = Relu (add_1072)
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer2.7.conv1.weight", "visual.layer2.7.conv1.weight_bias")
relu_42 = Relu (getitem_132)
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer2.7.conv2.weight", "visual.layer2.7.conv2.weight_bias")
relu_43 = Relu (getitem_135)
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_43, "visual.layer2.7.conv3.weight", "visual.layer2.7.conv3.weight_bias")
add_1148 = Add (getitem_138, relu_41)
relu_44 = Relu (add_1148)
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
relu_45 = Relu (getitem_141)
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
relu_46 = Relu (getitem_144)
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_46)
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_44)
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
add_1244 = Add (getitem_147, getitem_150)
relu_47 = Relu (add_1244)
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
relu_48 = Relu (getitem_153)
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
relu_49 = Relu (getitem_156)
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
add_1320 = Add (getitem_159, relu_47)
relu_50 = Relu (add_1320)
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_50, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
relu_51 = Relu (getitem_162)
getitem_165 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_51, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
relu_52 = Relu (getitem_165)
getitem_168 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_52, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
add_1396 = Add (getitem_168, relu_50)
relu_53 = Relu (add_1396)
getitem_171 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_53, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
relu_54 = Relu (getitem_171)
getitem_174 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_54, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
relu_55 = Relu (getitem_174)
getitem_177 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_55, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
add_1472 = Add (getitem_177, relu_53)
relu_56 = Relu (add_1472)
getitem_180 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_56, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
relu_57 = Relu (getitem_180)
getitem_183 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_57, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
relu_58 = Relu (getitem_183)
getitem_186 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_58, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
add_1548 = Add (getitem_186, relu_56)
relu_59 = Relu (add_1548)
getitem_189 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_59, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
relu_60 = Relu (getitem_189)
getitem_192 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_60, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
relu_61 = Relu (getitem_192)
getitem_195 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_61, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
add_1624 = Add (getitem_195, relu_59)
relu_62 = Relu (add_1624)
getitem_198 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_62, "visual.layer3.6.conv1.weight", "visual.layer3.6.conv1.weight_bias")
relu_63 = Relu (getitem_198)
getitem_201 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_63, "visual.layer3.6.conv2.weight", "visual.layer3.6.conv2.weight_bias")
relu_64 = Relu (getitem_201)
getitem_204 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_64, "visual.layer3.6.conv3.weight", "visual.layer3.6.conv3.weight_bias")
add_1700 = Add (getitem_204, relu_62)
relu_65 = Relu (add_1700)
getitem_207 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_65, "visual.layer3.7.conv1.weight", "visual.layer3.7.conv1.weight_bias")
relu_66 = Relu (getitem_207)
getitem_210 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_66, "visual.layer3.7.conv2.weight", "visual.layer3.7.conv2.weight_bias")
relu_67 = Relu (getitem_210)
getitem_213 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_67, "visual.layer3.7.conv3.weight", "visual.layer3.7.conv3.weight_bias")
add_1776 = Add (getitem_213, relu_65)
relu_68 = Relu (add_1776)
getitem_216 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_68, "visual.layer3.8.conv1.weight", "visual.layer3.8.conv1.weight_bias")
relu_69 = Relu (getitem_216)
getitem_219 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_69, "visual.layer3.8.conv2.weight", "visual.layer3.8.conv2.weight_bias")
relu_70 = Relu (getitem_219)
getitem_222 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_70, "visual.layer3.8.conv3.weight", "visual.layer3.8.conv3.weight_bias")
add_1852 = Add (getitem_222, relu_68)
relu_71 = Relu (add_1852)
getitem_225 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_71, "visual.layer3.9.conv1.weight", "visual.layer3.9.conv1.weight_bias")
relu_72 = Relu (getitem_225)
getitem_228 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_72, "visual.layer3.9.conv2.weight", "visual.layer3.9.conv2.weight_bias")
relu_73 = Relu (getitem_228)
getitem_231 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_73, "visual.layer3.9.conv3.weight", "visual.layer3.9.conv3.weight_bias")
add_1928 = Add (getitem_231, relu_71)
relu_74 = Relu (add_1928)
getitem_234 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_74, "visual.layer3.10.conv1.weight", "visual.layer3.10.conv1.weight_bias")
relu_75 = Relu (getitem_234)
getitem_237 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_75, "visual.layer3.10.conv2.weight", "visual.layer3.10.conv2.weight_bias")
relu_76 = Relu (getitem_237)
getitem_240 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_76, "visual.layer3.10.conv3.weight", "visual.layer3.10.conv3.weight_bias")
add_2004 = Add (getitem_240, relu_74)
relu_77 = Relu (add_2004)
getitem_243 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_77, "visual.layer3.11.conv1.weight", "visual.layer3.11.conv1.weight_bias")
relu_78 = Relu (getitem_243)
getitem_246 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_78, "visual.layer3.11.conv2.weight", "visual.layer3.11.conv2.weight_bias")
relu_79 = Relu (getitem_246)
getitem_249 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_79, "visual.layer3.11.conv3.weight", "visual.layer3.11.conv3.weight_bias")
add_2080 = Add (getitem_249, relu_77)
relu_80 = Relu (add_2080)
getitem_252 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_80, "visual.layer3.12.conv1.weight", "visual.layer3.12.conv1.weight_bias")
relu_81 = Relu (getitem_252)
getitem_255 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_81, "visual.layer3.12.conv2.weight", "visual.layer3.12.conv2.weight_bias")
relu_82 = Relu (getitem_255)
getitem_258 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_82, "visual.layer3.12.conv3.weight", "visual.layer3.12.conv3.weight_bias")
add_2156 = Add (getitem_258, relu_80)
relu_83 = Relu (add_2156)
getitem_261 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_83, "visual.layer3.13.conv1.weight", "visual.layer3.13.conv1.weight_bias")
relu_84 = Relu (getitem_261)
getitem_264 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_84, "visual.layer3.13.conv2.weight", "visual.layer3.13.conv2.weight_bias")
relu_85 = Relu (getitem_264)
getitem_267 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_85, "visual.layer3.13.conv3.weight", "visual.layer3.13.conv3.weight_bias")
add_2232 = Add (getitem_267, relu_83)
relu_86 = Relu (add_2232)
getitem_270 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_86, "visual.layer3.14.conv1.weight", "visual.layer3.14.conv1.weight_bias")
relu_87 = Relu (getitem_270)
getitem_273 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_87, "visual.layer3.14.conv2.weight", "visual.layer3.14.conv2.weight_bias")
relu_88 = Relu (getitem_273)
getitem_276 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_88, "visual.layer3.14.conv3.weight", "visual.layer3.14.conv3.weight_bias")
add_2308 = Add (getitem_276, relu_86)
relu_89 = Relu (add_2308)
getitem_279 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_89, "visual.layer3.15.conv1.weight", "visual.layer3.15.conv1.weight_bias")
relu_90 = Relu (getitem_279)
getitem_282 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_90, "visual.layer3.15.conv2.weight", "visual.layer3.15.conv2.weight_bias")
relu_91 = Relu (getitem_282)
getitem_285 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_91, "visual.layer3.15.conv3.weight", "visual.layer3.15.conv3.weight_bias")
add_2384 = Add (getitem_285, relu_89)
relu_92 = Relu (add_2384)
getitem_288 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_92, "visual.layer3.16.conv1.weight", "visual.layer3.16.conv1.weight_bias")
relu_93 = Relu (getitem_288)
getitem_291 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_93, "visual.layer3.16.conv2.weight", "visual.layer3.16.conv2.weight_bias")
relu_94 = Relu (getitem_291)
getitem_294 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_94, "visual.layer3.16.conv3.weight", "visual.layer3.16.conv3.weight_bias")
add_2460 = Add (getitem_294, relu_92)
relu_95 = Relu (add_2460)
getitem_297 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_95, "visual.layer3.17.conv1.weight", "visual.layer3.17.conv1.weight_bias")
relu_96 = Relu (getitem_297)
getitem_300 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_96, "visual.layer3.17.conv2.weight", "visual.layer3.17.conv2.weight_bias")
relu_97 = Relu (getitem_300)
getitem_303 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_97, "visual.layer3.17.conv3.weight", "visual.layer3.17.conv3.weight_bias")
add_2536 = Add (getitem_303, relu_95)
relu_98 = Relu (add_2536)
getitem_306 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_98, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
relu_99 = Relu (getitem_306)
getitem_309 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_99, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
relu_100 = Relu (getitem_309)
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_100)
getitem_312 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_98)
getitem_315 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
add_2632 = Add (getitem_312, getitem_315)
relu_101 = Relu (add_2632)
getitem_318 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_101, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
relu_102 = Relu (getitem_318)
getitem_321 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_102, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
relu_103 = Relu (getitem_321)
getitem_324 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_103, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
add_2708 = Add (getitem_324, relu_101)
relu_104 = Relu (add_2708)
getitem_327 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_104, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
relu_105 = Relu (getitem_327)
getitem_330 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_105, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
relu_106 = Relu (getitem_330)
getitem_333 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_106, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
add_2784 = Add (getitem_333, relu_104)
relu_107 = Relu (add_2784)
getitem_336 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_107, "visual.layer4.3.conv1.weight", "visual.layer4.3.conv1.weight_bias")
relu_108 = Relu (getitem_336)
getitem_339 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_108, "visual.layer4.3.conv2.weight", "visual.layer4.3.conv2.weight_bias")
relu_109 = Relu (getitem_339)
getitem_342 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_109, "visual.layer4.3.conv3.weight", "visual.layer4.3.conv3.weight_bias")
add_2860 = Add (getitem_342, relu_107)
relu_110 = Relu (add_2860)
getitem_345 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_110, "visual.layer4.4.conv1.weight", "visual.layer4.4.conv1.weight_bias")
relu_111 = Relu (getitem_345)
getitem_348 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_111, "visual.layer4.4.conv2.weight", "visual.layer4.4.conv2.weight_bias")
relu_112 = Relu (getitem_348)
getitem_351 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_112, "visual.layer4.4.conv3.weight", "visual.layer4.4.conv3.weight_bias")
add_2936 = Add (getitem_351, relu_110)
relu_113 = Relu (add_2936)
getitem_354 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_113, "visual.layer4.5.conv1.weight", "visual.layer4.5.conv1.weight_bias")
relu_114 = Relu (getitem_354)
getitem_357 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_114, "visual.layer4.5.conv2.weight", "visual.layer4.5.conv2.weight_bias")
relu_115 = Relu (getitem_357)
getitem_360 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_115, "visual.layer4.5.conv3.weight", "visual.layer4.5.conv3.weight_bias")
add_3012 = Add (getitem_360, relu_113)
relu_116 = Relu (add_3012)
getitem_363 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_116, "visual.layer4.6.conv1.weight", "visual.layer4.6.conv1.weight_bias")
relu_117 = Relu (getitem_363)
getitem_366 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_117, "visual.layer4.6.conv2.weight", "visual.layer4.6.conv2.weight_bias")
relu_118 = Relu (getitem_366)
getitem_369 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_118, "visual.layer4.6.conv3.weight", "visual.layer4.6.conv3.weight_bias")
add_3088 = Add (getitem_369, relu_116)
relu_119 = Relu (add_3088)
getitem_372 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_119, "visual.layer4.7.conv1.weight", "visual.layer4.7.conv1.weight_bias")
relu_120 = Relu (getitem_372)
getitem_375 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_120, "visual.layer4.7.conv2.weight", "visual.layer4.7.conv2.weight_bias")
relu_121 = Relu (getitem_375)
getitem_378 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_121, "visual.layer4.7.conv3.weight", "visual.layer4.7.conv3.weight_bias")
add_3164 = Add (getitem_378, relu_119)
relu_122 = Relu (add_3164)
view_2 = Reshape <allowzero: int = 1> (relu_122, view_2_target)
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
add_3194 = Add (cat, unsqueeze)
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
node_scaled_dot_product_attention_q_row = Slice (add_3194, val_0, val_3, val_0)
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
[node_linear] linear = Add (val_7, split_split_0)
val_8 = MatMul (add_3194, val_5)
linear_1 = Add (val_8, split_split_1)
val_9 = MatMul (add_3194, val_6)
linear_2 = Add (val_9, split_split_2)
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
select = Squeeze (view_10, val_0)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
cat_1 FLOAT[9216] 5f298c3e502a
image_shift FLOAT[3] 2f7a50e604ad
node_scaled_dot_product_attention_out_1 INT64[3] fa8d086288f9
node_scaled_dot_product_attention_q_pack_1 INT64[4] 2564bf8beb9e
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
val_0 INT64[1] af5570f5a181
val_1 INT64[1] 12a3ae445661
val_2 FLOAT[] 6708d9be4956
val_3 INT64[1] 7c9fa136d441
val_4 FLOAT[3072,3072] e41d511859c1
val_5 FLOAT[3072,3072] f5d2fce4950e
val_6 FLOAT[3072,3072] dd21d99158e4
view_2_target INT64[3] 78f76ad494cc
view_4_target INT64[3] fb31726bf5aa
view_7_target INT64[4] cb83b36b0f4b
view_9_target INT64[2] 7a66e878ce45
visual.attnpool.c_proj.bias FLOAT[768] 11751e48178a
visual.attnpool.c_proj.weight FLOAT[768,3072] e84b5146e971
visual.attnpool.positional_embedding FLOAT[145,3072] 391340b02a4c
visual.conv1.weight FLOAT[48,3,3,3] 94baac763782
visual.conv1.weight_bias FLOAT[48] f16e2f8ab2b9
visual.conv2.weight FLOAT[48,48,3,3] 7b12a6a125bf
visual.conv2.weight_bias FLOAT[48] 7603d13d1e7d
visual.conv3.weight FLOAT[96,48,3,3] eb5f6ccb217c
visual.conv3.weight_bias FLOAT[96] fa9e4ae719cd
visual.layer1.0.conv1.weight FLOAT[96,96,1,1] 5c51f34176d3
visual.layer1.0.conv1.weight_bias FLOAT[96] ef07c9705365
visual.layer1.0.conv2.weight FLOAT[96,96,3,3] e217e4607643
visual.layer1.0.conv2.weight_bias FLOAT[96] 929988a1764a
visual.layer1.0.conv3.weight FLOAT[384,96,1,1] f548690c165e
visual.layer1.0.conv3.weight_bias FLOAT[384] c43fa7cd692d
visual.layer1.0.downsample.0.weight FLOAT[384,96,1,1] c27abd7f140a
visual.layer1.0.downsample.0.weight_bias FLOAT[384] 2e60f8fd53ec
visual.layer1.1.conv1.weight FLOAT[96,384,1,1] f2faf43f174e
visual.layer1.1.conv1.weight_bias FLOAT[96] 42e8cbdef849
visual.layer1.1.conv2.weight FLOAT[96,96,3,3] 45a2ac5680af
visual.layer1.1.conv2.weight_bias FLOAT[96] 3fa6c2e74a63
visual.layer1.1.conv3.weight FLOAT[384,96,1,1] 90977330f018
visual.layer1.1.conv3.weight_bias FLOAT[384] 33c6ab7fa125
visual.layer1.2.conv1.weight FLOAT[96,384,1,1] b236d91bc6ec
visual.layer1.2.conv1.weight_bias FLOAT[96] 79d91f16952f
visual.layer1.2.conv2.weight FLOAT[96,96,3,3] 63dfac313c4d
visual.layer1.2.conv2.weight_bias FLOAT[96] 764914249890
visual.layer1.2.conv3.weight FLOAT[384,96,1,1] 0467713e7ff9
visual.layer1.2.conv3.weight_bias FLOAT[384] 27f3acd3c15c
visual.layer1.3.conv1.weight FLOAT[96,384,1,1] db0b6e3e7edc
visual.layer1.3.conv1.weight_bias FLOAT[96] bc5354f9a1ed
visual.layer1.3.conv2.weight FLOAT[96,96,3,3] a853e59b9dd9
visual.layer1.3.conv2.weight_bias FLOAT[96] 6c27e3a329fe
visual.layer1.3.conv3.weight FLOAT[384,96,1,1] b6823e3f9fc8
visual.layer1.3.conv3.weight_bias FLOAT[384] 896457ceca49
visual.layer1.4.conv1.weight FLOAT[96,384,1,1] 3462530111cd
visual.layer1.4.conv1.weight_bias FLOAT[96] f7343658a869
visual.layer1.4.conv2.weight FLOAT[96,96,3,3] 7fb27742743b
visual.layer1.4.conv2.weight_bias FLOAT[96] 34404d5cc103
visual.layer1.4.conv3.weight FLOAT[384,96,1,1] ba4fae0e290e
visual.layer1.4.conv3.weight_bias FLOAT[384] a7b62859c32c
visual.layer1.5.conv1.weight FLOAT[96,384,1,1] 08ff71a767b8
visual.layer1.5.conv1.weight_bias FLOAT[96] 5cbe11322b0d
visual.layer1.5.conv2.weight FLOAT[96,96,3,3] 69987159265a
visual.layer1.5.conv2.weight_bias FLOAT[96] 05bcc6914bb8
visual.layer1.5.conv3.weight FLOAT[384,96,1,1] dc2d1c91c8ba
visual.layer1.5.conv3.weight_bias FLOAT[384] 56245f32f25e
visual.layer2.0.conv1.weight FLOAT[192,384,1,1] a510be647379
visual.layer2.0.conv1.weight_bias FLOAT[192] 009180dd7ee3
visual.layer2.0.conv2.weight FLOAT[192,192,3,3] 5911a3abc49a
visual.layer2.0.conv2.weight_bias FLOAT[192] 2cd5e8fbdae8
visual.layer2.0.conv3.weight FLOAT[768,192,1,1] ba61994eb098
visual.layer2.0.conv3.weight_bias FLOAT[768] f44059758d13
visual.layer2.0.downsample.0.weight FLOAT[768,384,1,1] 213de7d55207
visual.layer2.0.downsample.0.weight_bias FLOAT[768] 4df5cf325874
visual.layer2.1.conv1.weight FLOAT[192,768,1,1] 22ca5be53c1b
visual.layer2.1.conv1.weight_bias FLOAT[192] 2de713331def
visual.layer2.1.conv2.weight FLOAT[192,192,3,3] ae6353cb8963
visual.layer2.1.conv2.weight_bias FLOAT[192] b592f047261a
visual.layer2.1.conv3.weight FLOAT[768,192,1,1] 5d0a468b6620
visual.layer2.1.conv3.weight_bias FLOAT[768] bece70d27add
visual.layer2.2.conv1.weight FLOAT[192,768,1,1] 8ec57c67fdc4
visual.layer2.2.conv1.weight_bias FLOAT[192] bad771e598fd
visual.layer2.2.conv2.weight FLOAT[192,192,3,3] 862a9a1b4c8a
visual.layer2.2.conv2.weight_bias FLOAT[192] d2f871f39da6
visual.layer2.2.conv3.weight FLOAT[768,192,1,1] dc327b8983f9
visual.layer2.2.conv3.weight_bias FLOAT[768] 7d89ad3d7b12
visual.layer2.3.conv1.weight FLOAT[192,768,1,1] c01b158a566d
visual.layer2.3.conv1.weight_bias FLOAT[192] fa008f02e930
visual.layer2.3.conv2.weight FLOAT[192,192,3,3] b74a749292fa
visual.layer2.3.conv2.weight_bias FLOAT[192] 33d7a61fd2c5
visual.layer2.3.conv3.weight FLOAT[768,192,1,1] e6318f561497
visual.layer2.3.conv3.weight_bias FLOAT[768] 0be1e9fbcc17
visual.layer2.4.conv1.weight FLOAT[192,768,1,1] 31ebfeb6f2ec
visual.layer2.4.conv1.weight_bias FLOAT[192] e1c11c285387
visual.layer2.4.conv2.weight FLOAT[192,192,3,3] 6f9216ef7d7e
visual.layer2.4.conv2.weight_bias FLOAT[192] c75b0ecc3b62
visual.layer2.4.conv3.weight FLOAT[768,192,1,1] 6aaf2c9fa64e
visual.layer2.4.conv3.weight_bias FLOAT[768] 6cf00a2f5f23
visual.layer2.5.conv1.weight FLOAT[192,768,1,1] 1fb9f4d2fe94
visual.layer2.5.conv1.weight_bias FLOAT[192] a621e08512dd
visual.layer2.5.conv2.weight FLOAT[192,192,3,3] bde3e0b4ea83
visual.layer2.5.conv2.weight_bias FLOAT[192] 7905f91d9907
visual.layer2.5.conv3.weight FLOAT[768,192,1,1] d9771e37956a
visual.layer2.5.conv3.weight_bias FLOAT[768] bdbe0eba8714
visual.layer2.6.conv1.weight FLOAT[192,768,1,1] fcd41b467588
visual.layer2.6.conv1.weight_bias FLOAT[192] 86fd3640d3cb
visual.layer2.6.conv2.weight FLOAT[192,192,3,3] 79c3beee8fb2
visual.layer2.6.conv2.weight_bias FLOAT[192] b603fd76eb0b
visual.layer2.6.conv3.weight FLOAT[768,192,1,1] 83577e4084e3
visual.layer2.6.conv3.weight_bias FLOAT[768] c9a84d8eff5f
visual.layer2.7.conv1.weight FLOAT[192,768,1,1] a967445e4898
visual.layer2.7.conv1.weight_bias FLOAT[192] 89712714a40a
visual.layer2.7.conv2.weight FLOAT[192,192,3,3] 162011389981
visual.layer2.7.conv2.weight_bias FLOAT[192] cb8ac0f4008e
visual.layer2.7.conv3.weight FLOAT[768,192,1,1] d239c56f2194
visual.layer2.7.conv3.weight_bias FLOAT[768] 1ed2926ada17
visual.layer3.0.conv1.weight FLOAT[384,768,1,1] efbdc65e8341
visual.layer3.0.conv1.weight_bias FLOAT[384] 3d7a7d2f144e
visual.layer3.0.conv2.weight FLOAT[384,384,3,3] 7c499b01152f
visual.layer3.0.conv2.weight_bias FLOAT[384] 0b8792d39d97
visual.layer3.0.conv3.weight FLOAT[1536,384,1,1] 3aafe0b0c4ab
visual.layer3.0.conv3.weight_bias FLOAT[1536] 09c1ab66649e
visual.layer3.0.downsample.0.weight FLOAT[1536,768,1,1] d34c9de36609
visual.layer3.0.downsample.0.weight_bias FLOAT[1536] 36326f840377
visual.layer3.1.conv1.weight FLOAT[384,1536,1,1] 0f13b98faeb0
visual.layer3.1.conv1.weight_bias FLOAT[384] 903fd2c9cefe
visual.layer3.1.conv2.weight FLOAT[384,384,3,3] d30bc2a6ad6a
visual.layer3.1.conv2.weight_bias FLOAT[384] 78548969b53b
visual.layer3.1.conv3.weight FLOAT[1536,384,1,1] c5abd5931d65
visual.layer3.1.conv3.weight_bias FLOAT[1536] ff7f9bab5c25
visual.layer3.10.conv1.weight FLOAT[384,1536,1,1] 18ee9e95c2bb
visual.layer3.10.conv1.weight_bias FLOAT[384] d60538f8bb82
visual.layer3.10.conv2.weight FLOAT[384,384,3,3] 1ec781912725
visual.layer3.10.conv2.weight_bias FLOAT[384] 585b7e010cb5
visual.layer3.10.conv3.weight FLOAT[1536,384,1,1] 8f4b1d8ae33c
visual.layer3.10.conv3.weight_bias FLOAT[1536] 41ea52623c2e
visual.layer3.11.conv1.weight FLOAT[384,1536,1,1] db41912c1e4b
visual.layer3.11.conv1.weight_bias FLOAT[384] 7a7e8329fb90
visual.layer3.11.conv2.weight FLOAT[384,384,3,3] af327e2a8c11
visual.layer3.11.conv2.weight_bias FLOAT[384] 1c010e9a0cbf
visual.layer3.11.conv3.weight FLOAT[1536,384,1,1] 9b8ef8381cac
visual.layer3.11.conv3.weight_bias FLOAT[1536] 59a6d206491f
visual.layer3.12.conv1.weight FLOAT[384,1536,1,1] 55d172c59cc1
visual.layer3.12.conv1.weight_bias FLOAT[384] cac9ad220116
visual.layer3.12.conv2.weight FLOAT[384,384,3,3] e3d672380955
visual.layer3.12.conv2.weight_bias FLOAT[384] 9098b988bce5
visual.layer3.12.conv3.weight FLOAT[1536,384,1,1] fae8e7d159bd
visual.layer3.12.conv3.weight_bias FLOAT[1536] 94c7bb63d4b2
visual.layer3.13.conv1.weight FLOAT[384,1536,1,1] 4ec0699dc4c6
visual.layer3.13.conv1.weight_bias FLOAT[384] f148cc9349cd
visual.layer3.13.conv2.weight FLOAT[384,384,3,3] 9315a995d483
visual.layer3.13.conv2.weight_bias FLOAT[384] 2aa5c4dd432f
visual.layer3.13.conv3.weight FLOAT[1536,384,1,1] 3f0c7916cc9d
visual.layer3.13.conv3.weight_bias FLOAT[1536] 28c59af94d11
visual.layer3.14.conv1.weight FLOAT[384,1536,1,1] e49a4124b100
visual.layer3.14.conv1.weight_bias FLOAT[384] fc2508770eb6
visual.layer3.14.conv2.weight FLOAT[384,384,3,3] ad7e91370e9b
visual.layer3.14.conv2.weight_bias FLOAT[384] d1f4c0a83216
visual.layer3.14.conv3.weight FLOAT[1536,384,1,1] 5c01e3bcf39b
visual.layer3.14.conv3.weight_bias FLOAT[1536] aeaa0b16c3ab
visual.layer3.15.conv1.weight FLOAT[384,1536,1,1] 7affe7c62039
visual.layer3.15.conv1.weight_bias FLOAT[384] b991cb772c9e
visual.layer3.15.conv2.weight FLOAT[384,384,3,3] 70a774f3e9ab
visual.layer3.15.conv2.weight_bias FLOAT[384] 2bed00808e48
visual.layer3.15.conv3.weight FLOAT[1536,384,1,1] 60716c3a91ea
visual.layer3.15.conv3.weight_bias FLOAT[1536] 57f6761b7490
visual.layer3.16.conv1.weight FLOAT[384,1536,1,1] 95585caeda31
visual.layer3.16.conv1.weight_bias FLOAT[384] 156340c56819
visual.layer3.16.conv2.weight FLOAT[384,384,3,3] d436e1db88df
visual.layer3.16.conv2.weight_bias FLOAT[384] d0c57d2e5211
visual.layer3.16.conv3.weight FLOAT[1536,384,1,1] b5f42bbf0a56
visual.layer3.16.conv3.weight_bias FLOAT[1536] 7ddb9040e36c
visual.layer3.17.conv1.weight FLOAT[384,1536,1,1] 76d9160aa365
visual.layer3.17.conv1.weight_bias FLOAT[384] 8d6f7505ada2
visual.layer3.17.conv2.weight FLOAT[384,384,3,3] ff8d832e2a33
visual.layer3.17.conv2.weight_bias FLOAT[384] 6daeb51037d4
visual.layer3.17.conv3.weight FLOAT[1536,384,1,1] 0439097498d4
visual.layer3.17.conv3.weight_bias FLOAT[1536] c729abbe4b7e
visual.layer3.2.conv1.weight FLOAT[384,1536,1,1] 011598123945
visual.layer3.2.conv1.weight_bias FLOAT[384] e6d83d566c84
visual.layer3.2.conv2.weight FLOAT[384,384,3,3] 8b62c0ae0b0e
visual.layer3.2.conv2.weight_bias FLOAT[384] a4cbba71cd75
visual.layer3.2.conv3.weight FLOAT[1536,384,1,1] c2cf2ddd5d08
visual.layer3.2.conv3.weight_bias FLOAT[1536] 23b98d48c0ed
visual.layer3.3.conv1.weight FLOAT[384,1536,1,1] 8623b5e6a7d2
visual.layer3.3.conv1.weight_bias FLOAT[384] 4b6dc08ede3c
visual.layer3.3.conv2.weight FLOAT[384,384,3,3] df9ab2e3efd2
visual.layer3.3.conv2.weight_bias FLOAT[384] e70ba06acce5
visual.layer3.3.conv3.weight FLOAT[1536,384,1,1] d85e5b4e0516
visual.layer3.3.conv3.weight_bias FLOAT[1536] 75c56e738c21
visual.layer3.4.conv1.weight FLOAT[384,1536,1,1] dd5607aae16d
visual.layer3.4.conv1.weight_bias FLOAT[384] 4a49785e13ab
visual.layer3.4.conv2.weight FLOAT[384,384,3,3] e80c6572671d
visual.layer3.4.conv2.weight_bias FLOAT[384] 616150ac52e0
visual.layer3.4.conv3.weight FLOAT[1536,384,1,1] b671e0ea1a86
visual.layer3.4.conv3.weight_bias FLOAT[1536] 87bc065cd62c
visual.layer3.5.conv1.weight FLOAT[384,1536,1,1] b531d32a8e78
visual.layer3.5.conv1.weight_bias FLOAT[384] 3c69d354360e
visual.layer3.5.conv2.weight FLOAT[384,384,3,3] 44d1ba1ca38c
visual.layer3.5.conv2.weight_bias FLOAT[384] 5d514ba3ebf9
visual.layer3.5.conv3.weight FLOAT[1536,384,1,1] 260d32792c81
visual.layer3.5.conv3.weight_bias FLOAT[1536] ce0a56bcb1f6
visual.layer3.6.conv1.weight FLOAT[384,1536,1,1] a41e9b85dbef
visual.layer3.6.conv1.weight_bias FLOAT[384] 86a1c13da678
visual.layer3.6.conv2.weight FLOAT[384,384,3,3] 0c0aba7522a8
visual.layer3.6.conv2.weight_bias FLOAT[384] 36ef8af1b88a
visual.layer3.6.conv3.weight FLOAT[1536,384,1,1] cc4c083ec206
visual.layer3.6.conv3.weight_bias FLOAT[1536] 86356c93aad0
visual.layer3.7.conv1.weight FLOAT[384,1536,1,1] 12bacb1d1729
visual.layer3.7.conv1.weight_bias FLOAT[384] cefc320b7e5a
visual.layer3.7.conv2.weight FLOAT[384,384,3,3] 3b51d860fbb9
visual.layer3.7.conv2.weight_bias FLOAT[384] 3aeb23524f41
visual.layer3.7.conv3.weight FLOAT[1536,384,1,1] 71e1ee495b58
visual.layer3.7.conv3.weight_bias FLOAT[1536] b05c443d9638
visual.layer3.8.conv1.weight FLOAT[384,1536,1,1] 836eb37caca6
visual.layer3.8.conv1.weight_bias FLOAT[384] aafd2e4c10b4
visual.layer3.8.conv2.weight FLOAT[384,384,3,3] d4bc3cc3998c
visual.layer3.8.conv2.weight_bias FLOAT[384] c7de0e5c00f2
visual.layer3.8.conv3.weight FLOAT[1536,384,1,1] dd361fa421d8
visual.layer3.8.conv3.weight_bias FLOAT[1536] af5ed08e955d
visual.layer3.9.conv1.weight FLOAT[384,1536,1,1] 128e641e3c51
visual.layer3.9.conv1.weight_bias FLOAT[384] be19d26f1331
visual.layer3.9.conv2.weight FLOAT[384,384,3,3] 921712ebc6cf
visual.layer3.9.conv2.weight_bias FLOAT[384] 35974e689dae
visual.layer3.9.conv3.weight FLOAT[1536,384,1,1] 9583495a1b58
visual.layer3.9.conv3.weight_bias FLOAT[1536] bdd9f656d9d0
visual.layer4.0.conv1.weight FLOAT[768,1536,1,1] d13d6d47962c
visual.layer4.0.conv1.weight_bias FLOAT[768] 39cd48197351
visual.layer4.0.conv2.weight FLOAT[768,768,3,3] f2489e38e919
visual.layer4.0.conv2.weight_bias FLOAT[768] 043d8a89969a
visual.layer4.0.conv3.weight FLOAT[3072,768,1,1] 0ef32922752f
visual.layer4.0.conv3.weight_bias FLOAT[3072] 96d3f24e84e1
visual.layer4.0.downsample.0.weight FLOAT[3072,1536,1,1] 0e3e2c667c03
visual.layer4.0.downsample.0.weight_bias FLOAT[3072] b9bc52b12f0a
visual.layer4.1.conv1.weight FLOAT[768,3072,1,1] 847bf04cc598
visual.layer4.1.conv1.weight_bias FLOAT[768] 2f1d4bddbf80
visual.layer4.1.conv2.weight FLOAT[768,768,3,3] 1c5c3192472a
visual.layer4.1.conv2.weight_bias FLOAT[768] a01da007167e
visual.layer4.1.conv3.weight FLOAT[3072,768,1,1] 4e81d83926fd
visual.layer4.1.conv3.weight_bias FLOAT[3072] 1dc9339df7af
visual.layer4.2.conv1.weight FLOAT[768,3072,1,1] 0e6d87c69cd9
visual.layer4.2.conv1.weight_bias FLOAT[768] 539a1ecb3721
visual.layer4.2.conv2.weight FLOAT[768,768,3,3] e506cbf8a8e8
visual.layer4.2.conv2.weight_bias FLOAT[768] 535f938f25e2
visual.layer4.2.conv3.weight FLOAT[3072,768,1,1] 02cc5eeb69d7
visual.layer4.2.conv3.weight_bias FLOAT[3072] 7308050614bc
visual.layer4.3.conv1.weight FLOAT[768,3072,1,1] a391b121c89f
visual.layer4.3.conv1.weight_bias FLOAT[768] 132090d609cf
visual.layer4.3.conv2.weight FLOAT[768,768,3,3] 8358e75dbda4
visual.layer4.3.conv2.weight_bias FLOAT[768] e12d041b74ce
visual.layer4.3.conv3.weight FLOAT[3072,768,1,1] 062ef697b5fd
visual.layer4.3.conv3.weight_bias FLOAT[3072] 58bebde27743
visual.layer4.4.conv1.weight FLOAT[768,3072,1,1] b03c31db1ed5
visual.layer4.4.conv1.weight_bias FLOAT[768] c500c179a44f
visual.layer4.4.conv2.weight FLOAT[768,768,3,3] 698f09451e89
visual.layer4.4.conv2.weight_bias FLOAT[768] 3387d622da54
visual.layer4.4.conv3.weight FLOAT[3072,768,1,1] 1a3097e10ded
visual.layer4.4.conv3.weight_bias FLOAT[3072] 35c9ef927560
visual.layer4.5.conv1.weight FLOAT[768,3072,1,1] 8361d620d747
visual.layer4.5.conv1.weight_bias FLOAT[768] 46d3190e524b
visual.layer4.5.conv2.weight FLOAT[768,768,3,3] 183b29394732
visual.layer4.5.conv2.weight_bias FLOAT[768] 17296ccf0ea0
visual.layer4.5.conv3.weight FLOAT[3072,768,1,1] fa572600c03c
visual.layer4.5.conv3.weight_bias FLOAT[3072] 1afbf729c53b
visual.layer4.6.conv1.weight FLOAT[768,3072,1,1] bb863ba982ed
visual.layer4.6.conv1.weight_bias FLOAT[768] 333bb7a987b5
visual.layer4.6.conv2.weight FLOAT[768,768,3,3] 017b42b5b5a8
visual.layer4.6.conv2.weight_bias FLOAT[768] 98d7febe37df
visual.layer4.6.conv3.weight FLOAT[3072,768,1,1] 290e30caef3c
visual.layer4.6.conv3.weight_bias FLOAT[3072] efca3c1d6966
visual.layer4.7.conv1.weight FLOAT[768,3072,1,1] 5565dd2003f3
visual.layer4.7.conv1.weight_bias FLOAT[768] f81985899ba1
visual.layer4.7.conv2.weight FLOAT[768,768,3,3] 6e4b6e97f8f0
visual.layer4.7.conv2.weight_bias FLOAT[768] 6a2c3b51a87e
visual.layer4.7.conv3.weight FLOAT[3072,768,1,1] 9a1dad3c5d68
visual.layer4.7.conv3.weight_bias FLOAT[3072] 82daa5e93709
+625
View File
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,640] text_embedding)
<
float[batch,77,640] add_1012
float[batch,77,640] add_1127
float[batch,77,640] add_1156
float[batch,77,640] add_119
float[batch,77,640] add_1271
float[batch,77,640] add_1300
float[batch,77,640] add_1415
float[batch,77,640] add_1444
float[batch,77,640] add_148
float[batch,77,640] add_1559
float[batch,77,640] add_1588
float[batch,1,640] add_1588_pooled
float[batch,1,640] add_1703
float[batch,1,640] add_1732
float[batch,77,640] add_263
float[batch,77,640] add_292
float[batch,77,640] add_4
float[batch,77,640] add_407
float[batch,77,640] add_436
float[batch,77,640] add_551
float[batch,77,640] add_580
float[batch,77,640] add_695
float[batch,77,640] add_724
float[batch,77,640] add_839
float[batch,77,640] add_868
float[batch,77,640] add_983
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,640] embedding
float[batch,77,640] layer_norm
float[batch,77,640] layer_norm_1
float[batch,77,640] layer_norm_10
float[batch,77,640] layer_norm_11
float[batch,77,640] layer_norm_12
float[batch,77,640] layer_norm_13
float[batch,77,640] layer_norm_14
float[batch,77,640] layer_norm_15
float[batch,77,640] layer_norm_16
float[batch,77,640] layer_norm_17
float[batch,77,640] layer_norm_18
float[batch,77,640] layer_norm_19
float[batch,77,640] layer_norm_2
float[batch,77,640] layer_norm_20
float[batch,77,640] layer_norm_21
float[batch,77,640] layer_norm_22
float[batch,1,640] layer_norm_23
float[batch,77,640] layer_norm_3
float[batch,77,640] layer_norm_4
float[batch,77,640] layer_norm_5
float[batch,77,640] layer_norm_6
float[batch,77,640] layer_norm_7
float[batch,77,640] layer_norm_8
float[batch,77,640] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2560] linear_10
float[batch,77,640] linear_11
float[batch,77,2560] linear_14
float[batch,77,640] linear_15
float[batch,77,2560] linear_18
float[batch,77,640] linear_19
float[batch,77,2560] linear_2
float[batch,77,2560] linear_22
float[batch,77,640] linear_23
float[batch,77,2560] linear_26
float[batch,77,640] linear_27
float[batch,77,640] linear_3
float[batch,77,2560] linear_30
float[batch,77,640] linear_31
float[batch,77,2560] linear_34
float[batch,77,640] linear_35
float[batch,77,2560] linear_38
float[batch,77,640] linear_39
float[batch,77,2560] linear_42
float[batch,77,640] linear_43
float[batch,1,2560] linear_46
float[batch,1,640] linear_47
float[batch,77,2560] linear_6
float[batch,77,640] linear_7
float[batch,640] matmul
float[batch,77,2560] mul_101
float[batch,77,2560] mul_106
float[batch,77,2560] mul_1064
float[batch,77,2560] mul_1069
float[batch,77,2560] mul_1171
float[batch,77,2560] mul_1176
float[batch,1,2560] mul_1278
float[batch,1,2560] mul_1283
float[batch,77,2560] mul_208
float[batch,77,2560] mul_213
float[batch,77,2560] mul_315
float[batch,77,2560] mul_320
float[batch,77,2560] mul_422
float[batch,77,2560] mul_427
float[batch,77,2560] mul_529
float[batch,77,2560] mul_534
float[batch,77,2560] mul_636
float[batch,77,2560] mul_641
float[batch,77,2560] mul_743
float[batch,77,2560] mul_748
float[batch,77,2560] mul_850
float[batch,77,2560] mul_855
float[batch,77,2560] mul_957
float[batch,77,2560] mul_962
float[batch,77,640] node_scaled_dot_product_attention_10_k
float[batch,77,640] node_scaled_dot_product_attention_10_out
float[batch,77,640] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_10_q
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_10_v
float[batch,77,640] node_scaled_dot_product_attention_11_k
float[batch,1,640] node_scaled_dot_product_attention_11_out
float[batch,1,640] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_11_q
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_11_v
float[batch,77,640] node_scaled_dot_product_attention_1_k
float[batch,77,640] node_scaled_dot_product_attention_1_out
float[batch,77,640] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_1_q
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_1_v
float[batch,77,640] node_scaled_dot_product_attention_2_k
float[batch,77,640] node_scaled_dot_product_attention_2_out
float[batch,77,640] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_2_q
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_2_v
float[batch,77,640] node_scaled_dot_product_attention_3_k
float[batch,77,640] node_scaled_dot_product_attention_3_out
float[batch,77,640] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_3_q
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_3_v
float[batch,77,640] node_scaled_dot_product_attention_4_k
float[batch,77,640] node_scaled_dot_product_attention_4_out
float[batch,77,640] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_4_q
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_4_v
float[batch,77,640] node_scaled_dot_product_attention_5_k
float[batch,77,640] node_scaled_dot_product_attention_5_out
float[batch,77,640] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_5_q
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_5_v
float[batch,77,640] node_scaled_dot_product_attention_6_k
float[batch,77,640] node_scaled_dot_product_attention_6_out
float[batch,77,640] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_6_q
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_6_v
float[batch,77,640] node_scaled_dot_product_attention_7_k
float[batch,77,640] node_scaled_dot_product_attention_7_out
float[batch,77,640] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_7_q
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_7_v
float[batch,77,640] node_scaled_dot_product_attention_8_k
float[batch,77,640] node_scaled_dot_product_attention_8_out
float[batch,77,640] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_8_q
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_8_v
float[batch,77,640] node_scaled_dot_product_attention_9_k
float[batch,77,640] node_scaled_dot_product_attention_9_out
float[batch,77,640] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_9_q
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_9_v
float[batch,77,640] node_scaled_dot_product_attention_k
float[batch,77,640] node_scaled_dot_product_attention_out
float[batch,77,640] node_scaled_dot_product_attention_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_q
float[batch,77,1920] node_scaled_dot_product_attention_qkv
float[batch,77,1920] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_v
float[batch,77,640] scaled_dot_product_attention
float[batch,77,640] scaled_dot_product_attention_1
float[batch,77,640] scaled_dot_product_attention_10
float[batch,77,640] scaled_dot_product_attention_11
float[batch,1,640] scaled_dot_product_attention_11_pooled
float[batch,77,640] scaled_dot_product_attention_2
float[batch,77,640] scaled_dot_product_attention_3
float[batch,77,640] scaled_dot_product_attention_4
float[batch,77,640] scaled_dot_product_attention_5
float[batch,77,640] scaled_dot_product_attention_6
float[batch,77,640] scaled_dot_product_attention_7
float[batch,77,640] scaled_dot_product_attention_8
float[batch,77,640] scaled_dot_product_attention_9
float[batch,77,2560] sigmoid
float[batch,77,2560] sigmoid_1
float[batch,77,2560] sigmoid_10
float[batch,1,2560] sigmoid_11
float[batch,77,2560] sigmoid_2
float[batch,77,2560] sigmoid_3
float[batch,77,2560] sigmoid_4
float[batch,77,2560] sigmoid_5
float[batch,77,2560] sigmoid_6
float[batch,77,2560] sigmoid_7
float[batch,77,2560] sigmoid_8
float[batch,77,2560] sigmoid_9
float[batch,77,2560] val_40
float[batch,77,640] val_41
float[batch,77,2560] val_42
float[batch,77,640] val_43
float[batch,77,2560] val_44
float[batch,77,640] val_45
float[batch,77,2560] val_46
float[batch,77,640] val_47
float[batch,77,2560] val_48
float[batch,77,640] val_49
float[batch,77,2560] val_50
float[batch,77,640] val_51
float[batch,77,2560] val_52
float[batch,77,640] val_53
float[batch,77,2560] val_54
float[batch,77,640] val_55
float[batch,77,2560] val_56
float[batch,77,640] val_57
float[batch,77,2560] val_58
float[batch,77,640] val_59
float[batch,77,2560] val_60
float[batch,77,640] val_61
float[batch,77] val_62
float[batch,1,77] val_63
float[batch,1,2560] val_64
float[batch,1,640] val_65
float[batch,1,640] val_66
float[batch,640] val_67
>
{
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_39)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x640)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_40 = MatMul (layer_norm_1, val_4)
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
mul_101 = Mul (linear_2, val_2)
[node_sigmoid] sigmoid = Sigmoid (mul_101)
mul_106 = Mul (linear_2, sigmoid)
val_41 = MatMul (mul_106, val_5)
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
add_148 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x640)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_42 = MatMul (layer_norm_3, val_7)
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
mul_208 = Mul (linear_6, val_2)
sigmoid_1 = Sigmoid (mul_208)
mul_213 = Mul (linear_6, sigmoid_1)
val_43 = MatMul (mul_213, val_8)
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
add_292 = Add (add_263, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x640)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_44 = MatMul (layer_norm_5, val_10)
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
mul_315 = Mul (linear_10, val_2)
sigmoid_2 = Sigmoid (mul_315)
mul_320 = Mul (linear_10, sigmoid_2)
val_45 = MatMul (mul_320, val_11)
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
add_436 = Add (add_407, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x640)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_46 = MatMul (layer_norm_7, val_13)
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
mul_422 = Mul (linear_14, val_2)
sigmoid_3 = Sigmoid (mul_422)
mul_427 = Mul (linear_14, sigmoid_3)
val_47 = MatMul (mul_427, val_14)
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
add_580 = Add (add_551, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x640)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_48 = MatMul (layer_norm_9, val_16)
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
mul_529 = Mul (linear_18, val_2)
sigmoid_4 = Sigmoid (mul_529)
mul_534 = Mul (linear_18, sigmoid_4)
val_49 = MatMul (mul_534, val_17)
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
add_724 = Add (add_695, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x640)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_50 = MatMul (layer_norm_11, val_19)
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
mul_636 = Mul (linear_22, val_2)
sigmoid_5 = Sigmoid (mul_636)
mul_641 = Mul (linear_22, sigmoid_5)
val_51 = MatMul (mul_641, val_20)
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
add_868 = Add (add_839, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x640)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_52 = MatMul (layer_norm_13, val_22)
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
mul_743 = Mul (linear_26, val_2)
sigmoid_6 = Sigmoid (mul_743)
mul_748 = Mul (linear_26, sigmoid_6)
val_53 = MatMul (mul_748, val_23)
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
add_1012 = Add (add_983, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x640)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_54 = MatMul (layer_norm_15, val_25)
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
mul_850 = Mul (linear_30, val_2)
sigmoid_7 = Sigmoid (mul_850)
mul_855 = Mul (linear_30, sigmoid_7)
val_55 = MatMul (mul_855, val_26)
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
add_1156 = Add (add_1127, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x640)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_56 = MatMul (layer_norm_17, val_28)
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
mul_957 = Mul (linear_34, val_2)
sigmoid_8 = Sigmoid (mul_957)
mul_962 = Mul (linear_34, sigmoid_8)
val_57 = MatMul (mul_962, val_29)
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
add_1300 = Add (add_1271, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x640)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_58 = MatMul (layer_norm_19, val_31)
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
mul_1064 = Mul (linear_38, val_2)
sigmoid_9 = Sigmoid (mul_1064)
mul_1069 = Mul (linear_38, sigmoid_9)
val_59 = MatMul (mul_1069, val_32)
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
add_1444 = Add (add_1415, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x640)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_60 = MatMul (layer_norm_21, val_34)
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
mul_1171 = Mul (linear_42, val_2)
sigmoid_10 = Sigmoid (mul_1171)
mul_1176 = Mul (linear_42, sigmoid_10)
val_61 = MatMul (mul_1176, val_35)
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
add_1588 = Add (add_1559, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x640)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
val_63 = Unsqueeze (val_62, val_756_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_64 = MatMul (layer_norm_23, val_37)
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
mul_1278 = Mul (linear_46, val_2)
sigmoid_11 = Sigmoid (mul_1278)
mul_1283 = Mul (linear_46, sigmoid_11)
val_65 = MatMul (mul_1283, val_38)
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
add_1732 = Add (add_1703, linear_47)
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
val_67 = Squeeze (val_66, val_756_axes1)
[node_matmul] matmul = MatMul (val_67, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x640 INT64[3] 96f437355f6e
ln_final.bias FLOAT[640] 8a5f2d55c328
ln_final.weight FLOAT[640] 32b5ed53d659
node_scaled_dot_product_attention_10_wo_t FLOAT[640,640] 2ce581d2c71c
node_scaled_dot_product_attention_11_wo_t FLOAT[640,640] 4a563173d428
node_scaled_dot_product_attention_1_wo_t FLOAT[640,640] 500d04ba3a69
node_scaled_dot_product_attention_2_wo_t FLOAT[640,640] 5abf80fd01a7
node_scaled_dot_product_attention_3_wo_t FLOAT[640,640] 49f78c631c7a
node_scaled_dot_product_attention_4_wo_t FLOAT[640,640] 30526fab2402
node_scaled_dot_product_attention_5_wo_t FLOAT[640,640] 801815bdfd87
node_scaled_dot_product_attention_6_wo_t FLOAT[640,640] 10d23f8ee262
node_scaled_dot_product_attention_7_wo_t FLOAT[640,640] 3658cdfcccc1
node_scaled_dot_product_attention_8_wo_t FLOAT[640,640] 370697c88438
node_scaled_dot_product_attention_9_wo_t FLOAT[640,640] 77654b10bb91
node_scaled_dot_product_attention_wo_t FLOAT[640,640] 983322738618
positional_embedding FLOAT[77,640] 150469ec704e
text_projection FLOAT[640,640] 4137b9152ab2
token_embedding.weight_fp16 FLOAT16[49408,640] 433322639a81
transformer.resblocks.0.attn.in_proj_bias FLOAT[1920] 56ff20bcdc50
transformer.resblocks.0.attn.out_proj.bias FLOAT[640] 1fc7ca9647ac
transformer.resblocks.0.ln_1.bias FLOAT[640] 83c39630bfe6
transformer.resblocks.0.ln_1.weight FLOAT[640] d02bed394313
transformer.resblocks.0.ln_2.bias FLOAT[640] aa12e199b46e
transformer.resblocks.0.ln_2.weight FLOAT[640] 6035850d6a97
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2560] 5a3587818823
transformer.resblocks.0.mlp.c_proj.bias FLOAT[640] 47b8928abb58
transformer.resblocks.1.attn.in_proj_bias FLOAT[1920] ca272f4dd17b
transformer.resblocks.1.attn.out_proj.bias FLOAT[640] 06e21fe63f3d
transformer.resblocks.1.ln_1.bias FLOAT[640] 69a59151865f
transformer.resblocks.1.ln_1.weight FLOAT[640] 6f0d6e63623f
transformer.resblocks.1.ln_2.bias FLOAT[640] a602f13993ad
transformer.resblocks.1.ln_2.weight FLOAT[640] 87a7c472402f
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2560] 15d7bfa5c7cc
transformer.resblocks.1.mlp.c_proj.bias FLOAT[640] 504e773b8a1e
transformer.resblocks.10.attn.in_proj_bias FLOAT[1920] 78c169ee79be
transformer.resblocks.10.attn.out_proj.bias FLOAT[640] 35c21a79396f
transformer.resblocks.10.ln_1.bias FLOAT[640] 0083327355b9
transformer.resblocks.10.ln_1.weight FLOAT[640] 58e9898b0bc7
transformer.resblocks.10.ln_2.bias FLOAT[640] 4a5c5cfa44ee
transformer.resblocks.10.ln_2.weight FLOAT[640] faf6b69c41b9
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2560] d8e2abc3874e
transformer.resblocks.10.mlp.c_proj.bias FLOAT[640] dc635fee6d04
transformer.resblocks.11.attn.in_proj_bias FLOAT[1920] 0d4c348c23f5
transformer.resblocks.11.attn.out_proj.bias FLOAT[640] ee2169f313d9
transformer.resblocks.11.ln_1.bias FLOAT[640] 4195ca4a3f24
transformer.resblocks.11.ln_1.weight FLOAT[640] dfa2fc68b007
transformer.resblocks.11.ln_2.bias FLOAT[640] f708ea67c900
transformer.resblocks.11.ln_2.weight FLOAT[640] 10ef840a467a
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2560] 4e18641c6f86
transformer.resblocks.11.mlp.c_proj.bias FLOAT[640] 46c06c677dd5
transformer.resblocks.2.attn.in_proj_bias FLOAT[1920] bb375663a1de
transformer.resblocks.2.attn.out_proj.bias FLOAT[640] b82e56b48290
transformer.resblocks.2.ln_1.bias FLOAT[640] 3d2149e364a5
transformer.resblocks.2.ln_1.weight FLOAT[640] 3717dd838d8a
transformer.resblocks.2.ln_2.bias FLOAT[640] b3480d2c1f32
transformer.resblocks.2.ln_2.weight FLOAT[640] 93e85ac07374
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2560] d65c9cac5f3f
transformer.resblocks.2.mlp.c_proj.bias FLOAT[640] 9b35faa55fee
transformer.resblocks.3.attn.in_proj_bias FLOAT[1920] 473c60e12667
transformer.resblocks.3.attn.out_proj.bias FLOAT[640] eef12ad44655
transformer.resblocks.3.ln_1.bias FLOAT[640] ce791e05a8b6
transformer.resblocks.3.ln_1.weight FLOAT[640] 40473f0ef8ce
transformer.resblocks.3.ln_2.bias FLOAT[640] 9465f0ef461f
transformer.resblocks.3.ln_2.weight FLOAT[640] 46bff1d771b4
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2560] 3b770f3c7f67
transformer.resblocks.3.mlp.c_proj.bias FLOAT[640] 69cfbd864847
transformer.resblocks.4.attn.in_proj_bias FLOAT[1920] a5da21259540
transformer.resblocks.4.attn.out_proj.bias FLOAT[640] f11806002f24
transformer.resblocks.4.ln_1.bias FLOAT[640] 2b7e3903fa77
transformer.resblocks.4.ln_1.weight FLOAT[640] 1da67ff86eb8
transformer.resblocks.4.ln_2.bias FLOAT[640] a90d96015e6e
transformer.resblocks.4.ln_2.weight FLOAT[640] b1efdf094f2b
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2560] 1150d8ffb961
transformer.resblocks.4.mlp.c_proj.bias FLOAT[640] 09eb2239e0f4
transformer.resblocks.5.attn.in_proj_bias FLOAT[1920] d5918fb838f5
transformer.resblocks.5.attn.out_proj.bias FLOAT[640] 0957ca34c641
transformer.resblocks.5.ln_1.bias FLOAT[640] d21f2a375c63
transformer.resblocks.5.ln_1.weight FLOAT[640] e49237b4bb67
transformer.resblocks.5.ln_2.bias FLOAT[640] c970b07e42d9
transformer.resblocks.5.ln_2.weight FLOAT[640] 66247e6a3133
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2560] 50999a3ab4dd
transformer.resblocks.5.mlp.c_proj.bias FLOAT[640] c5265c0fb05b
transformer.resblocks.6.attn.in_proj_bias FLOAT[1920] 722f1c313089
transformer.resblocks.6.attn.out_proj.bias FLOAT[640] be2db29f8b7e
transformer.resblocks.6.ln_1.bias FLOAT[640] 650a1f19709a
transformer.resblocks.6.ln_1.weight FLOAT[640] cfcc8ffdc47d
transformer.resblocks.6.ln_2.bias FLOAT[640] 8561932fb9f9
transformer.resblocks.6.ln_2.weight FLOAT[640] 884a6b9d55d5
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2560] a7d4c2861fdc
transformer.resblocks.6.mlp.c_proj.bias FLOAT[640] 4b0cec79f216
transformer.resblocks.7.attn.in_proj_bias FLOAT[1920] 1a6f638c8034
transformer.resblocks.7.attn.out_proj.bias FLOAT[640] d4bb7649433b
transformer.resblocks.7.ln_1.bias FLOAT[640] 896532b6d6a7
transformer.resblocks.7.ln_1.weight FLOAT[640] 6fb365bc53e3
transformer.resblocks.7.ln_2.bias FLOAT[640] a7392c39ec2e
transformer.resblocks.7.ln_2.weight FLOAT[640] 0508331dd16f
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2560] 903d766dfd08
transformer.resblocks.7.mlp.c_proj.bias FLOAT[640] 6fabb4235ba7
transformer.resblocks.8.attn.in_proj_bias FLOAT[1920] 1e41b2103966
transformer.resblocks.8.attn.out_proj.bias FLOAT[640] 7dcd295ef226
transformer.resblocks.8.ln_1.bias FLOAT[640] db6450da747a
transformer.resblocks.8.ln_1.weight FLOAT[640] 2940070bc8ea
transformer.resblocks.8.ln_2.bias FLOAT[640] cafc0b2e83d2
transformer.resblocks.8.ln_2.weight FLOAT[640] 51dfff481a61
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2560] f89aa0303606
transformer.resblocks.8.mlp.c_proj.bias FLOAT[640] d63911e4b782
transformer.resblocks.9.attn.in_proj_bias FLOAT[1920] 422845e9015e
transformer.resblocks.9.attn.out_proj.bias FLOAT[640] aba2467d3b84
transformer.resblocks.9.ln_1.bias FLOAT[640] 01f506c2ec1e
transformer.resblocks.9.ln_1.weight FLOAT[640] 6301f3174f38
transformer.resblocks.9.ln_2.bias FLOAT[640] cf645ff3b934
transformer.resblocks.9.ln_2.weight FLOAT[640] 8be87eb68bb9
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2560] 758b5cb64da2
transformer.resblocks.9.mlp.c_proj.bias FLOAT[640] bbb2c967b66a
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[640,2560] 1564799974cb
val_11 FLOAT[2560,640] 21d7156f37e8
val_12 FLOAT[640,1920] a93a04d0c6d1
val_13 FLOAT[640,2560] 8c094b3930bc
val_14 FLOAT[2560,640] f78f7d50c0e1
val_15 FLOAT[640,1920] 180a7e68fbea
val_16 FLOAT[640,2560] 7887c6da344d
val_17 FLOAT[2560,640] 81c34b41f370
val_18 FLOAT[640,1920] 14c0b1debaf5
val_19 FLOAT[640,2560] 7522c81b4fcf
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[2560,640] 8566d6360c89
val_21 FLOAT[640,1920] 4310106495b6
val_22 FLOAT[640,2560] 354b702d8761
val_23 FLOAT[2560,640] 5b201a078c62
val_24 FLOAT[640,1920] 009e94c56cc6
val_25 FLOAT[640,2560] 4c6b00d8fc3f
val_26 FLOAT[2560,640] 19e756d1f034
val_27 FLOAT[640,1920] 213eab8161e5
val_28 FLOAT[640,2560] f43766319d7d
val_29 FLOAT[2560,640] f1ab06ae3c13
val_3 FLOAT[640,1920] 453bbd244e58
val_30 FLOAT[640,1920] 3f8f1861398a
val_31 FLOAT[640,2560] fb30b024ad30
val_32 FLOAT[2560,640] 471561acb8a9
val_33 FLOAT[640,1920] 1208485f3c4a
val_34 FLOAT[640,2560] 88178300232b
val_35 FLOAT[2560,640] 362692062fd8
val_36 FLOAT[640,1920] 8ae373f8fb24
val_37 FLOAT[640,2560] 54809ac800b6
val_38 FLOAT[2560,640] cc7c3b9e10ea
val_4 FLOAT[640,2560] cd842c30a608
val_5 FLOAT[2560,640] b1279ad9e676
val_6 FLOAT[640,1920] d8a4516d3936
val_7 FLOAT[640,2560] 0e8b11417f26
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[2560,640] 0ebdb0264e07
val_9 FLOAT[640,1920] ae7e6c5d74d6
+670
View File
@@ -0,0 +1,670 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,288,288,3] image) => (float[batch,640] image_embedding)
<
float[batch,1280,18,18] add_1016
float[batch,1280,18,18] add_1092
float[batch,1280,18,18] add_1168
float[batch,1280,18,18] add_1244
float[batch,1280,18,18] add_1320
float[batch,1280,18,18] add_1396
float[batch,320,72,72] add_140
float[batch,1280,18,18] add_1472
float[batch,1280,18,18] add_1548
float[batch,1280,18,18] add_1624
float[batch,2560,9,9] add_1720
float[batch,2560,9,9] add_1796
float[batch,2560,9,9] add_1872
float[batch,2560,9,9] add_1948
float[batch,2560,9,9] add_2024
float[batch,2560,9,9] add_2100
float[82,batch,2560] add_2130
float[batch,320,72,72] add_216
float[batch,320,72,72] add_292
float[batch,320,72,72] add_368
float[batch,640,36,36] add_464
float[batch,640,36,36] add_540
float[batch,640,36,36] add_616
float[batch,640,36,36] add_692
float[batch,640,36,36] add_768
float[batch,640,36,36] add_844
float[batch,1280,18,18] add_940
float[batch,80,72,72] avg_pool2d
float[batch,160,36,36] avg_pool2d_2
float[batch,320,36,36] avg_pool2d_3
float[batch,320,18,18] avg_pool2d_4
float[batch,640,18,18] avg_pool2d_5
float[batch,640,9,9] avg_pool2d_6
float[batch,1280,9,9] avg_pool2d_7
float[82,batch,2560] cat
float[batch,1] clamp_min
float[batch,40,144,144] getitem
float[batch,640,36,36] getitem_102
float[batch,320,36,36] getitem_105
float[batch,320,36,36] getitem_108
float[batch,1280,18,18] getitem_111
float[batch,1280,18,18] getitem_114
float[batch,320,18,18] getitem_117
float[batch,80,72,72] getitem_12
float[batch,320,18,18] getitem_120
float[batch,1280,18,18] getitem_123
float[batch,320,18,18] getitem_126
float[batch,320,18,18] getitem_129
float[batch,1280,18,18] getitem_132
float[batch,320,18,18] getitem_135
float[batch,320,18,18] getitem_138
float[batch,1280,18,18] getitem_141
float[batch,320,18,18] getitem_144
float[batch,320,18,18] getitem_147
float[batch,320,72,72] getitem_15
float[batch,1280,18,18] getitem_150
float[batch,320,18,18] getitem_153
float[batch,320,18,18] getitem_156
float[batch,1280,18,18] getitem_159
float[batch,320,18,18] getitem_162
float[batch,320,18,18] getitem_165
float[batch,1280,18,18] getitem_168
float[batch,320,18,18] getitem_171
float[batch,320,18,18] getitem_174
float[batch,1280,18,18] getitem_177
float[batch,320,72,72] getitem_18
float[batch,320,18,18] getitem_180
float[batch,320,18,18] getitem_183
float[batch,1280,18,18] getitem_186
float[batch,320,18,18] getitem_189
float[batch,320,18,18] getitem_192
float[batch,1280,18,18] getitem_195
float[batch,640,18,18] getitem_198
float[batch,640,18,18] getitem_201
float[batch,2560,9,9] getitem_204
float[batch,2560,9,9] getitem_207
float[batch,80,72,72] getitem_21
float[batch,640,9,9] getitem_210
float[batch,640,9,9] getitem_213
float[batch,2560,9,9] getitem_216
float[batch,640,9,9] getitem_219
float[batch,640,9,9] getitem_222
float[batch,2560,9,9] getitem_225
float[batch,640,9,9] getitem_228
float[batch,640,9,9] getitem_231
float[batch,2560,9,9] getitem_234
float[batch,640,9,9] getitem_237
float[batch,80,72,72] getitem_24
float[batch,640,9,9] getitem_240
float[batch,2560,9,9] getitem_243
float[batch,640,9,9] getitem_246
float[batch,640,9,9] getitem_249
float[batch,2560,9,9] getitem_252
float[batch,320,72,72] getitem_27
float[batch,40,144,144] getitem_3
float[batch,80,72,72] getitem_30
float[batch,80,72,72] getitem_33
float[batch,320,72,72] getitem_36
float[batch,80,72,72] getitem_39
float[batch,80,72,72] getitem_42
float[batch,320,72,72] getitem_45
float[batch,160,72,72] getitem_48
float[batch,160,72,72] getitem_51
float[batch,640,36,36] getitem_54
float[batch,640,36,36] getitem_57
float[batch,80,144,144] getitem_6
float[batch,160,36,36] getitem_60
float[batch,160,36,36] getitem_63
float[batch,640,36,36] getitem_66
float[batch,160,36,36] getitem_69
float[batch,160,36,36] getitem_72
float[batch,640,36,36] getitem_75
float[batch,160,36,36] getitem_78
float[batch,160,36,36] getitem_81
float[batch,640,36,36] getitem_84
float[batch,160,36,36] getitem_87
float[batch,80,72,72] getitem_9
float[batch,160,36,36] getitem_90
float[batch,640,36,36] getitem_93
float[batch,160,36,36] getitem_96
float[batch,160,36,36] getitem_99
float[batch,3,288,288] image_chw
float[batch,288,288,3] image_f32
float[batch,288,288,3] image_shifted
float[batch,1] linalg_vector_norm
float[1,batch,2560] linear
float[82,batch,2560] linear_1
float[82,batch,2560] linear_2
float[batch,640] linear_3
float[1,batch,2560] mean
float[1,batch,2560] node_scaled_dot_product_attention_q_row
float[81,batch,2560] permute_1
float[1,batch,40,64] permute_2
float[batch,40,144,144] relu
float[batch,40,144,144] relu_1
float[batch,80,72,72] relu_10
float[batch,320,72,72] relu_11
float[batch,80,72,72] relu_12
float[batch,80,72,72] relu_13
float[batch,320,72,72] relu_14
float[batch,160,72,72] relu_15
float[batch,160,72,72] relu_16
float[batch,640,36,36] relu_17
float[batch,160,36,36] relu_18
float[batch,160,36,36] relu_19
float[batch,80,144,144] relu_2
float[batch,640,36,36] relu_20
float[batch,160,36,36] relu_21
float[batch,160,36,36] relu_22
float[batch,640,36,36] relu_23
float[batch,160,36,36] relu_24
float[batch,160,36,36] relu_25
float[batch,640,36,36] relu_26
float[batch,160,36,36] relu_27
float[batch,160,36,36] relu_28
float[batch,640,36,36] relu_29
float[batch,80,72,72] relu_3
float[batch,160,36,36] relu_30
float[batch,160,36,36] relu_31
float[batch,640,36,36] relu_32
float[batch,320,36,36] relu_33
float[batch,320,36,36] relu_34
float[batch,1280,18,18] relu_35
float[batch,320,18,18] relu_36
float[batch,320,18,18] relu_37
float[batch,1280,18,18] relu_38
float[batch,320,18,18] relu_39
float[batch,80,72,72] relu_4
float[batch,320,18,18] relu_40
float[batch,1280,18,18] relu_41
float[batch,320,18,18] relu_42
float[batch,320,18,18] relu_43
float[batch,1280,18,18] relu_44
float[batch,320,18,18] relu_45
float[batch,320,18,18] relu_46
float[batch,1280,18,18] relu_47
float[batch,320,18,18] relu_48
float[batch,320,18,18] relu_49
float[batch,320,72,72] relu_5
float[batch,1280,18,18] relu_50
float[batch,320,18,18] relu_51
float[batch,320,18,18] relu_52
float[batch,1280,18,18] relu_53
float[batch,320,18,18] relu_54
float[batch,320,18,18] relu_55
float[batch,1280,18,18] relu_56
float[batch,320,18,18] relu_57
float[batch,320,18,18] relu_58
float[batch,1280,18,18] relu_59
float[batch,80,72,72] relu_6
float[batch,320,18,18] relu_60
float[batch,320,18,18] relu_61
float[batch,1280,18,18] relu_62
float[batch,640,18,18] relu_63
float[batch,640,18,18] relu_64
float[batch,2560,9,9] relu_65
float[batch,640,9,9] relu_66
float[batch,640,9,9] relu_67
float[batch,2560,9,9] relu_68
float[batch,640,9,9] relu_69
float[batch,80,72,72] relu_7
float[batch,640,9,9] relu_70
float[batch,2560,9,9] relu_71
float[batch,640,9,9] relu_72
float[batch,640,9,9] relu_73
float[batch,2560,9,9] relu_74
float[batch,640,9,9] relu_75
float[batch,640,9,9] relu_76
float[batch,2560,9,9] relu_77
float[batch,640,9,9] relu_78
float[batch,640,9,9] relu_79
float[batch,320,72,72] relu_8
float[batch,2560,9,9] relu_80
float[batch,80,72,72] relu_9
float[batch,40,1,64] scaled_dot_product_attention
float[batch,640] select
float[2560] split_split_0
float[2560] split_split_1
float[2560] split_split_2
float[unk__1,1,64] transpose
float[unk__1,82,64] transpose_1
float[unk__1,82,64] transpose_2
float[82,1,2560] unsqueeze
float[1,batch,2560] val_7
float[82,batch,2560] val_8
float[82,batch,2560] val_9
float[1,batch,640] view_10
float[batch,2560,81] view_2
float[1,unk__1,64] view_3
float[82,unk__1,64] view_4
float[82,unk__1,64] view_5
float[batch,40,1,64] view_6
float[batch,40,82,64] view_7
float[batch,40,82,64] view_8
float[batch,2560] view_9
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_shift] image_shifted = Sub (image_f32, image_shift)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_shifted)
getitem = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [2, 2]> (image_chw, "visual.conv1.weight", "visual.conv1.weight_bias")
[node_relu] relu = Relu (getitem)
getitem_3 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu, "visual.conv2.weight", "visual.conv2.weight_bias")
relu_1 = Relu (getitem_3)
getitem_6 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_1, "visual.conv3.weight", "visual.conv3.weight_bias")
relu_2 = Relu (getitem_6)
[node_avg_pool2d] avg_pool2d = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_2)
getitem_9 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.conv1.weight", "visual.layer1.0.conv1.weight_bias")
relu_3 = Relu (getitem_9)
getitem_12 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_3, "visual.layer1.0.conv2.weight", "visual.layer1.0.conv2.weight_bias")
relu_4 = Relu (getitem_12)
getitem_15 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_4, "visual.layer1.0.conv3.weight", "visual.layer1.0.conv3.weight_bias")
getitem_18 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d, "visual.layer1.0.downsample.0.weight", "visual.layer1.0.downsample.0.weight_bias")
add_140 = Add (getitem_15, getitem_18)
relu_5 = Relu (add_140)
getitem_21 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_5, "visual.layer1.1.conv1.weight", "visual.layer1.1.conv1.weight_bias")
relu_6 = Relu (getitem_21)
getitem_24 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_6, "visual.layer1.1.conv2.weight", "visual.layer1.1.conv2.weight_bias")
relu_7 = Relu (getitem_24)
getitem_27 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_7, "visual.layer1.1.conv3.weight", "visual.layer1.1.conv3.weight_bias")
add_216 = Add (getitem_27, relu_5)
relu_8 = Relu (add_216)
getitem_30 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_8, "visual.layer1.2.conv1.weight", "visual.layer1.2.conv1.weight_bias")
relu_9 = Relu (getitem_30)
getitem_33 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_9, "visual.layer1.2.conv2.weight", "visual.layer1.2.conv2.weight_bias")
relu_10 = Relu (getitem_33)
getitem_36 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_10, "visual.layer1.2.conv3.weight", "visual.layer1.2.conv3.weight_bias")
add_292 = Add (getitem_36, relu_8)
relu_11 = Relu (add_292)
getitem_39 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_11, "visual.layer1.3.conv1.weight", "visual.layer1.3.conv1.weight_bias")
relu_12 = Relu (getitem_39)
getitem_42 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_12, "visual.layer1.3.conv2.weight", "visual.layer1.3.conv2.weight_bias")
relu_13 = Relu (getitem_42)
getitem_45 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_13, "visual.layer1.3.conv3.weight", "visual.layer1.3.conv3.weight_bias")
add_368 = Add (getitem_45, relu_11)
relu_14 = Relu (add_368)
getitem_48 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_14, "visual.layer2.0.conv1.weight", "visual.layer2.0.conv1.weight_bias")
relu_15 = Relu (getitem_48)
getitem_51 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_15, "visual.layer2.0.conv2.weight", "visual.layer2.0.conv2.weight_bias")
relu_16 = Relu (getitem_51)
avg_pool2d_2 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_16)
getitem_54 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_2, "visual.layer2.0.conv3.weight", "visual.layer2.0.conv3.weight_bias")
avg_pool2d_3 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_14)
getitem_57 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_3, "visual.layer2.0.downsample.0.weight", "visual.layer2.0.downsample.0.weight_bias")
add_464 = Add (getitem_54, getitem_57)
relu_17 = Relu (add_464)
getitem_60 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_17, "visual.layer2.1.conv1.weight", "visual.layer2.1.conv1.weight_bias")
relu_18 = Relu (getitem_60)
getitem_63 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_18, "visual.layer2.1.conv2.weight", "visual.layer2.1.conv2.weight_bias")
relu_19 = Relu (getitem_63)
getitem_66 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_19, "visual.layer2.1.conv3.weight", "visual.layer2.1.conv3.weight_bias")
add_540 = Add (getitem_66, relu_17)
relu_20 = Relu (add_540)
getitem_69 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_20, "visual.layer2.2.conv1.weight", "visual.layer2.2.conv1.weight_bias")
relu_21 = Relu (getitem_69)
getitem_72 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_21, "visual.layer2.2.conv2.weight", "visual.layer2.2.conv2.weight_bias")
relu_22 = Relu (getitem_72)
getitem_75 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_22, "visual.layer2.2.conv3.weight", "visual.layer2.2.conv3.weight_bias")
add_616 = Add (getitem_75, relu_20)
relu_23 = Relu (add_616)
getitem_78 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_23, "visual.layer2.3.conv1.weight", "visual.layer2.3.conv1.weight_bias")
relu_24 = Relu (getitem_78)
getitem_81 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_24, "visual.layer2.3.conv2.weight", "visual.layer2.3.conv2.weight_bias")
relu_25 = Relu (getitem_81)
getitem_84 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_25, "visual.layer2.3.conv3.weight", "visual.layer2.3.conv3.weight_bias")
add_692 = Add (getitem_84, relu_23)
relu_26 = Relu (add_692)
getitem_87 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_26, "visual.layer2.4.conv1.weight", "visual.layer2.4.conv1.weight_bias")
relu_27 = Relu (getitem_87)
getitem_90 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_27, "visual.layer2.4.conv2.weight", "visual.layer2.4.conv2.weight_bias")
relu_28 = Relu (getitem_90)
getitem_93 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_28, "visual.layer2.4.conv3.weight", "visual.layer2.4.conv3.weight_bias")
add_768 = Add (getitem_93, relu_26)
relu_29 = Relu (add_768)
getitem_96 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_29, "visual.layer2.5.conv1.weight", "visual.layer2.5.conv1.weight_bias")
relu_30 = Relu (getitem_96)
getitem_99 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_30, "visual.layer2.5.conv2.weight", "visual.layer2.5.conv2.weight_bias")
relu_31 = Relu (getitem_99)
getitem_102 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_31, "visual.layer2.5.conv3.weight", "visual.layer2.5.conv3.weight_bias")
add_844 = Add (getitem_102, relu_29)
relu_32 = Relu (add_844)
getitem_105 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_32, "visual.layer3.0.conv1.weight", "visual.layer3.0.conv1.weight_bias")
relu_33 = Relu (getitem_105)
getitem_108 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_33, "visual.layer3.0.conv2.weight", "visual.layer3.0.conv2.weight_bias")
relu_34 = Relu (getitem_108)
avg_pool2d_4 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_34)
getitem_111 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_4, "visual.layer3.0.conv3.weight", "visual.layer3.0.conv3.weight_bias")
avg_pool2d_5 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_32)
getitem_114 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_5, "visual.layer3.0.downsample.0.weight", "visual.layer3.0.downsample.0.weight_bias")
add_940 = Add (getitem_111, getitem_114)
relu_35 = Relu (add_940)
getitem_117 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_35, "visual.layer3.1.conv1.weight", "visual.layer3.1.conv1.weight_bias")
relu_36 = Relu (getitem_117)
getitem_120 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_36, "visual.layer3.1.conv2.weight", "visual.layer3.1.conv2.weight_bias")
relu_37 = Relu (getitem_120)
getitem_123 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_37, "visual.layer3.1.conv3.weight", "visual.layer3.1.conv3.weight_bias")
add_1016 = Add (getitem_123, relu_35)
relu_38 = Relu (add_1016)
getitem_126 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_38, "visual.layer3.2.conv1.weight", "visual.layer3.2.conv1.weight_bias")
relu_39 = Relu (getitem_126)
getitem_129 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_39, "visual.layer3.2.conv2.weight", "visual.layer3.2.conv2.weight_bias")
relu_40 = Relu (getitem_129)
getitem_132 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_40, "visual.layer3.2.conv3.weight", "visual.layer3.2.conv3.weight_bias")
add_1092 = Add (getitem_132, relu_38)
relu_41 = Relu (add_1092)
getitem_135 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_41, "visual.layer3.3.conv1.weight", "visual.layer3.3.conv1.weight_bias")
relu_42 = Relu (getitem_135)
getitem_138 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_42, "visual.layer3.3.conv2.weight", "visual.layer3.3.conv2.weight_bias")
relu_43 = Relu (getitem_138)
getitem_141 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_43, "visual.layer3.3.conv3.weight", "visual.layer3.3.conv3.weight_bias")
add_1168 = Add (getitem_141, relu_41)
relu_44 = Relu (add_1168)
getitem_144 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_44, "visual.layer3.4.conv1.weight", "visual.layer3.4.conv1.weight_bias")
relu_45 = Relu (getitem_144)
getitem_147 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_45, "visual.layer3.4.conv2.weight", "visual.layer3.4.conv2.weight_bias")
relu_46 = Relu (getitem_147)
getitem_150 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_46, "visual.layer3.4.conv3.weight", "visual.layer3.4.conv3.weight_bias")
add_1244 = Add (getitem_150, relu_44)
relu_47 = Relu (add_1244)
getitem_153 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_47, "visual.layer3.5.conv1.weight", "visual.layer3.5.conv1.weight_bias")
relu_48 = Relu (getitem_153)
getitem_156 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_48, "visual.layer3.5.conv2.weight", "visual.layer3.5.conv2.weight_bias")
relu_49 = Relu (getitem_156)
getitem_159 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_49, "visual.layer3.5.conv3.weight", "visual.layer3.5.conv3.weight_bias")
add_1320 = Add (getitem_159, relu_47)
relu_50 = Relu (add_1320)
getitem_162 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_50, "visual.layer3.6.conv1.weight", "visual.layer3.6.conv1.weight_bias")
relu_51 = Relu (getitem_162)
getitem_165 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_51, "visual.layer3.6.conv2.weight", "visual.layer3.6.conv2.weight_bias")
relu_52 = Relu (getitem_165)
getitem_168 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_52, "visual.layer3.6.conv3.weight", "visual.layer3.6.conv3.weight_bias")
add_1396 = Add (getitem_168, relu_50)
relu_53 = Relu (add_1396)
getitem_171 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_53, "visual.layer3.7.conv1.weight", "visual.layer3.7.conv1.weight_bias")
relu_54 = Relu (getitem_171)
getitem_174 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_54, "visual.layer3.7.conv2.weight", "visual.layer3.7.conv2.weight_bias")
relu_55 = Relu (getitem_174)
getitem_177 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_55, "visual.layer3.7.conv3.weight", "visual.layer3.7.conv3.weight_bias")
add_1472 = Add (getitem_177, relu_53)
relu_56 = Relu (add_1472)
getitem_180 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_56, "visual.layer3.8.conv1.weight", "visual.layer3.8.conv1.weight_bias")
relu_57 = Relu (getitem_180)
getitem_183 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_57, "visual.layer3.8.conv2.weight", "visual.layer3.8.conv2.weight_bias")
relu_58 = Relu (getitem_183)
getitem_186 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_58, "visual.layer3.8.conv3.weight", "visual.layer3.8.conv3.weight_bias")
add_1548 = Add (getitem_186, relu_56)
relu_59 = Relu (add_1548)
getitem_189 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_59, "visual.layer3.9.conv1.weight", "visual.layer3.9.conv1.weight_bias")
relu_60 = Relu (getitem_189)
getitem_192 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_60, "visual.layer3.9.conv2.weight", "visual.layer3.9.conv2.weight_bias")
relu_61 = Relu (getitem_192)
getitem_195 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_61, "visual.layer3.9.conv3.weight", "visual.layer3.9.conv3.weight_bias")
add_1624 = Add (getitem_195, relu_59)
relu_62 = Relu (add_1624)
getitem_198 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_62, "visual.layer4.0.conv1.weight", "visual.layer4.0.conv1.weight_bias")
relu_63 = Relu (getitem_198)
getitem_201 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_63, "visual.layer4.0.conv2.weight", "visual.layer4.0.conv2.weight_bias")
relu_64 = Relu (getitem_201)
avg_pool2d_6 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_64)
getitem_204 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_6, "visual.layer4.0.conv3.weight", "visual.layer4.0.conv3.weight_bias")
avg_pool2d_7 = AveragePool <auto_pad: string = "NOTSET", ceil_mode: int = 0, count_include_pad: int = 1, kernel_shape: ints = [2, 2], pads: ints = [0, 0, 0, 0], strides: ints = [2, 2]> (relu_62)
getitem_207 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (avg_pool2d_7, "visual.layer4.0.downsample.0.weight", "visual.layer4.0.downsample.0.weight_bias")
add_1720 = Add (getitem_204, getitem_207)
relu_65 = Relu (add_1720)
getitem_210 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_65, "visual.layer4.1.conv1.weight", "visual.layer4.1.conv1.weight_bias")
relu_66 = Relu (getitem_210)
getitem_213 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_66, "visual.layer4.1.conv2.weight", "visual.layer4.1.conv2.weight_bias")
relu_67 = Relu (getitem_213)
getitem_216 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_67, "visual.layer4.1.conv3.weight", "visual.layer4.1.conv3.weight_bias")
add_1796 = Add (getitem_216, relu_65)
relu_68 = Relu (add_1796)
getitem_219 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_68, "visual.layer4.2.conv1.weight", "visual.layer4.2.conv1.weight_bias")
relu_69 = Relu (getitem_219)
getitem_222 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_69, "visual.layer4.2.conv2.weight", "visual.layer4.2.conv2.weight_bias")
relu_70 = Relu (getitem_222)
getitem_225 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_70, "visual.layer4.2.conv3.weight", "visual.layer4.2.conv3.weight_bias")
add_1872 = Add (getitem_225, relu_68)
relu_71 = Relu (add_1872)
getitem_228 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_71, "visual.layer4.3.conv1.weight", "visual.layer4.3.conv1.weight_bias")
relu_72 = Relu (getitem_228)
getitem_231 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_72, "visual.layer4.3.conv2.weight", "visual.layer4.3.conv2.weight_bias")
relu_73 = Relu (getitem_231)
getitem_234 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_73, "visual.layer4.3.conv3.weight", "visual.layer4.3.conv3.weight_bias")
add_1948 = Add (getitem_234, relu_71)
relu_74 = Relu (add_1948)
getitem_237 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_74, "visual.layer4.4.conv1.weight", "visual.layer4.4.conv1.weight_bias")
relu_75 = Relu (getitem_237)
getitem_240 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_75, "visual.layer4.4.conv2.weight", "visual.layer4.4.conv2.weight_bias")
relu_76 = Relu (getitem_240)
getitem_243 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_76, "visual.layer4.4.conv3.weight", "visual.layer4.4.conv3.weight_bias")
add_2024 = Add (getitem_243, relu_74)
relu_77 = Relu (add_2024)
getitem_246 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_77, "visual.layer4.5.conv1.weight", "visual.layer4.5.conv1.weight_bias")
relu_78 = Relu (getitem_246)
getitem_249 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [1, 1, 1, 1], strides: ints = [1, 1]> (relu_78, "visual.layer4.5.conv2.weight", "visual.layer4.5.conv2.weight_bias")
relu_79 = Relu (getitem_249)
getitem_252 = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [1, 1]> (relu_79, "visual.layer4.5.conv3.weight", "visual.layer4.5.conv3.weight_bias")
add_2100 = Add (getitem_252, relu_77)
relu_80 = Relu (add_2100)
view_2 = Reshape <allowzero: int = 1> (relu_80, view_2_target)
permute_1 = Transpose <perm: ints = [2, 0, 1]> (view_2)
[node_mean] mean = ReduceMean <keepdims: int = 1, noop_with_empty_axes: int = 0> (permute_1, val_0)
[node_cat] cat = Concat <axis: int = 0> (mean, permute_1)
[node_unsqueeze] unsqueeze = Unsqueeze ("visual.attnpool.positional_embedding", val_3)
add_2130 = Add (cat, unsqueeze)
split_split_0, split_split_1, split_split_2 = Split <axis: int = 0, num_outputs: int = 3> (cat_1)
node_scaled_dot_product_attention_q_row = Slice (add_2130, val_0, val_3, val_0)
val_7 = MatMul (node_scaled_dot_product_attention_q_row, val_4)
[node_linear] linear = Add (val_7, split_split_0)
val_8 = MatMul (add_2130, val_5)
linear_1 = Add (val_8, split_split_1)
val_9 = MatMul (add_2130, val_6)
linear_2 = Add (val_9, split_split_2)
view_3 = Reshape <allowzero: int = 1> (linear, node_scaled_dot_product_attention_q_unpack_1)
[node_transpose] transpose = Transpose <perm: ints = [1, 0, 2]> (view_3)
view_4 = Reshape <allowzero: int = 1> (linear_1, view_4_target)
transpose_1 = Transpose <perm: ints = [1, 0, 2]> (view_4)
view_5 = Reshape <allowzero: int = 1> (linear_2, view_4_target)
transpose_2 = Transpose <perm: ints = [1, 0, 2]> (view_5)
view_6 = Reshape <allowzero: int = 1> (transpose, node_scaled_dot_product_attention_q_pack_1)
view_7 = Reshape <allowzero: int = 1> (transpose_1, view_7_target)
view_8 = Reshape <allowzero: int = 1> (transpose_2, view_7_target)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, qk_matmul_output_mode: int = 0, softcap: float = 0> (view_6, view_7, view_8)
permute_2 = Transpose <perm: ints = [2, 0, 1, 3]> (scaled_dot_product_attention)
view_9 = Reshape <allowzero: int = 1> (permute_2, view_9_target)
linear_3 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (view_9, "visual.attnpool.c_proj.weight", "visual.attnpool.c_proj.bias")
view_10 = Reshape <allowzero: int = 1> (linear_3, node_scaled_dot_product_attention_out_1)
select = Squeeze (view_10, val_0)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_1)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_2)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
cat_1 FLOAT[7680] 02169d887c20
image_shift FLOAT[3] 2f7a50e604ad
node_scaled_dot_product_attention_out_1 INT64[3] b21750a40eac
node_scaled_dot_product_attention_q_pack_1 INT64[4] 41b931e3a504
node_scaled_dot_product_attention_q_unpack_1 INT64[3] cfe34a386daf
val_0 INT64[1] af5570f5a181
val_1 INT64[1] 12a3ae445661
val_2 FLOAT[] 6708d9be4956
val_3 INT64[1] 7c9fa136d441
val_4 FLOAT[2560,2560] 5736c74beb1f
val_5 FLOAT[2560,2560] 807f60e16206
val_6 FLOAT[2560,2560] 333bff0cb9dd
view_2_target INT64[3] e683a94499f2
view_4_target INT64[3] f5e12c71e402
view_7_target INT64[4] 86d1b5aa033a
view_9_target INT64[2] 3025738d86fc
visual.attnpool.c_proj.bias FLOAT[640] 4d3b7acccb96
visual.attnpool.c_proj.weight FLOAT[640,2560] 6d7b8c46e6dc
visual.attnpool.positional_embedding FLOAT[82,2560] 4e5b4b84ec32
visual.conv1.weight FLOAT[40,3,3,3] 4a386e67fdd2
visual.conv1.weight_bias FLOAT[40] 6ad8e26f520b
visual.conv2.weight FLOAT[40,40,3,3] ac78538072a8
visual.conv2.weight_bias FLOAT[40] 377f0867cf6b
visual.conv3.weight FLOAT[80,40,3,3] 95a868052faa
visual.conv3.weight_bias FLOAT[80] af4be2ff044c
visual.layer1.0.conv1.weight FLOAT[80,80,1,1] f7afa8453060
visual.layer1.0.conv1.weight_bias FLOAT[80] 866d62b981bf
visual.layer1.0.conv2.weight FLOAT[80,80,3,3] 1310e8499d9d
visual.layer1.0.conv2.weight_bias FLOAT[80] 91860eb8af5e
visual.layer1.0.conv3.weight FLOAT[320,80,1,1] 9d8938f44c04
visual.layer1.0.conv3.weight_bias FLOAT[320] 589af9f55891
visual.layer1.0.downsample.0.weight FLOAT[320,80,1,1] 4db2473f8977
visual.layer1.0.downsample.0.weight_bias FLOAT[320] 7f8e2faad82a
visual.layer1.1.conv1.weight FLOAT[80,320,1,1] 0ccef24c1d1d
visual.layer1.1.conv1.weight_bias FLOAT[80] 4d9797922307
visual.layer1.1.conv2.weight FLOAT[80,80,3,3] 38cbb92174e8
visual.layer1.1.conv2.weight_bias FLOAT[80] 68e905e8d6c4
visual.layer1.1.conv3.weight FLOAT[320,80,1,1] c13440312ce1
visual.layer1.1.conv3.weight_bias FLOAT[320] fe14ec8ce307
visual.layer1.2.conv1.weight FLOAT[80,320,1,1] be2bd4d6a1ec
visual.layer1.2.conv1.weight_bias FLOAT[80] 522a0b846fa3
visual.layer1.2.conv2.weight FLOAT[80,80,3,3] cd372c100e00
visual.layer1.2.conv2.weight_bias FLOAT[80] 538bb51da6f1
visual.layer1.2.conv3.weight FLOAT[320,80,1,1] 1d3796a33fa0
visual.layer1.2.conv3.weight_bias FLOAT[320] efe66252832c
visual.layer1.3.conv1.weight FLOAT[80,320,1,1] 3aa3e6a35926
visual.layer1.3.conv1.weight_bias FLOAT[80] 83677b1c3ca8
visual.layer1.3.conv2.weight FLOAT[80,80,3,3] a6f6176464f2
visual.layer1.3.conv2.weight_bias FLOAT[80] 7f644086a61c
visual.layer1.3.conv3.weight FLOAT[320,80,1,1] aaa8c1b7386e
visual.layer1.3.conv3.weight_bias FLOAT[320] 221986494af2
visual.layer2.0.conv1.weight FLOAT[160,320,1,1] d3f082c1c0a9
visual.layer2.0.conv1.weight_bias FLOAT[160] 353cbbb2b24f
visual.layer2.0.conv2.weight FLOAT[160,160,3,3] 544b55967be2
visual.layer2.0.conv2.weight_bias FLOAT[160] 023b41e7a379
visual.layer2.0.conv3.weight FLOAT[640,160,1,1] 4f2153d63cca
visual.layer2.0.conv3.weight_bias FLOAT[640] 5d50beb52d55
visual.layer2.0.downsample.0.weight FLOAT[640,320,1,1] 91e4799418bb
visual.layer2.0.downsample.0.weight_bias FLOAT[640] dc8d9e6d4c06
visual.layer2.1.conv1.weight FLOAT[160,640,1,1] c151f9e73b96
visual.layer2.1.conv1.weight_bias FLOAT[160] cde450425808
visual.layer2.1.conv2.weight FLOAT[160,160,3,3] 025f68e48711
visual.layer2.1.conv2.weight_bias FLOAT[160] 2ca1b70ffad6
visual.layer2.1.conv3.weight FLOAT[640,160,1,1] 76e42669cdd6
visual.layer2.1.conv3.weight_bias FLOAT[640] 884817f9aede
visual.layer2.2.conv1.weight FLOAT[160,640,1,1] 30ec5fd76c17
visual.layer2.2.conv1.weight_bias FLOAT[160] d0362b26a192
visual.layer2.2.conv2.weight FLOAT[160,160,3,3] 7b688ff53813
visual.layer2.2.conv2.weight_bias FLOAT[160] ca81004391c8
visual.layer2.2.conv3.weight FLOAT[640,160,1,1] 839306ce4136
visual.layer2.2.conv3.weight_bias FLOAT[640] e4d7afce43e6
visual.layer2.3.conv1.weight FLOAT[160,640,1,1] d80e864a0a4c
visual.layer2.3.conv1.weight_bias FLOAT[160] 480235497d03
visual.layer2.3.conv2.weight FLOAT[160,160,3,3] 967c0966ecfd
visual.layer2.3.conv2.weight_bias FLOAT[160] 5fbd467bf6f7
visual.layer2.3.conv3.weight FLOAT[640,160,1,1] 106e262c4cc5
visual.layer2.3.conv3.weight_bias FLOAT[640] 19e0452cda66
visual.layer2.4.conv1.weight FLOAT[160,640,1,1] 55dd4a366f91
visual.layer2.4.conv1.weight_bias FLOAT[160] 5a211fd53822
visual.layer2.4.conv2.weight FLOAT[160,160,3,3] 332eb3a9b445
visual.layer2.4.conv2.weight_bias FLOAT[160] 889013bce33d
visual.layer2.4.conv3.weight FLOAT[640,160,1,1] 11f216f8878c
visual.layer2.4.conv3.weight_bias FLOAT[640] 369e31603c86
visual.layer2.5.conv1.weight FLOAT[160,640,1,1] 0c36b49d617f
visual.layer2.5.conv1.weight_bias FLOAT[160] 1175dc26bf07
visual.layer2.5.conv2.weight FLOAT[160,160,3,3] c2edefe8a076
visual.layer2.5.conv2.weight_bias FLOAT[160] dd5b8845c661
visual.layer2.5.conv3.weight FLOAT[640,160,1,1] 14d8860297e9
visual.layer2.5.conv3.weight_bias FLOAT[640] c446651da8f0
visual.layer3.0.conv1.weight FLOAT[320,640,1,1] f5a990de992d
visual.layer3.0.conv1.weight_bias FLOAT[320] 0235023ba0ad
visual.layer3.0.conv2.weight FLOAT[320,320,3,3] 6e73d63f4b16
visual.layer3.0.conv2.weight_bias FLOAT[320] d7721389a5f0
visual.layer3.0.conv3.weight FLOAT[1280,320,1,1] 746bab2fd6cd
visual.layer3.0.conv3.weight_bias FLOAT[1280] e25ef9157441
visual.layer3.0.downsample.0.weight FLOAT[1280,640,1,1] 86030ba75d04
visual.layer3.0.downsample.0.weight_bias FLOAT[1280] d6a86911f0f6
visual.layer3.1.conv1.weight FLOAT[320,1280,1,1] 2f6f67c747c2
visual.layer3.1.conv1.weight_bias FLOAT[320] 824000bc75ff
visual.layer3.1.conv2.weight FLOAT[320,320,3,3] 9a10c085b1d1
visual.layer3.1.conv2.weight_bias FLOAT[320] 874f690d69d1
visual.layer3.1.conv3.weight FLOAT[1280,320,1,1] 03bdfa3ab5bb
visual.layer3.1.conv3.weight_bias FLOAT[1280] 86311c514a66
visual.layer3.2.conv1.weight FLOAT[320,1280,1,1] 951843e6d211
visual.layer3.2.conv1.weight_bias FLOAT[320] feb7ff50c0b7
visual.layer3.2.conv2.weight FLOAT[320,320,3,3] 0f44f61100a9
visual.layer3.2.conv2.weight_bias FLOAT[320] 9d9e06c43296
visual.layer3.2.conv3.weight FLOAT[1280,320,1,1] 5999d26f258e
visual.layer3.2.conv3.weight_bias FLOAT[1280] ed0aaf7203dd
visual.layer3.3.conv1.weight FLOAT[320,1280,1,1] dafafc657e88
visual.layer3.3.conv1.weight_bias FLOAT[320] 1176fe66caaa
visual.layer3.3.conv2.weight FLOAT[320,320,3,3] db1b02a33a4a
visual.layer3.3.conv2.weight_bias FLOAT[320] 53392a38af4a
visual.layer3.3.conv3.weight FLOAT[1280,320,1,1] e36cbcc31e2c
visual.layer3.3.conv3.weight_bias FLOAT[1280] 1541dfa1e41a
visual.layer3.4.conv1.weight FLOAT[320,1280,1,1] 8f8c81061c7c
visual.layer3.4.conv1.weight_bias FLOAT[320] 3854f1f443cf
visual.layer3.4.conv2.weight FLOAT[320,320,3,3] e4f849d0d567
visual.layer3.4.conv2.weight_bias FLOAT[320] fff84395cc79
visual.layer3.4.conv3.weight FLOAT[1280,320,1,1] 99b81459dd34
visual.layer3.4.conv3.weight_bias FLOAT[1280] 4807455e3030
visual.layer3.5.conv1.weight FLOAT[320,1280,1,1] 2563338ceed2
visual.layer3.5.conv1.weight_bias FLOAT[320] bae4b2eb7da0
visual.layer3.5.conv2.weight FLOAT[320,320,3,3] 99ffb589312a
visual.layer3.5.conv2.weight_bias FLOAT[320] 1555dd4e2d6c
visual.layer3.5.conv3.weight FLOAT[1280,320,1,1] d2ebc477974d
visual.layer3.5.conv3.weight_bias FLOAT[1280] 0368a82b8e54
visual.layer3.6.conv1.weight FLOAT[320,1280,1,1] 9fc75976ab26
visual.layer3.6.conv1.weight_bias FLOAT[320] ceeb7d39dd5e
visual.layer3.6.conv2.weight FLOAT[320,320,3,3] f78f55346989
visual.layer3.6.conv2.weight_bias FLOAT[320] 3e075e4d8b53
visual.layer3.6.conv3.weight FLOAT[1280,320,1,1] 48833c16cffd
visual.layer3.6.conv3.weight_bias FLOAT[1280] 02a6d55f39a8
visual.layer3.7.conv1.weight FLOAT[320,1280,1,1] ef6a96929d87
visual.layer3.7.conv1.weight_bias FLOAT[320] 3495a266ae82
visual.layer3.7.conv2.weight FLOAT[320,320,3,3] 0ac3ec729e91
visual.layer3.7.conv2.weight_bias FLOAT[320] 9cb6228ab5d1
visual.layer3.7.conv3.weight FLOAT[1280,320,1,1] 3d1ce4907c99
visual.layer3.7.conv3.weight_bias FLOAT[1280] a3ae7ebadbc7
visual.layer3.8.conv1.weight FLOAT[320,1280,1,1] f3811c60495e
visual.layer3.8.conv1.weight_bias FLOAT[320] e136d6d7d163
visual.layer3.8.conv2.weight FLOAT[320,320,3,3] ec205c5dc010
visual.layer3.8.conv2.weight_bias FLOAT[320] f4bd4db0da5a
visual.layer3.8.conv3.weight FLOAT[1280,320,1,1] 0593faa437ca
visual.layer3.8.conv3.weight_bias FLOAT[1280] 9c82ea3d7ccb
visual.layer3.9.conv1.weight FLOAT[320,1280,1,1] c977a533043d
visual.layer3.9.conv1.weight_bias FLOAT[320] 9136d344bc61
visual.layer3.9.conv2.weight FLOAT[320,320,3,3] 43ba83570b84
visual.layer3.9.conv2.weight_bias FLOAT[320] 6aa806f51ee3
visual.layer3.9.conv3.weight FLOAT[1280,320,1,1] 58e8f3c33d2c
visual.layer3.9.conv3.weight_bias FLOAT[1280] 6e4e0dd7cdac
visual.layer4.0.conv1.weight FLOAT[640,1280,1,1] 33a2c2acf487
visual.layer4.0.conv1.weight_bias FLOAT[640] 56be1d72f013
visual.layer4.0.conv2.weight FLOAT[640,640,3,3] 313d718da807
visual.layer4.0.conv2.weight_bias FLOAT[640] 95c74759dfa0
visual.layer4.0.conv3.weight FLOAT[2560,640,1,1] 2eddcb356cd8
visual.layer4.0.conv3.weight_bias FLOAT[2560] dfc87fff3ef3
visual.layer4.0.downsample.0.weight FLOAT[2560,1280,1,1] 09a5f300d26c
visual.layer4.0.downsample.0.weight_bias FLOAT[2560] 0e098493ee4e
visual.layer4.1.conv1.weight FLOAT[640,2560,1,1] 94c1aeafc762
visual.layer4.1.conv1.weight_bias FLOAT[640] 08094d255cce
visual.layer4.1.conv2.weight FLOAT[640,640,3,3] 3f72aceb695f
visual.layer4.1.conv2.weight_bias FLOAT[640] 6628fd335b62
visual.layer4.1.conv3.weight FLOAT[2560,640,1,1] 8ee2318d0de5
visual.layer4.1.conv3.weight_bias FLOAT[2560] 8b2f3c1e4c92
visual.layer4.2.conv1.weight FLOAT[640,2560,1,1] 526c6edce078
visual.layer4.2.conv1.weight_bias FLOAT[640] 0ee11ab4bea3
visual.layer4.2.conv2.weight FLOAT[640,640,3,3] 3494c6a22e6e
visual.layer4.2.conv2.weight_bias FLOAT[640] a84b968e63e7
visual.layer4.2.conv3.weight FLOAT[2560,640,1,1] efaabe1c4a46
visual.layer4.2.conv3.weight_bias FLOAT[2560] 81e2d50ebf23
visual.layer4.3.conv1.weight FLOAT[640,2560,1,1] 3daeaf9b14fb
visual.layer4.3.conv1.weight_bias FLOAT[640] de2343bfbf05
visual.layer4.3.conv2.weight FLOAT[640,640,3,3] 3071670ac1a7
visual.layer4.3.conv2.weight_bias FLOAT[640] e59dfae7d259
visual.layer4.3.conv3.weight FLOAT[2560,640,1,1] a4832de03edd
visual.layer4.3.conv3.weight_bias FLOAT[2560] c7d4f70002be
visual.layer4.4.conv1.weight FLOAT[640,2560,1,1] 1ad51144187d
visual.layer4.4.conv1.weight_bias FLOAT[640] 2198dc6ac1c9
visual.layer4.4.conv2.weight FLOAT[640,640,3,3] 8355b0ebc706
visual.layer4.4.conv2.weight_bias FLOAT[640] b61e3126993f
visual.layer4.4.conv3.weight FLOAT[2560,640,1,1] 90cea2f1097c
visual.layer4.4.conv3.weight_bias FLOAT[2560] 60ade73a4090
visual.layer4.5.conv1.weight FLOAT[640,2560,1,1] 858b46edcf37
visual.layer4.5.conv1.weight_bias FLOAT[640] 75532c664d13
visual.layer4.5.conv2.weight FLOAT[640,640,3,3] 6e6673b1b765
visual.layer4.5.conv2.weight_bias FLOAT[640] 89df48a1dfc3
visual.layer4.5.conv3.weight FLOAT[2560,640,1,1] 63058554a723
visual.layer4.5.conv3.weight_bias FLOAT[2560] 44e46e36b5ac
+625
View File
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,1024] text_embedding)
<
float[batch,77,1024] add_1012
float[batch,77,1024] add_1127
float[batch,77,1024] add_1156
float[batch,77,1024] add_119
float[batch,77,1024] add_1271
float[batch,77,1024] add_1300
float[batch,77,1024] add_1415
float[batch,77,1024] add_1444
float[batch,77,1024] add_148
float[batch,77,1024] add_1559
float[batch,77,1024] add_1588
float[batch,1,1024] add_1588_pooled
float[batch,1,1024] add_1703
float[batch,1,1024] add_1732
float[batch,77,1024] add_263
float[batch,77,1024] add_292
float[batch,77,1024] add_4
float[batch,77,1024] add_407
float[batch,77,1024] add_436
float[batch,77,1024] add_551
float[batch,77,1024] add_580
float[batch,77,1024] add_695
float[batch,77,1024] add_724
float[batch,77,1024] add_839
float[batch,77,1024] add_868
float[batch,77,1024] add_983
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,1024] embedding
float[batch,77,1024] layer_norm
float[batch,77,1024] layer_norm_1
float[batch,77,1024] layer_norm_10
float[batch,77,1024] layer_norm_11
float[batch,77,1024] layer_norm_12
float[batch,77,1024] layer_norm_13
float[batch,77,1024] layer_norm_14
float[batch,77,1024] layer_norm_15
float[batch,77,1024] layer_norm_16
float[batch,77,1024] layer_norm_17
float[batch,77,1024] layer_norm_18
float[batch,77,1024] layer_norm_19
float[batch,77,1024] layer_norm_2
float[batch,77,1024] layer_norm_20
float[batch,77,1024] layer_norm_21
float[batch,77,1024] layer_norm_22
float[batch,1,1024] layer_norm_23
float[batch,77,1024] layer_norm_3
float[batch,77,1024] layer_norm_4
float[batch,77,1024] layer_norm_5
float[batch,77,1024] layer_norm_6
float[batch,77,1024] layer_norm_7
float[batch,77,1024] layer_norm_8
float[batch,77,1024] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,4096] linear_10
float[batch,77,1024] linear_11
float[batch,77,4096] linear_14
float[batch,77,1024] linear_15
float[batch,77,4096] linear_18
float[batch,77,1024] linear_19
float[batch,77,4096] linear_2
float[batch,77,4096] linear_22
float[batch,77,1024] linear_23
float[batch,77,4096] linear_26
float[batch,77,1024] linear_27
float[batch,77,1024] linear_3
float[batch,77,4096] linear_30
float[batch,77,1024] linear_31
float[batch,77,4096] linear_34
float[batch,77,1024] linear_35
float[batch,77,4096] linear_38
float[batch,77,1024] linear_39
float[batch,77,4096] linear_42
float[batch,77,1024] linear_43
float[batch,1,4096] linear_46
float[batch,1,1024] linear_47
float[batch,77,4096] linear_6
float[batch,77,1024] linear_7
float[batch,1024] matmul
float[batch,77,4096] mul_101
float[batch,77,4096] mul_106
float[batch,77,4096] mul_1064
float[batch,77,4096] mul_1069
float[batch,77,4096] mul_1171
float[batch,77,4096] mul_1176
float[batch,1,4096] mul_1278
float[batch,1,4096] mul_1283
float[batch,77,4096] mul_208
float[batch,77,4096] mul_213
float[batch,77,4096] mul_315
float[batch,77,4096] mul_320
float[batch,77,4096] mul_422
float[batch,77,4096] mul_427
float[batch,77,4096] mul_529
float[batch,77,4096] mul_534
float[batch,77,4096] mul_636
float[batch,77,4096] mul_641
float[batch,77,4096] mul_743
float[batch,77,4096] mul_748
float[batch,77,4096] mul_850
float[batch,77,4096] mul_855
float[batch,77,4096] mul_957
float[batch,77,4096] mul_962
float[batch,77,1024] node_scaled_dot_product_attention_10_k
float[batch,77,1024] node_scaled_dot_product_attention_10_out
float[batch,77,1024] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_10_q
float[batch,77,3072] node_scaled_dot_product_attention_10_qkv
float[batch,77,3072] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_10_v
float[batch,77,1024] node_scaled_dot_product_attention_11_k
float[batch,1,1024] node_scaled_dot_product_attention_11_out
float[batch,1,1024] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_11_q
float[batch,77,3072] node_scaled_dot_product_attention_11_qkv
float[batch,77,3072] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_11_v
float[batch,77,1024] node_scaled_dot_product_attention_1_k
float[batch,77,1024] node_scaled_dot_product_attention_1_out
float[batch,77,1024] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_1_q
float[batch,77,3072] node_scaled_dot_product_attention_1_qkv
float[batch,77,3072] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_1_v
float[batch,77,1024] node_scaled_dot_product_attention_2_k
float[batch,77,1024] node_scaled_dot_product_attention_2_out
float[batch,77,1024] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_2_q
float[batch,77,3072] node_scaled_dot_product_attention_2_qkv
float[batch,77,3072] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_2_v
float[batch,77,1024] node_scaled_dot_product_attention_3_k
float[batch,77,1024] node_scaled_dot_product_attention_3_out
float[batch,77,1024] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_3_q
float[batch,77,3072] node_scaled_dot_product_attention_3_qkv
float[batch,77,3072] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_3_v
float[batch,77,1024] node_scaled_dot_product_attention_4_k
float[batch,77,1024] node_scaled_dot_product_attention_4_out
float[batch,77,1024] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_4_q
float[batch,77,3072] node_scaled_dot_product_attention_4_qkv
float[batch,77,3072] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_4_v
float[batch,77,1024] node_scaled_dot_product_attention_5_k
float[batch,77,1024] node_scaled_dot_product_attention_5_out
float[batch,77,1024] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_5_q
float[batch,77,3072] node_scaled_dot_product_attention_5_qkv
float[batch,77,3072] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_5_v
float[batch,77,1024] node_scaled_dot_product_attention_6_k
float[batch,77,1024] node_scaled_dot_product_attention_6_out
float[batch,77,1024] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_6_q
float[batch,77,3072] node_scaled_dot_product_attention_6_qkv
float[batch,77,3072] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_6_v
float[batch,77,1024] node_scaled_dot_product_attention_7_k
float[batch,77,1024] node_scaled_dot_product_attention_7_out
float[batch,77,1024] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_7_q
float[batch,77,3072] node_scaled_dot_product_attention_7_qkv
float[batch,77,3072] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_7_v
float[batch,77,1024] node_scaled_dot_product_attention_8_k
float[batch,77,1024] node_scaled_dot_product_attention_8_out
float[batch,77,1024] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_8_q
float[batch,77,3072] node_scaled_dot_product_attention_8_qkv
float[batch,77,3072] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_8_v
float[batch,77,1024] node_scaled_dot_product_attention_9_k
float[batch,77,1024] node_scaled_dot_product_attention_9_out
float[batch,77,1024] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_9_q
float[batch,77,3072] node_scaled_dot_product_attention_9_qkv
float[batch,77,3072] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_9_v
float[batch,77,1024] node_scaled_dot_product_attention_k
float[batch,77,1024] node_scaled_dot_product_attention_out
float[batch,77,1024] node_scaled_dot_product_attention_out_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_q
float[batch,77,3072] node_scaled_dot_product_attention_qkv
float[batch,77,3072] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,1024] node_scaled_dot_product_attention_v
float[batch,77,1024] scaled_dot_product_attention
float[batch,77,1024] scaled_dot_product_attention_1
float[batch,77,1024] scaled_dot_product_attention_10
float[batch,77,1024] scaled_dot_product_attention_11
float[batch,1,1024] scaled_dot_product_attention_11_pooled
float[batch,77,1024] scaled_dot_product_attention_2
float[batch,77,1024] scaled_dot_product_attention_3
float[batch,77,1024] scaled_dot_product_attention_4
float[batch,77,1024] scaled_dot_product_attention_5
float[batch,77,1024] scaled_dot_product_attention_6
float[batch,77,1024] scaled_dot_product_attention_7
float[batch,77,1024] scaled_dot_product_attention_8
float[batch,77,1024] scaled_dot_product_attention_9
float[batch,77,4096] sigmoid
float[batch,77,4096] sigmoid_1
float[batch,77,4096] sigmoid_10
float[batch,1,4096] sigmoid_11
float[batch,77,4096] sigmoid_2
float[batch,77,4096] sigmoid_3
float[batch,77,4096] sigmoid_4
float[batch,77,4096] sigmoid_5
float[batch,77,4096] sigmoid_6
float[batch,77,4096] sigmoid_7
float[batch,77,4096] sigmoid_8
float[batch,77,4096] sigmoid_9
float[batch,77,4096] val_40
float[batch,77,1024] val_41
float[batch,77,4096] val_42
float[batch,77,1024] val_43
float[batch,77,4096] val_44
float[batch,77,1024] val_45
float[batch,77,4096] val_46
float[batch,77,1024] val_47
float[batch,77,4096] val_48
float[batch,77,1024] val_49
float[batch,77,4096] val_50
float[batch,77,1024] val_51
float[batch,77,4096] val_52
float[batch,77,1024] val_53
float[batch,77,4096] val_54
float[batch,77,1024] val_55
float[batch,77,4096] val_56
float[batch,77,1024] val_57
float[batch,77,4096] val_58
float[batch,77,1024] val_59
float[batch,77,4096] val_60
float[batch,77,1024] val_61
float[batch,77] val_62
float[batch,1,77] val_63
float[batch,1,4096] val_64
float[batch,1,1024] val_65
float[batch,1,1024] val_66
float[batch,1024] val_67
>
{
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_39)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x1024)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_40 = MatMul (layer_norm_1, val_4)
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
mul_101 = Mul (linear_2, val_2)
[node_sigmoid] sigmoid = Sigmoid (mul_101)
mul_106 = Mul (linear_2, sigmoid)
val_41 = MatMul (mul_106, val_5)
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
add_148 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_42 = MatMul (layer_norm_3, val_7)
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
mul_208 = Mul (linear_6, val_2)
sigmoid_1 = Sigmoid (mul_208)
mul_213 = Mul (linear_6, sigmoid_1)
val_43 = MatMul (mul_213, val_8)
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
add_292 = Add (add_263, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_44 = MatMul (layer_norm_5, val_10)
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
mul_315 = Mul (linear_10, val_2)
sigmoid_2 = Sigmoid (mul_315)
mul_320 = Mul (linear_10, sigmoid_2)
val_45 = MatMul (mul_320, val_11)
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
add_436 = Add (add_407, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_46 = MatMul (layer_norm_7, val_13)
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
mul_422 = Mul (linear_14, val_2)
sigmoid_3 = Sigmoid (mul_422)
mul_427 = Mul (linear_14, sigmoid_3)
val_47 = MatMul (mul_427, val_14)
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
add_580 = Add (add_551, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_48 = MatMul (layer_norm_9, val_16)
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
mul_529 = Mul (linear_18, val_2)
sigmoid_4 = Sigmoid (mul_529)
mul_534 = Mul (linear_18, sigmoid_4)
val_49 = MatMul (mul_534, val_17)
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
add_724 = Add (add_695, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_50 = MatMul (layer_norm_11, val_19)
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
mul_636 = Mul (linear_22, val_2)
sigmoid_5 = Sigmoid (mul_636)
mul_641 = Mul (linear_22, sigmoid_5)
val_51 = MatMul (mul_641, val_20)
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
add_868 = Add (add_839, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_52 = MatMul (layer_norm_13, val_22)
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
mul_743 = Mul (linear_26, val_2)
sigmoid_6 = Sigmoid (mul_743)
mul_748 = Mul (linear_26, sigmoid_6)
val_53 = MatMul (mul_748, val_23)
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
add_1012 = Add (add_983, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_54 = MatMul (layer_norm_15, val_25)
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
mul_850 = Mul (linear_30, val_2)
sigmoid_7 = Sigmoid (mul_850)
mul_855 = Mul (linear_30, sigmoid_7)
val_55 = MatMul (mul_855, val_26)
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
add_1156 = Add (add_1127, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_56 = MatMul (layer_norm_17, val_28)
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
mul_957 = Mul (linear_34, val_2)
sigmoid_8 = Sigmoid (mul_957)
mul_962 = Mul (linear_34, sigmoid_8)
val_57 = MatMul (mul_962, val_29)
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
add_1300 = Add (add_1271, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_58 = MatMul (layer_norm_19, val_31)
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
mul_1064 = Mul (linear_38, val_2)
sigmoid_9 = Sigmoid (mul_1064)
mul_1069 = Mul (linear_38, sigmoid_9)
val_59 = MatMul (mul_1069, val_32)
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
add_1444 = Add (add_1415, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_60 = MatMul (layer_norm_21, val_34)
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
mul_1171 = Mul (linear_42, val_2)
sigmoid_10 = Sigmoid (mul_1171)
mul_1176 = Mul (linear_42, sigmoid_10)
val_61 = MatMul (mul_1176, val_35)
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
add_1588 = Add (add_1559, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x1024)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 16, q_num_heads: int = 16, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
val_63 = Unsqueeze (val_62, val_756_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_64 = MatMul (layer_norm_23, val_37)
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
mul_1278 = Mul (linear_46, val_2)
sigmoid_11 = Sigmoid (mul_1278)
mul_1283 = Mul (linear_46, sigmoid_11)
val_65 = MatMul (mul_1283, val_38)
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
add_1732 = Add (add_1703, linear_47)
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
val_67 = Squeeze (val_66, val_756_axes1)
[node_matmul] matmul = MatMul (val_67, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x1024 INT64[3] 0ec6f5651fd5
ln_final.bias FLOAT[1024] c158fa2fd310
ln_final.weight FLOAT[1024] 0f5085023d43
node_scaled_dot_product_attention_10_wo_t FLOAT[1024,1024] e88e79069507
node_scaled_dot_product_attention_11_wo_t FLOAT[1024,1024] 4a936c874f03
node_scaled_dot_product_attention_1_wo_t FLOAT[1024,1024] f676dc3ad242
node_scaled_dot_product_attention_2_wo_t FLOAT[1024,1024] ee2206309bd3
node_scaled_dot_product_attention_3_wo_t FLOAT[1024,1024] a08c5b0184a2
node_scaled_dot_product_attention_4_wo_t FLOAT[1024,1024] 69604966b61b
node_scaled_dot_product_attention_5_wo_t FLOAT[1024,1024] d542d49d0091
node_scaled_dot_product_attention_6_wo_t FLOAT[1024,1024] 8585c33cdd4d
node_scaled_dot_product_attention_7_wo_t FLOAT[1024,1024] 6db160de0a8c
node_scaled_dot_product_attention_8_wo_t FLOAT[1024,1024] ce1f55a23309
node_scaled_dot_product_attention_9_wo_t FLOAT[1024,1024] 8f795b2326f9
node_scaled_dot_product_attention_wo_t FLOAT[1024,1024] b406f6dfa0f9
positional_embedding FLOAT[77,1024] f008be43e715
text_projection FLOAT[1024,1024] 6d4fef8843c1
token_embedding.weight_fp16 FLOAT16[49408,1024] 1da8b0979903
transformer.resblocks.0.attn.in_proj_bias FLOAT[3072] 6279ad13131e
transformer.resblocks.0.attn.out_proj.bias FLOAT[1024] 4e30fe824e31
transformer.resblocks.0.ln_1.bias FLOAT[1024] 614c4325375d
transformer.resblocks.0.ln_1.weight FLOAT[1024] 25b598879841
transformer.resblocks.0.ln_2.bias FLOAT[1024] d25a2e7a00a3
transformer.resblocks.0.ln_2.weight FLOAT[1024] 5563178aba84
transformer.resblocks.0.mlp.c_fc.bias FLOAT[4096] 848ecd1a736b
transformer.resblocks.0.mlp.c_proj.bias FLOAT[1024] edd281b3ed00
transformer.resblocks.1.attn.in_proj_bias FLOAT[3072] 3aa22afdf34b
transformer.resblocks.1.attn.out_proj.bias FLOAT[1024] 8589f2c609be
transformer.resblocks.1.ln_1.bias FLOAT[1024] 090fbb84f350
transformer.resblocks.1.ln_1.weight FLOAT[1024] 71ce24bd1cb9
transformer.resblocks.1.ln_2.bias FLOAT[1024] 11d5082ed975
transformer.resblocks.1.ln_2.weight FLOAT[1024] f28b0c1c7d5f
transformer.resblocks.1.mlp.c_fc.bias FLOAT[4096] 84581e742f70
transformer.resblocks.1.mlp.c_proj.bias FLOAT[1024] 557de8b55ec3
transformer.resblocks.10.attn.in_proj_bias FLOAT[3072] 70af461830c4
transformer.resblocks.10.attn.out_proj.bias FLOAT[1024] 1778efa0d71b
transformer.resblocks.10.ln_1.bias FLOAT[1024] 9228ef6db72e
transformer.resblocks.10.ln_1.weight FLOAT[1024] 0c1291d2a693
transformer.resblocks.10.ln_2.bias FLOAT[1024] 04e713840828
transformer.resblocks.10.ln_2.weight FLOAT[1024] 6a71d74d68ca
transformer.resblocks.10.mlp.c_fc.bias FLOAT[4096] b2e3a7c5d287
transformer.resblocks.10.mlp.c_proj.bias FLOAT[1024] 6ad9a1e42b9b
transformer.resblocks.11.attn.in_proj_bias FLOAT[3072] ad0e1c2992ad
transformer.resblocks.11.attn.out_proj.bias FLOAT[1024] bd1f660ab5c1
transformer.resblocks.11.ln_1.bias FLOAT[1024] 60c27f9f0d06
transformer.resblocks.11.ln_1.weight FLOAT[1024] a2fafad8dcec
transformer.resblocks.11.ln_2.bias FLOAT[1024] 840a17ab89b1
transformer.resblocks.11.ln_2.weight FLOAT[1024] 3d87aaea2df4
transformer.resblocks.11.mlp.c_fc.bias FLOAT[4096] 289395febb66
transformer.resblocks.11.mlp.c_proj.bias FLOAT[1024] 7a75a89ea1d4
transformer.resblocks.2.attn.in_proj_bias FLOAT[3072] e6d2854786df
transformer.resblocks.2.attn.out_proj.bias FLOAT[1024] 4117ed9008e1
transformer.resblocks.2.ln_1.bias FLOAT[1024] 04617df69b96
transformer.resblocks.2.ln_1.weight FLOAT[1024] 98621e0461a3
transformer.resblocks.2.ln_2.bias FLOAT[1024] 29d0e86e05a7
transformer.resblocks.2.ln_2.weight FLOAT[1024] 9cfa88211778
transformer.resblocks.2.mlp.c_fc.bias FLOAT[4096] c131b5cb11aa
transformer.resblocks.2.mlp.c_proj.bias FLOAT[1024] 9debeee7c22a
transformer.resblocks.3.attn.in_proj_bias FLOAT[3072] 17aa099b96d3
transformer.resblocks.3.attn.out_proj.bias FLOAT[1024] 7a2275bd78f0
transformer.resblocks.3.ln_1.bias FLOAT[1024] c6784508b72d
transformer.resblocks.3.ln_1.weight FLOAT[1024] 21624818f500
transformer.resblocks.3.ln_2.bias FLOAT[1024] 88258e14de6b
transformer.resblocks.3.ln_2.weight FLOAT[1024] cc1c0429d421
transformer.resblocks.3.mlp.c_fc.bias FLOAT[4096] b88daea35120
transformer.resblocks.3.mlp.c_proj.bias FLOAT[1024] 5add36106c2f
transformer.resblocks.4.attn.in_proj_bias FLOAT[3072] 8e9d2764b572
transformer.resblocks.4.attn.out_proj.bias FLOAT[1024] 9eb75408fbf3
transformer.resblocks.4.ln_1.bias FLOAT[1024] 1c8feffb3961
transformer.resblocks.4.ln_1.weight FLOAT[1024] 5c5d7d3dc605
transformer.resblocks.4.ln_2.bias FLOAT[1024] 8e27a1cd3dbf
transformer.resblocks.4.ln_2.weight FLOAT[1024] 543ad5c1aa14
transformer.resblocks.4.mlp.c_fc.bias FLOAT[4096] c3a4aa27f5a8
transformer.resblocks.4.mlp.c_proj.bias FLOAT[1024] d527c6399ea2
transformer.resblocks.5.attn.in_proj_bias FLOAT[3072] f7c8279c7e7d
transformer.resblocks.5.attn.out_proj.bias FLOAT[1024] 42a397e51b3b
transformer.resblocks.5.ln_1.bias FLOAT[1024] 055229583cd1
transformer.resblocks.5.ln_1.weight FLOAT[1024] 6e6b46f70528
transformer.resblocks.5.ln_2.bias FLOAT[1024] 6e0fc8d5076c
transformer.resblocks.5.ln_2.weight FLOAT[1024] 06b5884dbd52
transformer.resblocks.5.mlp.c_fc.bias FLOAT[4096] a758d6342e53
transformer.resblocks.5.mlp.c_proj.bias FLOAT[1024] 3e33bf785395
transformer.resblocks.6.attn.in_proj_bias FLOAT[3072] 0faf26a979ac
transformer.resblocks.6.attn.out_proj.bias FLOAT[1024] 3071649956f9
transformer.resblocks.6.ln_1.bias FLOAT[1024] b4c9cb7aafd7
transformer.resblocks.6.ln_1.weight FLOAT[1024] 61fb7b7a7a55
transformer.resblocks.6.ln_2.bias FLOAT[1024] 7188da77d364
transformer.resblocks.6.ln_2.weight FLOAT[1024] f524991001d2
transformer.resblocks.6.mlp.c_fc.bias FLOAT[4096] b13f6119d6e8
transformer.resblocks.6.mlp.c_proj.bias FLOAT[1024] f22489672508
transformer.resblocks.7.attn.in_proj_bias FLOAT[3072] bce3bdd0c4b8
transformer.resblocks.7.attn.out_proj.bias FLOAT[1024] 8b46397b7ad4
transformer.resblocks.7.ln_1.bias FLOAT[1024] f11c7d0ef42f
transformer.resblocks.7.ln_1.weight FLOAT[1024] 70916a369813
transformer.resblocks.7.ln_2.bias FLOAT[1024] 4b1d30a80c2e
transformer.resblocks.7.ln_2.weight FLOAT[1024] ec407b6941f5
transformer.resblocks.7.mlp.c_fc.bias FLOAT[4096] be7638ba1390
transformer.resblocks.7.mlp.c_proj.bias FLOAT[1024] 369189e00ca0
transformer.resblocks.8.attn.in_proj_bias FLOAT[3072] 5c8de429591a
transformer.resblocks.8.attn.out_proj.bias FLOAT[1024] cf1cc73d7d3f
transformer.resblocks.8.ln_1.bias FLOAT[1024] 8ed2a3186d4c
transformer.resblocks.8.ln_1.weight FLOAT[1024] accee17dc839
transformer.resblocks.8.ln_2.bias FLOAT[1024] 98fb4cbb0c3b
transformer.resblocks.8.ln_2.weight FLOAT[1024] ede208ee0bf3
transformer.resblocks.8.mlp.c_fc.bias FLOAT[4096] d05c3e24f2db
transformer.resblocks.8.mlp.c_proj.bias FLOAT[1024] 1da760d4aab3
transformer.resblocks.9.attn.in_proj_bias FLOAT[3072] bfe88d188d4b
transformer.resblocks.9.attn.out_proj.bias FLOAT[1024] 2d36e069955f
transformer.resblocks.9.ln_1.bias FLOAT[1024] 20ebf61a78b5
transformer.resblocks.9.ln_1.weight FLOAT[1024] d7cd17781ac3
transformer.resblocks.9.ln_2.bias FLOAT[1024] 3c5efe387fb7
transformer.resblocks.9.ln_2.weight FLOAT[1024] 8d81f62a10c0
transformer.resblocks.9.mlp.c_fc.bias FLOAT[4096] 3e64b9307f4d
transformer.resblocks.9.mlp.c_proj.bias FLOAT[1024] 034773c5c494
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[1024,4096] c2183eb49796
val_11 FLOAT[4096,1024] c142568e80d2
val_12 FLOAT[1024,3072] 44941b4f0dd3
val_13 FLOAT[1024,4096] 06aa71e4097a
val_14 FLOAT[4096,1024] 0bc58a81fb20
val_15 FLOAT[1024,3072] 4e6112b2c72a
val_16 FLOAT[1024,4096] c81b38d4436f
val_17 FLOAT[4096,1024] e296c2111ef0
val_18 FLOAT[1024,3072] 03b5053ce129
val_19 FLOAT[1024,4096] 16ef6e6f1a13
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[4096,1024] 32174a78ac0a
val_21 FLOAT[1024,3072] fbe129c05a7c
val_22 FLOAT[1024,4096] 021fca3d1724
val_23 FLOAT[4096,1024] 3ce6495ff5fa
val_24 FLOAT[1024,3072] f64627edd8e5
val_25 FLOAT[1024,4096] 659535db2008
val_26 FLOAT[4096,1024] d70c69b6b3f1
val_27 FLOAT[1024,3072] 6e8b7049d2ed
val_28 FLOAT[1024,4096] 29bca006017a
val_29 FLOAT[4096,1024] 94f5d93ac2f0
val_3 FLOAT[1024,3072] de969930dc12
val_30 FLOAT[1024,3072] e586477a412e
val_31 FLOAT[1024,4096] e16242281285
val_32 FLOAT[4096,1024] b3fb7108dd94
val_33 FLOAT[1024,3072] ded202f7943c
val_34 FLOAT[1024,4096] 009af24fa472
val_35 FLOAT[4096,1024] 1801773841b9
val_36 FLOAT[1024,3072] b855848302db
val_37 FLOAT[1024,4096] b80090ef7163
val_38 FLOAT[4096,1024] 97b4fcc8cba3
val_4 FLOAT[1024,4096] fbf678a932bc
val_5 FLOAT[4096,1024] de768150ab79
val_6 FLOAT[1024,3072] f5c1a847b621
val_7 FLOAT[1024,4096] 54085f6a09ee
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[4096,1024] 01e80c26a440
val_9 FLOAT[1024,3072] 906c3865df06
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,571 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
<
float[batch,64,768] add_1071
float[batch,64,768] add_1092
float[batch,64,768] add_119
float[batch,64,768] add_1207
float[batch,64,768] add_1228
float[batch,64,768] add_1343
float[batch,64,768] add_1364
float[batch,64,768] add_140
float[batch,64,768] add_1479
float[batch,64,768] add_1500
float[batch,1,768] add_1500_pooled
float[batch,1,768] add_1615
float[batch,1,768] add_1636
float[batch,64,768] add_255
float[batch,64,768] add_276
float[batch,64,768] add_391
float[batch,64,768] add_4
float[batch,64,768] add_412
float[batch,64,768] add_527
float[batch,64,768] add_548
float[batch,64,768] add_663
float[batch,64,768] add_684
float[batch,64,768] add_799
float[batch,64,768] add_820
float[batch,64,768] add_935
float[batch,64,768] add_956
float[batch,1] clamp_min
float[batch,64,768] embedding
float[batch,64,3072] gelu
float[batch,64,3072] gelu_1
float[batch,64,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,64,3072] gelu_2
float[batch,64,3072] gelu_3
float[batch,64,3072] gelu_4
float[batch,64,3072] gelu_5
float[batch,64,3072] gelu_6
float[batch,64,3072] gelu_7
float[batch,64,3072] gelu_8
float[batch,64,3072] gelu_9
float[batch,64,768] layer_norm
float[batch,64,768] layer_norm_1
float[batch,64,768] layer_norm_10
float[batch,64,768] layer_norm_11
float[batch,64,768] layer_norm_12
float[batch,64,768] layer_norm_13
float[batch,64,768] layer_norm_14
float[batch,64,768] layer_norm_15
float[batch,64,768] layer_norm_16
float[batch,64,768] layer_norm_17
float[batch,64,768] layer_norm_18
float[batch,64,768] layer_norm_19
float[batch,64,768] layer_norm_2
float[batch,64,768] layer_norm_20
float[batch,64,768] layer_norm_21
float[batch,64,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,64,768] layer_norm_3
float[batch,64,768] layer_norm_4
float[batch,64,768] layer_norm_5
float[batch,64,768] layer_norm_6
float[batch,64,768] layer_norm_7
float[batch,64,768] layer_norm_8
float[batch,64,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,64,3072] linear_10
float[batch,64,768] linear_11
float[batch,64,3072] linear_14
float[batch,64,768] linear_15
float[batch,64,3072] linear_18
float[batch,64,768] linear_19
float[batch,64,3072] linear_2
float[batch,64,3072] linear_22
float[batch,64,768] linear_23
float[batch,64,3072] linear_26
float[batch,64,768] linear_27
float[batch,64,768] linear_3
float[batch,64,3072] linear_30
float[batch,64,768] linear_31
float[batch,64,3072] linear_34
float[batch,64,768] linear_35
float[batch,64,3072] linear_38
float[batch,64,768] linear_39
float[batch,64,3072] linear_42
float[batch,64,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,768] linear_48
float[batch,64,3072] linear_6
float[batch,64,768] linear_7
float[batch,64,768] node_scaled_dot_product_attention_10_k
float[batch,64,768] node_scaled_dot_product_attention_10_out
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_q
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_v
float[batch,64,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_v
float[batch,64,768] node_scaled_dot_product_attention_1_k
float[batch,64,768] node_scaled_dot_product_attention_1_out
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_q
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_v
float[batch,64,768] node_scaled_dot_product_attention_2_k
float[batch,64,768] node_scaled_dot_product_attention_2_out
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_q
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_v
float[batch,64,768] node_scaled_dot_product_attention_3_k
float[batch,64,768] node_scaled_dot_product_attention_3_out
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_q
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_v
float[batch,64,768] node_scaled_dot_product_attention_4_k
float[batch,64,768] node_scaled_dot_product_attention_4_out
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_q
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_v
float[batch,64,768] node_scaled_dot_product_attention_5_k
float[batch,64,768] node_scaled_dot_product_attention_5_out
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_q
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_v
float[batch,64,768] node_scaled_dot_product_attention_6_k
float[batch,64,768] node_scaled_dot_product_attention_6_out
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_q
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_v
float[batch,64,768] node_scaled_dot_product_attention_7_k
float[batch,64,768] node_scaled_dot_product_attention_7_out
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_q
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_v
float[batch,64,768] node_scaled_dot_product_attention_8_k
float[batch,64,768] node_scaled_dot_product_attention_8_out
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_q
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_v
float[batch,64,768] node_scaled_dot_product_attention_9_k
float[batch,64,768] node_scaled_dot_product_attention_9_out
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_q
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_v
float[batch,64,768] node_scaled_dot_product_attention_k
float[batch,64,768] node_scaled_dot_product_attention_out
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_q
float[batch,64,2304] node_scaled_dot_product_attention_qkv
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_v
float[batch,64,768] scaled_dot_product_attention
float[batch,64,768] scaled_dot_product_attention_1
float[batch,64,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,64,768] scaled_dot_product_attention_2
float[batch,64,768] scaled_dot_product_attention_3
float[batch,64,768] scaled_dot_product_attention_4
float[batch,64,768] scaled_dot_product_attention_5
float[batch,64,768] scaled_dot_product_attention_6
float[batch,64,768] scaled_dot_product_attention_7
float[batch,64,768] scaled_dot_product_attention_8
float[batch,64,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,64,3072] val_41
float[batch,64,768] val_42
float[batch,64,3072] val_43
float[batch,64,768] val_44
float[batch,64,3072] val_45
float[batch,64,768] val_46
float[batch,64,3072] val_47
float[batch,64,768] val_48
float[batch,64,3072] val_49
float[batch,64,768] val_50
float[batch,64,3072] val_51
float[batch,64,768] val_52
float[batch,64,3072] val_53
float[batch,64,768] val_54
float[batch,64,3072] val_55
float[batch,64,768] val_56
float[batch,64,3072] val_57
float[batch,64,768] val_58
float[batch,64,3072] val_59
float[batch,64,768] val_60
float[batch,64,3072] val_61
float[batch,64,768] val_62
float[batch,1,3072] val_63
float[batch,1,768] val_64
float[batch,768] val_65
>
{
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_40)
add_4 = Add (embedding, "text.positional_embedding")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
val_41 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_42 = MatMul (gelu, val_6)
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
val_43 = MatMul (layer_norm_3, val_8)
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_44 = MatMul (gelu_1, val_9)
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
val_45 = MatMul (layer_norm_5, val_11)
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_46 = MatMul (gelu_2, val_12)
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
val_47 = MatMul (layer_norm_7, val_14)
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_48 = MatMul (gelu_3, val_15)
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
val_49 = MatMul (layer_norm_9, val_17)
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_50 = MatMul (gelu_4, val_18)
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
val_51 = MatMul (layer_norm_11, val_20)
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_52 = MatMul (gelu_5, val_21)
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
val_53 = MatMul (layer_norm_13, val_23)
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_54 = MatMul (gelu_6, val_24)
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
val_55 = MatMul (layer_norm_15, val_26)
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_56 = MatMul (gelu_7, val_27)
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
val_57 = MatMul (layer_norm_17, val_29)
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_58 = MatMul (gelu_8, val_30)
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
val_59 = MatMul (layer_norm_19, val_32)
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_60 = MatMul (gelu_9, val_33)
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
val_61 = MatMul (layer_norm_21, val_35)
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_62 = MatMul (gelu_10, val_36)
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_38)
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_39)
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = Squeeze (add_1636, val_2)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (linear_48, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 58921eb17041
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 80bb74f114b7
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] da4eae0a393b
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] c79341a19515
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] d20ec53acc01
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 21f0d9d4e629
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 854f2691c4dd
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 25f70d6740c1
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 230a1dd5511e
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] be27b7b2c648
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] b34a8f1f6dd4
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 5382de081f3b
text.ln_final.bias FLOAT[768] 654ac46e2a43
text.ln_final.weight FLOAT[768] f65dfa22b56f
text.positional_embedding FLOAT[64,768] 3149ca5ed586
text.text_projection.bias FLOAT[768] 51d4b7993be2
text.text_projection.weight FLOAT[768,768] 60a1ffa669b8
text.token_embedding.weight_fp16 FLOAT16[32000,768] 8ee862592bb0
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] aaa5053e26b9
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 73af5ac8aeea
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 217a76a777d1
text.transformer.resblocks.0.ln_1.weight FLOAT[768] 318c756bdea8
text.transformer.resblocks.0.ln_2.bias FLOAT[768] de9dd424362f
text.transformer.resblocks.0.ln_2.weight FLOAT[768] d05b21e27aae
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] d0781adcdb87
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] b76bafa9bceb
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 815b5626d430
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 6b8153a72a1d
text.transformer.resblocks.1.ln_1.bias FLOAT[768] 7836c3211bdc
text.transformer.resblocks.1.ln_1.weight FLOAT[768] aab0d0c05e1f
text.transformer.resblocks.1.ln_2.bias FLOAT[768] a7a56f1d6aec
text.transformer.resblocks.1.ln_2.weight FLOAT[768] 3d55e2931861
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] bf05cd75ca3d
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 5b03ee26650e
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 1ba559ef4457
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 74029bf35ee8
text.transformer.resblocks.10.ln_1.bias FLOAT[768] 1282e1e04e70
text.transformer.resblocks.10.ln_1.weight FLOAT[768] ca80a8625adc
text.transformer.resblocks.10.ln_2.bias FLOAT[768] c6a548427f7e
text.transformer.resblocks.10.ln_2.weight FLOAT[768] e127b15cc8a5
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 99313b411c2e
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 5916dd069135
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] cf12259278d8
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 98a2accce461
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 6954e5dcf1b7
text.transformer.resblocks.11.ln_1.weight FLOAT[768] b42144af2b48
text.transformer.resblocks.11.ln_2.bias FLOAT[768] bc1d2604dd96
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 14f9ad4de44f
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 89b710d8d8da
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] e9e93d772079
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 8e728dc89df7
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 4101b8e44004
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 1b42870d6446
text.transformer.resblocks.2.ln_1.weight FLOAT[768] af18c3a5515a
text.transformer.resblocks.2.ln_2.bias FLOAT[768] fa7455013a59
text.transformer.resblocks.2.ln_2.weight FLOAT[768] 8f27544da0a9
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 42aea2e68357
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 33be602f2c9d
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] f650e27876dc
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 4e358f6ae002
text.transformer.resblocks.3.ln_1.bias FLOAT[768] 2ba946bf6d60
text.transformer.resblocks.3.ln_1.weight FLOAT[768] ba7ba3084218
text.transformer.resblocks.3.ln_2.bias FLOAT[768] ce615f711496
text.transformer.resblocks.3.ln_2.weight FLOAT[768] a084ad1f3137
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 99eb59193d20
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 1bd4f34be25a
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] f471dd03247b
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] f6a6963dd95d
text.transformer.resblocks.4.ln_1.bias FLOAT[768] b31422390e0d
text.transformer.resblocks.4.ln_1.weight FLOAT[768] d424a73e30eb
text.transformer.resblocks.4.ln_2.bias FLOAT[768] 2531f9937012
text.transformer.resblocks.4.ln_2.weight FLOAT[768] 1400f0d3e5b6
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 45831948dd9f
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 947ce8ffd9b6
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] a13cc1f70b2e
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 6c06c59e22da
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 000d79e4738e
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 1e65cd2d6a07
text.transformer.resblocks.5.ln_2.bias FLOAT[768] 17e9593de394
text.transformer.resblocks.5.ln_2.weight FLOAT[768] 30da1b4b9a95
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] cced816ad0a7
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 42a3160f915e
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 6a03750a3f85
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] ce2d8330eb66
text.transformer.resblocks.6.ln_1.bias FLOAT[768] 078b5469ca80
text.transformer.resblocks.6.ln_1.weight FLOAT[768] 11232d20f82d
text.transformer.resblocks.6.ln_2.bias FLOAT[768] e2e7ae4008c3
text.transformer.resblocks.6.ln_2.weight FLOAT[768] 448c46748fc2
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] f4daafc60785
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 23d68eabea6c
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 3180e83cfd0e
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] e7a29846315b
text.transformer.resblocks.7.ln_1.bias FLOAT[768] 6d584a276736
text.transformer.resblocks.7.ln_1.weight FLOAT[768] feb30af1e6ef
text.transformer.resblocks.7.ln_2.bias FLOAT[768] eb542b41270a
text.transformer.resblocks.7.ln_2.weight FLOAT[768] cfa71ee1fd24
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] d7acd7b61da4
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] f88a8e056751
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] ee08dd77f7db
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] cad892aa9503
text.transformer.resblocks.8.ln_1.bias FLOAT[768] fe75f5e35c9e
text.transformer.resblocks.8.ln_1.weight FLOAT[768] 9992d9b127e6
text.transformer.resblocks.8.ln_2.bias FLOAT[768] ccc73a21ae37
text.transformer.resblocks.8.ln_2.weight FLOAT[768] 22c9e6ab492b
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 9ab8964608e0
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 360302aa0900
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 7740f99a8170
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 9699ff25b40c
text.transformer.resblocks.9.ln_1.bias FLOAT[768] 8733d4cf3e07
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 10efc4f02019
text.transformer.resblocks.9.ln_2.bias FLOAT[768] abb48c940281
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 226d27babb9b
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 54b427215bad
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 76564052387f
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,2304] 3e1c5be39ff7
val_11 FLOAT[768,3072] ea0fbad5099d
val_12 FLOAT[3072,768] cc99864f9fa7
val_13 FLOAT[768,2304] c5810c8afa6b
val_14 FLOAT[768,3072] c91f9d1f213c
val_15 FLOAT[3072,768] 8421a0a9352d
val_16 FLOAT[768,2304] 968155d110d2
val_17 FLOAT[768,3072] 6b8552d8aa87
val_18 FLOAT[3072,768] d30c70f073ce
val_19 FLOAT[768,2304] 42e2a77d565d
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,3072] ecf6dfb6a03f
val_21 FLOAT[3072,768] 77f297bee643
val_22 FLOAT[768,2304] b054680b8f81
val_23 FLOAT[768,3072] 8c9f6d9499a8
val_24 FLOAT[3072,768] f775af3219f6
val_25 FLOAT[768,2304] d9483a3dcbab
val_26 FLOAT[768,3072] f907379768d5
val_27 FLOAT[3072,768] 8830eab86564
val_28 FLOAT[768,2304] 6aca0e382ba5
val_29 FLOAT[768,3072] eb361e69245b
val_3 INT64[1] 6a69a6cc7473
val_30 FLOAT[3072,768] ada2cee6c773
val_31 FLOAT[768,2304] ab45769d959b
val_32 FLOAT[768,3072] 1ae3119db59d
val_33 FLOAT[3072,768] ce9b59e3c2ed
val_34 FLOAT[768,2304] b9c337619f11
val_35 FLOAT[768,3072] 3f41804d776f
val_36 FLOAT[3072,768] 1fff4d7b4f20
val_37 FLOAT[768,2304] 4c557884c1fe
val_38 FLOAT[768,3072] 30201ee52e00
val_39 FLOAT[3072,768] 443065c1a577
val_4 FLOAT[768,2304] ffbd4206ee11
val_5 FLOAT[768,3072] 7ef22d9c6695
val_6 FLOAT[3072,768] 5a6c3a36b5b7
val_7 FLOAT[768,2304] 5b98d65423fe
val_8 FLOAT[768,3072] 2fd4ee734214
val_9 FLOAT[3072,768] 9065657c1536
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,256,256,3] image) => (float[batch,768] image_embedding)
<
float[batch,256,768] add_1007
float[batch,256,768] add_1068
float[batch,256,768] add_107
float[batch,256,768] add_1097
float[batch,1,768] add_1195
float[batch,256,768] add_13
float[batch,256,768] add_168
float[batch,256,768] add_197
float[batch,256,768] add_258
float[batch,256,768] add_287
float[batch,256,768] add_348
float[batch,256,768] add_377
float[batch,256,768] add_438
float[batch,256,768] add_467
float[batch,256,768] add_528
float[batch,256,768] add_557
float[batch,256,768] add_618
float[batch,256,768] add_647
float[batch,256,768] add_708
float[batch,256,768] add_737
float[batch,256,768] add_78
float[batch,256,768] add_798
float[batch,256,768] add_827
float[batch,256,768] add_888
float[batch,256,768] add_917
float[batch,256,768] add_978
float[batch,1] clamp_min
float[batch,768,16,16] conv2d
float[batch,256,3072] gelu
float[batch,256,3072] gelu_1
float[batch,256,3072] gelu_10
float[batch,256,3072] gelu_11
float[batch,1,3072] gelu_12
float[batch,256,3072] gelu_2
float[batch,256,3072] gelu_3
float[batch,256,3072] gelu_4
float[batch,256,3072] gelu_5
float[batch,256,3072] gelu_6
float[batch,256,3072] gelu_7
float[batch,256,3072] gelu_8
float[batch,256,3072] gelu_9
float[batch,3,256,256] image_chw
float[batch] image_ez
float[batch] image_ez_r
float[batch,1,1,1] image_ez_s
float[batch,256,256,3] image_f32
float[batch,256,768] layer_norm
float[batch,256,768] layer_norm_1
float[batch,256,768] layer_norm_10
float[batch,256,768] layer_norm_11
float[batch,256,768] layer_norm_12
float[batch,256,768] layer_norm_13
float[batch,256,768] layer_norm_14
float[batch,256,768] layer_norm_15
float[batch,256,768] layer_norm_16
float[batch,256,768] layer_norm_17
float[batch,256,768] layer_norm_18
float[batch,256,768] layer_norm_19
float[batch,256,768] layer_norm_2
float[batch,256,768] layer_norm_20
float[batch,256,768] layer_norm_21
float[batch,256,768] layer_norm_22
float[batch,256,768] layer_norm_23
float[batch,256,768] layer_norm_24
float[batch,1,768] layer_norm_25
float[batch,256,768] layer_norm_3
float[batch,256,768] layer_norm_4
float[batch,256,768] layer_norm_5
float[batch,256,768] layer_norm_6
float[batch,256,768] layer_norm_7
float[batch,256,768] layer_norm_8
float[batch,256,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,256,2304] linear
float[batch,256,768] linear_1
float[batch,256,3072] linear_10
float[batch,256,768] linear_11
float[batch,256,2304] linear_12
float[batch,256,768] linear_13
float[batch,256,3072] linear_14
float[batch,256,768] linear_15
float[batch,256,2304] linear_16
float[batch,256,768] linear_17
float[batch,256,3072] linear_18
float[batch,256,768] linear_19
float[batch,256,3072] linear_2
float[batch,256,2304] linear_20
float[batch,256,768] linear_21
float[batch,256,3072] linear_22
float[batch,256,768] linear_23
float[batch,256,2304] linear_24
float[batch,256,768] linear_25
float[batch,256,3072] linear_26
float[batch,256,768] linear_27
float[batch,256,2304] linear_28
float[batch,256,768] linear_29
float[batch,256,768] linear_3
float[batch,256,3072] linear_30
float[batch,256,768] linear_31
float[batch,256,2304] linear_32
float[batch,256,768] linear_33
float[batch,256,3072] linear_34
float[batch,256,768] linear_35
float[batch,256,2304] linear_36
float[batch,256,768] linear_37
float[batch,256,3072] linear_38
float[batch,256,768] linear_39
float[batch,256,2304] linear_4
float[batch,256,2304] linear_40
float[batch,256,768] linear_41
float[batch,256,3072] linear_42
float[batch,256,768] linear_43
float[batch,256,2304] linear_44
float[batch,256,768] linear_45
float[batch,256,3072] linear_46
float[batch,256,768] linear_47
float[batch,256,1536] linear_49
float[batch,256,768] linear_5
float[batch,1,768] linear_50
float[batch,1,3072] linear_51
float[batch,1,768] linear_52
float[batch,256,3072] linear_6
float[batch,256,768] linear_7
float[batch,256,2304] linear_8
float[batch,256,768] linear_9
float[batch,256,768] node_scaled_dot_product_attention_10_k
float[batch,256,768] node_scaled_dot_product_attention_10_q
float[batch,256,768] node_scaled_dot_product_attention_10_v
float[batch,256,768] node_scaled_dot_product_attention_11_k
float[batch,256,768] node_scaled_dot_product_attention_11_q
float[batch,256,768] node_scaled_dot_product_attention_11_v
float[batch,256,768] node_scaled_dot_product_attention_12_k
float[batch,1,768] node_scaled_dot_product_attention_12_q
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
float[batch,256,768] node_scaled_dot_product_attention_12_v
float[batch,256,768] node_scaled_dot_product_attention_1_k
float[batch,256,768] node_scaled_dot_product_attention_1_q
float[batch,256,768] node_scaled_dot_product_attention_1_v
float[batch,256,768] node_scaled_dot_product_attention_2_k
float[batch,256,768] node_scaled_dot_product_attention_2_q
float[batch,256,768] node_scaled_dot_product_attention_2_v
float[batch,256,768] node_scaled_dot_product_attention_3_k
float[batch,256,768] node_scaled_dot_product_attention_3_q
float[batch,256,768] node_scaled_dot_product_attention_3_v
float[batch,256,768] node_scaled_dot_product_attention_4_k
float[batch,256,768] node_scaled_dot_product_attention_4_q
float[batch,256,768] node_scaled_dot_product_attention_4_v
float[batch,256,768] node_scaled_dot_product_attention_5_k
float[batch,256,768] node_scaled_dot_product_attention_5_q
float[batch,256,768] node_scaled_dot_product_attention_5_v
float[batch,256,768] node_scaled_dot_product_attention_6_k
float[batch,256,768] node_scaled_dot_product_attention_6_q
float[batch,256,768] node_scaled_dot_product_attention_6_v
float[batch,256,768] node_scaled_dot_product_attention_7_k
float[batch,256,768] node_scaled_dot_product_attention_7_q
float[batch,256,768] node_scaled_dot_product_attention_7_v
float[batch,256,768] node_scaled_dot_product_attention_8_k
float[batch,256,768] node_scaled_dot_product_attention_8_q
float[batch,256,768] node_scaled_dot_product_attention_8_v
float[batch,256,768] node_scaled_dot_product_attention_9_k
float[batch,256,768] node_scaled_dot_product_attention_9_q
float[batch,256,768] node_scaled_dot_product_attention_9_v
float[batch,256,768] node_scaled_dot_product_attention_k
float[batch,256,768] node_scaled_dot_product_attention_q
float[batch,256,768] node_scaled_dot_product_attention_v
float[batch,256,768] scaled_dot_product_attention
float[batch,256,768] scaled_dot_product_attention_1
float[batch,256,768] scaled_dot_product_attention_10
float[batch,256,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_12
float[batch,256,768] scaled_dot_product_attention_2
float[batch,256,768] scaled_dot_product_attention_3
float[batch,256,768] scaled_dot_product_attention_4
float[batch,256,768] scaled_dot_product_attention_5
float[batch,256,768] scaled_dot_product_attention_6
float[batch,256,768] scaled_dot_product_attention_7
float[batch,256,768] scaled_dot_product_attention_8
float[batch,256,768] scaled_dot_product_attention_9
float[batch,768] select
float[batch,256,768] transpose
float[batch,256,768] val_100
float[batch,256,3072] val_101
float[batch,256,768] val_102
float[batch,256,1536] val_103
float[batch,1,768] val_104
float[batch,1,3072] val_105
float[batch,1,768] val_106
float[batch,256,2304] val_55
float[batch,256,768] val_56
float[batch,256,3072] val_57
float[batch,256,768] val_58
float[batch,256,2304] val_59
float[batch,256,768] val_60
float[batch,256,3072] val_61
float[batch,256,768] val_62
float[batch,256,2304] val_63
float[batch,256,768] val_64
float[batch,256,3072] val_65
float[batch,256,768] val_66
float[batch,256,2304] val_67
float[batch,256,768] val_68
float[batch,256,3072] val_69
float[batch,256,768] val_70
float[batch,256,2304] val_71
float[batch,256,768] val_72
float[batch,256,3072] val_73
float[batch,256,768] val_74
float[batch,256,2304] val_75
float[batch,256,768] val_76
float[batch,256,3072] val_77
float[batch,256,768] val_78
float[batch,256,2304] val_79
float[batch,256,768] val_80
float[batch,256,3072] val_81
float[batch,256,768] val_82
float[batch,256,2304] val_83
float[batch,256,768] val_84
float[batch,256,3072] val_85
float[batch,256,768] val_86
float[batch,256,2304] val_87
float[batch,256,768] val_88
float[batch,256,3072] val_89
float[batch,256,768] val_90
float[batch,256,2304] val_91
float[batch,256,768] val_92
float[batch,256,3072] val_93
float[batch,256,768] val_94
float[batch,256,2304] val_95
float[batch,256,768] val_96
float[batch,256,3072] val_97
float[batch,256,768] val_98
float[batch,256,2304] val_99
float[batch,768,256] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
add_13 = Add (transpose, "visual.trunk.pos_embed")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
val_55 = MatMul (layer_norm, val_3)
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
val_56 = MatMul (scaled_dot_product_attention, val_4)
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
add_78 = Add (add_13, linear_1)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
val_57 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_58 = MatMul (gelu, val_6)
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
add_107 = Add (add_78, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
val_59 = MatMul (layer_norm_2, val_7)
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
add_168 = Add (add_107, linear_5)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
val_61 = MatMul (layer_norm_3, val_9)
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_62 = MatMul (gelu_1, val_10)
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
add_197 = Add (add_168, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
val_63 = MatMul (layer_norm_4, val_11)
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
add_258 = Add (add_197, linear_9)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
val_65 = MatMul (layer_norm_5, val_13)
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_66 = MatMul (gelu_2, val_14)
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
add_287 = Add (add_258, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
val_67 = MatMul (layer_norm_6, val_15)
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
add_348 = Add (add_287, linear_13)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
val_69 = MatMul (layer_norm_7, val_17)
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_70 = MatMul (gelu_3, val_18)
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
add_377 = Add (add_348, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
val_71 = MatMul (layer_norm_8, val_19)
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
add_438 = Add (add_377, linear_17)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
val_73 = MatMul (layer_norm_9, val_21)
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_74 = MatMul (gelu_4, val_22)
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
add_467 = Add (add_438, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
val_75 = MatMul (layer_norm_10, val_23)
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
add_528 = Add (add_467, linear_21)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
val_77 = MatMul (layer_norm_11, val_25)
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_78 = MatMul (gelu_5, val_26)
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
add_557 = Add (add_528, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
val_79 = MatMul (layer_norm_12, val_27)
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
add_618 = Add (add_557, linear_25)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
val_81 = MatMul (layer_norm_13, val_29)
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_82 = MatMul (gelu_6, val_30)
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
add_647 = Add (add_618, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
val_83 = MatMul (layer_norm_14, val_31)
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
add_708 = Add (add_647, linear_29)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
val_85 = MatMul (layer_norm_15, val_33)
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_86 = MatMul (gelu_7, val_34)
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
add_737 = Add (add_708, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
val_87 = MatMul (layer_norm_16, val_35)
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
add_798 = Add (add_737, linear_33)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
val_89 = MatMul (layer_norm_17, val_37)
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_90 = MatMul (gelu_8, val_38)
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
add_827 = Add (add_798, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
val_91 = MatMul (layer_norm_18, val_39)
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
add_888 = Add (add_827, linear_37)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
val_93 = MatMul (layer_norm_19, val_41)
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_94 = MatMul (gelu_9, val_42)
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
add_917 = Add (add_888, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
val_95 = MatMul (layer_norm_20, val_43)
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
add_978 = Add (add_917, linear_41)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
val_97 = MatMul (layer_norm_21, val_45)
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_98 = MatMul (gelu_10, val_46)
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
add_1007 = Add (add_978, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
val_99 = MatMul (layer_norm_22, val_47)
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
add_1068 = Add (add_1007, linear_45)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
val_101 = MatMul (layer_norm_23, val_49)
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_102 = MatMul (gelu_11, val_50)
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
add_1097 = Add (add_1068, linear_47)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
val_103 = MatMul (layer_norm_24, val_51)
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
val_105 = MatMul (layer_norm_25, val_53)
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
val_106 = MatMul (gelu_12, val_54)
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
add_1195 = Add (linear_50, linear_52)
select = Squeeze (add_1195, val_2)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
attn3d_split_2x768 INT64[2] 6b8b40015c71
attn3d_split_3x768 INT64[3] eca50b2daf34
image_ez_axes INT64[3] e2e2033ae7e1
image_ez_ends INT64[3] 605390e5a369
image_ez_starts INT64[3] 9d908ecfb6b2
image_ez_zero FLOAT[] df3f619804a9
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] 822edd12128e
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[3072,768] 20443f5e9237
val_11 FLOAT[768,2304] 4bfebf814fcf
val_12 FLOAT[768,768] e8cb1e6614a0
val_13 FLOAT[768,3072] 9cd2214c6e05
val_14 FLOAT[3072,768] 1448f95659ce
val_15 FLOAT[768,2304] 9fe3237e95f6
val_16 FLOAT[768,768] 5ed567544368
val_17 FLOAT[768,3072] f10c3f9f7328
val_18 FLOAT[3072,768] 2615c7578586
val_19 FLOAT[768,2304] 0925670f7fb1
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,768] bf5f950ce655
val_21 FLOAT[768,3072] 438c002727a7
val_22 FLOAT[3072,768] a51efc8f7e29
val_23 FLOAT[768,2304] 6b1607a4c294
val_24 FLOAT[768,768] 35284c9cccd3
val_25 FLOAT[768,3072] b0fbbc0e0e51
val_26 FLOAT[3072,768] 9a0efb34e194
val_27 FLOAT[768,2304] 42ed6ceb520e
val_28 FLOAT[768,768] 213f81f43a6f
val_29 FLOAT[768,3072] ac214e753c65
val_3 FLOAT[768,2304] 658d0c7113f3
val_30 FLOAT[3072,768] d0d18fc33580
val_31 FLOAT[768,2304] e1ada5087f78
val_32 FLOAT[768,768] 974793e9d0ea
val_33 FLOAT[768,3072] ad97876efcdf
val_34 FLOAT[3072,768] 99ee9f167b4d
val_35 FLOAT[768,2304] 2bc67961d303
val_36 FLOAT[768,768] 5d41207af977
val_37 FLOAT[768,3072] 64425687026f
val_38 FLOAT[3072,768] e942f5e85c46
val_39 FLOAT[768,2304] 8efcdea9623d
val_4 FLOAT[768,768] 6e8d0b64ce6c
val_40 FLOAT[768,768] 88d9797ff92b
val_41 FLOAT[768,3072] 8dce1f2c5b46
val_42 FLOAT[3072,768] ec61c6a07941
val_43 FLOAT[768,2304] 7f5cdaad7a19
val_44 FLOAT[768,768] 73384def1cbe
val_45 FLOAT[768,3072] 8f6dbfb086ff
val_46 FLOAT[3072,768] 12564c19b2d4
val_47 FLOAT[768,2304] c6586a7328b9
val_48 FLOAT[768,768] 26a393d570ff
val_49 FLOAT[768,3072] 687954448b61
val_5 FLOAT[768,3072] 59a9d18b499b
val_50 FLOAT[3072,768] 810b02cf4cdd
val_51 FLOAT[768,1536] 71d4754e252c
val_52 FLOAT[768,768] c42195cb251f
val_53 FLOAT[768,3072] ed2ab8d431d3
val_54 FLOAT[3072,768] 76c2d4e2a2fa
val_6 FLOAT[3072,768] a2725eade962
val_7 FLOAT[768,2304] 3c03491a64ef
val_8 FLOAT[768,768] 4c29ce19a012
val_9 FLOAT[768,3072] 0812790bb4eb
view_target INT64[3] 74424dcdaa1f
visual.trunk.attn_pool.kv.bias FLOAT[1536] 96dc7bab38be
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] b756a524a22f
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] fcc2a49b4f35
visual.trunk.attn_pool.norm.bias FLOAT[768] 9c01f0bd6aed
visual.trunk.attn_pool.norm.weight FLOAT[768] fbd2a506a58f
visual.trunk.attn_pool.proj.bias FLOAT[768] 360f5e491f46
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] cab6f2d344b5
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] c4ecba9a3c46
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] 1340691e504e
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] 826b5f91b088
visual.trunk.blocks.0.norm1.bias FLOAT[768] 0a623fa08cb1
visual.trunk.blocks.0.norm1.weight FLOAT[768] f544d0b35295
visual.trunk.blocks.0.norm2.bias FLOAT[768] 1d9cc98ab74a
visual.trunk.blocks.0.norm2.weight FLOAT[768] 0d6fcef88da2
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] fe433fa56b94
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] 08f32d16140d
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] 14313abe8363
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] a063cab83242
visual.trunk.blocks.1.norm1.bias FLOAT[768] 95183760d61d
visual.trunk.blocks.1.norm1.weight FLOAT[768] 9eb95701db73
visual.trunk.blocks.1.norm2.bias FLOAT[768] 2bafacd335f4
visual.trunk.blocks.1.norm2.weight FLOAT[768] 0521318d8128
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] 883c1671a03c
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] ccc77afd2d71
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] a1fa423adaee
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] 68854b1f9567
visual.trunk.blocks.10.norm1.bias FLOAT[768] 76fcf34d8985
visual.trunk.blocks.10.norm1.weight FLOAT[768] fabbdfb4818a
visual.trunk.blocks.10.norm2.bias FLOAT[768] 9e65558ca63f
visual.trunk.blocks.10.norm2.weight FLOAT[768] 6263d5b11780
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] 2da8a7069cb7
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] 8bc79e3c6eb7
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 8b577b6ec489
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] 9c5de8e2134b
visual.trunk.blocks.11.norm1.bias FLOAT[768] 6fd15c50cad3
visual.trunk.blocks.11.norm1.weight FLOAT[768] f7df0dcc8101
visual.trunk.blocks.11.norm2.bias FLOAT[768] 3b1e178926d7
visual.trunk.blocks.11.norm2.weight FLOAT[768] 37926475f38a
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] 951ad53087b1
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 74f49ad14f02
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 40adeccbd81a
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] 8a64e436367e
visual.trunk.blocks.2.norm1.bias FLOAT[768] 77321f6aa35b
visual.trunk.blocks.2.norm1.weight FLOAT[768] f776e059ccbe
visual.trunk.blocks.2.norm2.bias FLOAT[768] ffbe858537a8
visual.trunk.blocks.2.norm2.weight FLOAT[768] d09f6b8e8cb7
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 461e40c76ff6
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 343bcba8ed68
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] eaec102591c0
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] 745642858143
visual.trunk.blocks.3.norm1.bias FLOAT[768] 0d2dcd12a17a
visual.trunk.blocks.3.norm1.weight FLOAT[768] 04c0a30674ae
visual.trunk.blocks.3.norm2.bias FLOAT[768] 0ed2ab717383
visual.trunk.blocks.3.norm2.weight FLOAT[768] 1ec23748827a
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] f676b1ecc836
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 2e994c442c7b
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] dd96f2c28e20
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] f56e48c1f390
visual.trunk.blocks.4.norm1.bias FLOAT[768] c6fd972e81dd
visual.trunk.blocks.4.norm1.weight FLOAT[768] 7db7e28b9ce3
visual.trunk.blocks.4.norm2.bias FLOAT[768] 4c4b06d2d497
visual.trunk.blocks.4.norm2.weight FLOAT[768] 29f0884bbffd
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] 6fe8b0eab9ef
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] d61aff57d1dd
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] 7190b57a4d9a
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 4de2922af674
visual.trunk.blocks.5.norm1.bias FLOAT[768] 053748ea7034
visual.trunk.blocks.5.norm1.weight FLOAT[768] 8445ed61a033
visual.trunk.blocks.5.norm2.bias FLOAT[768] 56d00f83100a
visual.trunk.blocks.5.norm2.weight FLOAT[768] 24b5e132a280
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 70c4d8673d83
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] 6495830b715f
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 5d4455b0eb70
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] 98e2d20c2a3f
visual.trunk.blocks.6.norm1.bias FLOAT[768] 72aa635218b0
visual.trunk.blocks.6.norm1.weight FLOAT[768] 96b65520ad4c
visual.trunk.blocks.6.norm2.bias FLOAT[768] 4262774ddeb3
visual.trunk.blocks.6.norm2.weight FLOAT[768] f80eab13a5aa
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] cef7a41d0a4a
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 19a7f532849a
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] 02777ff65d9d
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] e0a04503ba0a
visual.trunk.blocks.7.norm1.bias FLOAT[768] f15523802c8e
visual.trunk.blocks.7.norm1.weight FLOAT[768] 17d4f5d7aead
visual.trunk.blocks.7.norm2.bias FLOAT[768] df001b97a365
visual.trunk.blocks.7.norm2.weight FLOAT[768] fa7fce8465c5
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] 1a5643d621b8
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] 4a846e209167
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] 191668074599
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] 7f902238138c
visual.trunk.blocks.8.norm1.bias FLOAT[768] 947ac28772f9
visual.trunk.blocks.8.norm1.weight FLOAT[768] 264f74b575c6
visual.trunk.blocks.8.norm2.bias FLOAT[768] 08946150a71d
visual.trunk.blocks.8.norm2.weight FLOAT[768] 59ea8597b9d9
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] a7bed3756d20
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] db60fe78fabb
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] fd0f2159a6e1
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] 6e9d3f9edb7c
visual.trunk.blocks.9.norm1.bias FLOAT[768] 7d97b275dddb
visual.trunk.blocks.9.norm1.weight FLOAT[768] 6a04d144190b
visual.trunk.blocks.9.norm2.bias FLOAT[768] 86b32f270e23
visual.trunk.blocks.9.norm2.weight FLOAT[768] 8706b6d60ef7
visual.trunk.norm.bias FLOAT[768] 5ee51c5cd4d1
visual.trunk.norm.weight FLOAT[768] ebd6f12b2db4
visual.trunk.patch_embed.proj.bias FLOAT[768] b9ce317708b1
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] e95e500f2e1d
visual.trunk.pos_embed FLOAT[1,256,768] 07fcc897789a
@@ -0,0 +1,571 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
<
float[batch,64,768] add_1071
float[batch,64,768] add_1092
float[batch,64,768] add_119
float[batch,64,768] add_1207
float[batch,64,768] add_1228
float[batch,64,768] add_1343
float[batch,64,768] add_1364
float[batch,64,768] add_140
float[batch,64,768] add_1479
float[batch,64,768] add_1500
float[batch,1,768] add_1500_pooled
float[batch,1,768] add_1615
float[batch,1,768] add_1636
float[batch,64,768] add_255
float[batch,64,768] add_276
float[batch,64,768] add_391
float[batch,64,768] add_4
float[batch,64,768] add_412
float[batch,64,768] add_527
float[batch,64,768] add_548
float[batch,64,768] add_663
float[batch,64,768] add_684
float[batch,64,768] add_799
float[batch,64,768] add_820
float[batch,64,768] add_935
float[batch,64,768] add_956
float[batch,1] clamp_min
float[batch,64,768] embedding
float[batch,64,3072] gelu
float[batch,64,3072] gelu_1
float[batch,64,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,64,3072] gelu_2
float[batch,64,3072] gelu_3
float[batch,64,3072] gelu_4
float[batch,64,3072] gelu_5
float[batch,64,3072] gelu_6
float[batch,64,3072] gelu_7
float[batch,64,3072] gelu_8
float[batch,64,3072] gelu_9
float[batch,64,768] layer_norm
float[batch,64,768] layer_norm_1
float[batch,64,768] layer_norm_10
float[batch,64,768] layer_norm_11
float[batch,64,768] layer_norm_12
float[batch,64,768] layer_norm_13
float[batch,64,768] layer_norm_14
float[batch,64,768] layer_norm_15
float[batch,64,768] layer_norm_16
float[batch,64,768] layer_norm_17
float[batch,64,768] layer_norm_18
float[batch,64,768] layer_norm_19
float[batch,64,768] layer_norm_2
float[batch,64,768] layer_norm_20
float[batch,64,768] layer_norm_21
float[batch,64,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,64,768] layer_norm_3
float[batch,64,768] layer_norm_4
float[batch,64,768] layer_norm_5
float[batch,64,768] layer_norm_6
float[batch,64,768] layer_norm_7
float[batch,64,768] layer_norm_8
float[batch,64,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,64,3072] linear_10
float[batch,64,768] linear_11
float[batch,64,3072] linear_14
float[batch,64,768] linear_15
float[batch,64,3072] linear_18
float[batch,64,768] linear_19
float[batch,64,3072] linear_2
float[batch,64,3072] linear_22
float[batch,64,768] linear_23
float[batch,64,3072] linear_26
float[batch,64,768] linear_27
float[batch,64,768] linear_3
float[batch,64,3072] linear_30
float[batch,64,768] linear_31
float[batch,64,3072] linear_34
float[batch,64,768] linear_35
float[batch,64,3072] linear_38
float[batch,64,768] linear_39
float[batch,64,3072] linear_42
float[batch,64,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,768] linear_48
float[batch,64,3072] linear_6
float[batch,64,768] linear_7
float[batch,64,768] node_scaled_dot_product_attention_10_k
float[batch,64,768] node_scaled_dot_product_attention_10_out
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_q
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_v
float[batch,64,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_v
float[batch,64,768] node_scaled_dot_product_attention_1_k
float[batch,64,768] node_scaled_dot_product_attention_1_out
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_q
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_v
float[batch,64,768] node_scaled_dot_product_attention_2_k
float[batch,64,768] node_scaled_dot_product_attention_2_out
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_q
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_v
float[batch,64,768] node_scaled_dot_product_attention_3_k
float[batch,64,768] node_scaled_dot_product_attention_3_out
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_q
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_v
float[batch,64,768] node_scaled_dot_product_attention_4_k
float[batch,64,768] node_scaled_dot_product_attention_4_out
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_q
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_v
float[batch,64,768] node_scaled_dot_product_attention_5_k
float[batch,64,768] node_scaled_dot_product_attention_5_out
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_q
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_v
float[batch,64,768] node_scaled_dot_product_attention_6_k
float[batch,64,768] node_scaled_dot_product_attention_6_out
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_q
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_v
float[batch,64,768] node_scaled_dot_product_attention_7_k
float[batch,64,768] node_scaled_dot_product_attention_7_out
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_q
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_v
float[batch,64,768] node_scaled_dot_product_attention_8_k
float[batch,64,768] node_scaled_dot_product_attention_8_out
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_q
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_v
float[batch,64,768] node_scaled_dot_product_attention_9_k
float[batch,64,768] node_scaled_dot_product_attention_9_out
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_q
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_v
float[batch,64,768] node_scaled_dot_product_attention_k
float[batch,64,768] node_scaled_dot_product_attention_out
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_q
float[batch,64,2304] node_scaled_dot_product_attention_qkv
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_v
float[batch,64,768] scaled_dot_product_attention
float[batch,64,768] scaled_dot_product_attention_1
float[batch,64,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,64,768] scaled_dot_product_attention_2
float[batch,64,768] scaled_dot_product_attention_3
float[batch,64,768] scaled_dot_product_attention_4
float[batch,64,768] scaled_dot_product_attention_5
float[batch,64,768] scaled_dot_product_attention_6
float[batch,64,768] scaled_dot_product_attention_7
float[batch,64,768] scaled_dot_product_attention_8
float[batch,64,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,64,3072] val_41
float[batch,64,768] val_42
float[batch,64,3072] val_43
float[batch,64,768] val_44
float[batch,64,3072] val_45
float[batch,64,768] val_46
float[batch,64,3072] val_47
float[batch,64,768] val_48
float[batch,64,3072] val_49
float[batch,64,768] val_50
float[batch,64,3072] val_51
float[batch,64,768] val_52
float[batch,64,3072] val_53
float[batch,64,768] val_54
float[batch,64,3072] val_55
float[batch,64,768] val_56
float[batch,64,3072] val_57
float[batch,64,768] val_58
float[batch,64,3072] val_59
float[batch,64,768] val_60
float[batch,64,3072] val_61
float[batch,64,768] val_62
float[batch,1,3072] val_63
float[batch,1,768] val_64
float[batch,768] val_65
>
{
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_40)
add_4 = Add (embedding, "text.positional_embedding")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
val_41 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_42 = MatMul (gelu, val_6)
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
val_43 = MatMul (layer_norm_3, val_8)
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_44 = MatMul (gelu_1, val_9)
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
val_45 = MatMul (layer_norm_5, val_11)
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_46 = MatMul (gelu_2, val_12)
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
val_47 = MatMul (layer_norm_7, val_14)
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_48 = MatMul (gelu_3, val_15)
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
val_49 = MatMul (layer_norm_9, val_17)
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_50 = MatMul (gelu_4, val_18)
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
val_51 = MatMul (layer_norm_11, val_20)
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_52 = MatMul (gelu_5, val_21)
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
val_53 = MatMul (layer_norm_13, val_23)
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_54 = MatMul (gelu_6, val_24)
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
val_55 = MatMul (layer_norm_15, val_26)
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_56 = MatMul (gelu_7, val_27)
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
val_57 = MatMul (layer_norm_17, val_29)
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_58 = MatMul (gelu_8, val_30)
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
val_59 = MatMul (layer_norm_19, val_32)
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_60 = MatMul (gelu_9, val_33)
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
val_61 = MatMul (layer_norm_21, val_35)
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_62 = MatMul (gelu_10, val_36)
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_38)
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_39)
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = Squeeze (add_1636, val_2)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (linear_48, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] e3e314874d27
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] be5d0feaa765
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 9b0bcc50a03b
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] e0c300ded0d1
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 8e9bc904dd37
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 0d16a5ff9548
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] b314c78a0d14
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 0a9cec00802d
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 6a0d8913322f
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] f8417a0c1597
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ee6cc1fe5f3b
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 4e149f60d2f4
text.ln_final.bias FLOAT[768] 1ec61ad20500
text.ln_final.weight FLOAT[768] dacb6223bcd5
text.positional_embedding FLOAT[64,768] fd11bfed66ce
text.text_projection.bias FLOAT[768] ead834f406de
text.text_projection.weight FLOAT[768,768] 4e16691c5638
text.token_embedding.weight_fp16 FLOAT16[32000,768] 190621409d9e
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 8c241323e598
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 4195344120a7
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 084c2b231e82
text.transformer.resblocks.0.ln_1.weight FLOAT[768] ed4f3ae8e6a6
text.transformer.resblocks.0.ln_2.bias FLOAT[768] 87d34f01b29a
text.transformer.resblocks.0.ln_2.weight FLOAT[768] 31a223605695
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] f9fc6107af33
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 4975de95fe1b
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 81f650047e05
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 54470a766244
text.transformer.resblocks.1.ln_1.bias FLOAT[768] b910086ea3ea
text.transformer.resblocks.1.ln_1.weight FLOAT[768] 388434446922
text.transformer.resblocks.1.ln_2.bias FLOAT[768] ce3b55158de7
text.transformer.resblocks.1.ln_2.weight FLOAT[768] b17d40b86179
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 12b9c3932802
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] df56778ab0d4
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 93cff3986cba
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] eb680a634edd
text.transformer.resblocks.10.ln_1.bias FLOAT[768] a5845b82e349
text.transformer.resblocks.10.ln_1.weight FLOAT[768] c3987976475f
text.transformer.resblocks.10.ln_2.bias FLOAT[768] 4d4f7cc9c267
text.transformer.resblocks.10.ln_2.weight FLOAT[768] a18d6adcf19c
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 963383e3e5a2
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 1cd2a05fb0e0
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] b78c708cd43f
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 7de33a830749
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 1c5e9c4746f2
text.transformer.resblocks.11.ln_1.weight FLOAT[768] cf61c3d5850b
text.transformer.resblocks.11.ln_2.bias FLOAT[768] 394ac7dae725
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 92e2578dde78
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] dba3b39229ef
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] d229747b5e71
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] b05784c08be5
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 26d459ab01fa
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 01f650d18464
text.transformer.resblocks.2.ln_1.weight FLOAT[768] a1b2dd6b13fb
text.transformer.resblocks.2.ln_2.bias FLOAT[768] b7d6eb97e9ac
text.transformer.resblocks.2.ln_2.weight FLOAT[768] 9f9229a4f544
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 3473e6bbe556
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] fad23dbace3a
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] de3a817d8abf
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 5c2adaefefa6
text.transformer.resblocks.3.ln_1.bias FLOAT[768] f87dc097a1f7
text.transformer.resblocks.3.ln_1.weight FLOAT[768] cf22932704db
text.transformer.resblocks.3.ln_2.bias FLOAT[768] 09220a55fa46
text.transformer.resblocks.3.ln_2.weight FLOAT[768] f5c8c417801c
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] bfd0ef0afef1
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 123e42d2ba93
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] e73dc8abf38e
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 3a0e4deb8dd3
text.transformer.resblocks.4.ln_1.bias FLOAT[768] 536b15819585
text.transformer.resblocks.4.ln_1.weight FLOAT[768] ccb556dddcc7
text.transformer.resblocks.4.ln_2.bias FLOAT[768] e14964da0f79
text.transformer.resblocks.4.ln_2.weight FLOAT[768] 7e6387354f58
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 0de31daaf317
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 8e4cb4fb424d
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 453d338d2107
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 10fea6f54207
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 6e940e2083a6
text.transformer.resblocks.5.ln_1.weight FLOAT[768] b91bbcc4434d
text.transformer.resblocks.5.ln_2.bias FLOAT[768] 18aa30c27579
text.transformer.resblocks.5.ln_2.weight FLOAT[768] b8a112953d38
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 080abe2a797e
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 7ae2b8a29c58
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 23cd8d63357c
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] a8ee8c4b2fc7
text.transformer.resblocks.6.ln_1.bias FLOAT[768] 0d610ac2b0e5
text.transformer.resblocks.6.ln_1.weight FLOAT[768] 462aad63aadc
text.transformer.resblocks.6.ln_2.bias FLOAT[768] 5b415bb2743d
text.transformer.resblocks.6.ln_2.weight FLOAT[768] 0a491346bd2e
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] a10af2391e96
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 0149fd8ac0ed
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 5e44e4c458b3
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 013c3ca0c7ac
text.transformer.resblocks.7.ln_1.bias FLOAT[768] f316304b4119
text.transformer.resblocks.7.ln_1.weight FLOAT[768] 33e5f2b979fc
text.transformer.resblocks.7.ln_2.bias FLOAT[768] 98852563efcc
text.transformer.resblocks.7.ln_2.weight FLOAT[768] 75d7be8f4ed9
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 9bfc1ed8e307
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 397dbb7b7774
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] eaa3ee25f96b
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 43bdb9b374b6
text.transformer.resblocks.8.ln_1.bias FLOAT[768] 6f9f254f5151
text.transformer.resblocks.8.ln_1.weight FLOAT[768] f5dc4db9dc09
text.transformer.resblocks.8.ln_2.bias FLOAT[768] 1e073c231de9
text.transformer.resblocks.8.ln_2.weight FLOAT[768] bb6016c07b00
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] aa69fd06ec27
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] edab1478ca13
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 6aa50e1966cc
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 53e2431cd6a3
text.transformer.resblocks.9.ln_1.bias FLOAT[768] 7a1e8a6b4d36
text.transformer.resblocks.9.ln_1.weight FLOAT[768] ad2da14668cc
text.transformer.resblocks.9.ln_2.bias FLOAT[768] 2ed3cde50ce8
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 863e2856e7e8
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 442a2dc44e38
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 7b25715597e4
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,2304] 8a075912fae9
val_11 FLOAT[768,3072] 36adbe68e72a
val_12 FLOAT[3072,768] 4fcf41fb818a
val_13 FLOAT[768,2304] caa1615f0619
val_14 FLOAT[768,3072] 1fcbcb69269e
val_15 FLOAT[3072,768] 17696399229c
val_16 FLOAT[768,2304] 8cc52d20687f
val_17 FLOAT[768,3072] 192e4affc213
val_18 FLOAT[3072,768] 18ed26ba9b34
val_19 FLOAT[768,2304] e5e1326db28c
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,3072] b451a161cfae
val_21 FLOAT[3072,768] 03937cd5dd63
val_22 FLOAT[768,2304] 19363a158dac
val_23 FLOAT[768,3072] 35da8f7aa508
val_24 FLOAT[3072,768] d5dd444e52b6
val_25 FLOAT[768,2304] 63393af55424
val_26 FLOAT[768,3072] edb60e1c3ebb
val_27 FLOAT[3072,768] 32b952096926
val_28 FLOAT[768,2304] 451d24214bd3
val_29 FLOAT[768,3072] 3ae9b0aaa050
val_3 INT64[1] 6a69a6cc7473
val_30 FLOAT[3072,768] 1c3b4fca56d8
val_31 FLOAT[768,2304] ace122a5772a
val_32 FLOAT[768,3072] af90e42c0e7a
val_33 FLOAT[3072,768] 236264f07db3
val_34 FLOAT[768,2304] f26b17faaf2d
val_35 FLOAT[768,3072] 65f2387927fc
val_36 FLOAT[3072,768] 8686c4a05fe9
val_37 FLOAT[768,2304] bf631a1fdfab
val_38 FLOAT[768,3072] d4ac43c6663a
val_39 FLOAT[3072,768] de1130f8d72c
val_4 FLOAT[768,2304] c0c0ce9b77b5
val_5 FLOAT[768,3072] 715a23a00136
val_6 FLOAT[3072,768] 7ab98d4cafa2
val_7 FLOAT[768,2304] e90164fba7fd
val_8 FLOAT[768,3072] 7e3beeb4c746
val_9 FLOAT[3072,768] 691f7d73d296
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,384,384,3] image) => (float[batch,768] image_embedding)
<
float[batch,576,768] add_1007
float[batch,576,768] add_1068
float[batch,576,768] add_107
float[batch,576,768] add_1097
float[batch,1,768] add_1195
float[batch,576,768] add_13
float[batch,576,768] add_168
float[batch,576,768] add_197
float[batch,576,768] add_258
float[batch,576,768] add_287
float[batch,576,768] add_348
float[batch,576,768] add_377
float[batch,576,768] add_438
float[batch,576,768] add_467
float[batch,576,768] add_528
float[batch,576,768] add_557
float[batch,576,768] add_618
float[batch,576,768] add_647
float[batch,576,768] add_708
float[batch,576,768] add_737
float[batch,576,768] add_78
float[batch,576,768] add_798
float[batch,576,768] add_827
float[batch,576,768] add_888
float[batch,576,768] add_917
float[batch,576,768] add_978
float[batch,1] clamp_min
float[batch,768,24,24] conv2d
float[batch,576,3072] gelu
float[batch,576,3072] gelu_1
float[batch,576,3072] gelu_10
float[batch,576,3072] gelu_11
float[batch,1,3072] gelu_12
float[batch,576,3072] gelu_2
float[batch,576,3072] gelu_3
float[batch,576,3072] gelu_4
float[batch,576,3072] gelu_5
float[batch,576,3072] gelu_6
float[batch,576,3072] gelu_7
float[batch,576,3072] gelu_8
float[batch,576,3072] gelu_9
float[batch,3,384,384] image_chw
float[batch] image_ez
float[batch] image_ez_r
float[batch,1,1,1] image_ez_s
float[batch,384,384,3] image_f32
float[batch,576,768] layer_norm
float[batch,576,768] layer_norm_1
float[batch,576,768] layer_norm_10
float[batch,576,768] layer_norm_11
float[batch,576,768] layer_norm_12
float[batch,576,768] layer_norm_13
float[batch,576,768] layer_norm_14
float[batch,576,768] layer_norm_15
float[batch,576,768] layer_norm_16
float[batch,576,768] layer_norm_17
float[batch,576,768] layer_norm_18
float[batch,576,768] layer_norm_19
float[batch,576,768] layer_norm_2
float[batch,576,768] layer_norm_20
float[batch,576,768] layer_norm_21
float[batch,576,768] layer_norm_22
float[batch,576,768] layer_norm_23
float[batch,576,768] layer_norm_24
float[batch,1,768] layer_norm_25
float[batch,576,768] layer_norm_3
float[batch,576,768] layer_norm_4
float[batch,576,768] layer_norm_5
float[batch,576,768] layer_norm_6
float[batch,576,768] layer_norm_7
float[batch,576,768] layer_norm_8
float[batch,576,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,576,2304] linear
float[batch,576,768] linear_1
float[batch,576,3072] linear_10
float[batch,576,768] linear_11
float[batch,576,2304] linear_12
float[batch,576,768] linear_13
float[batch,576,3072] linear_14
float[batch,576,768] linear_15
float[batch,576,2304] linear_16
float[batch,576,768] linear_17
float[batch,576,3072] linear_18
float[batch,576,768] linear_19
float[batch,576,3072] linear_2
float[batch,576,2304] linear_20
float[batch,576,768] linear_21
float[batch,576,3072] linear_22
float[batch,576,768] linear_23
float[batch,576,2304] linear_24
float[batch,576,768] linear_25
float[batch,576,3072] linear_26
float[batch,576,768] linear_27
float[batch,576,2304] linear_28
float[batch,576,768] linear_29
float[batch,576,768] linear_3
float[batch,576,3072] linear_30
float[batch,576,768] linear_31
float[batch,576,2304] linear_32
float[batch,576,768] linear_33
float[batch,576,3072] linear_34
float[batch,576,768] linear_35
float[batch,576,2304] linear_36
float[batch,576,768] linear_37
float[batch,576,3072] linear_38
float[batch,576,768] linear_39
float[batch,576,2304] linear_4
float[batch,576,2304] linear_40
float[batch,576,768] linear_41
float[batch,576,3072] linear_42
float[batch,576,768] linear_43
float[batch,576,2304] linear_44
float[batch,576,768] linear_45
float[batch,576,3072] linear_46
float[batch,576,768] linear_47
float[batch,576,1536] linear_49
float[batch,576,768] linear_5
float[batch,1,768] linear_50
float[batch,1,3072] linear_51
float[batch,1,768] linear_52
float[batch,576,3072] linear_6
float[batch,576,768] linear_7
float[batch,576,2304] linear_8
float[batch,576,768] linear_9
float[batch,576,768] node_scaled_dot_product_attention_10_k
float[batch,576,768] node_scaled_dot_product_attention_10_q
float[batch,576,768] node_scaled_dot_product_attention_10_v
float[batch,576,768] node_scaled_dot_product_attention_11_k
float[batch,576,768] node_scaled_dot_product_attention_11_q
float[batch,576,768] node_scaled_dot_product_attention_11_v
float[batch,576,768] node_scaled_dot_product_attention_12_k
float[batch,1,768] node_scaled_dot_product_attention_12_q
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
float[batch,576,768] node_scaled_dot_product_attention_12_v
float[batch,576,768] node_scaled_dot_product_attention_1_k
float[batch,576,768] node_scaled_dot_product_attention_1_q
float[batch,576,768] node_scaled_dot_product_attention_1_v
float[batch,576,768] node_scaled_dot_product_attention_2_k
float[batch,576,768] node_scaled_dot_product_attention_2_q
float[batch,576,768] node_scaled_dot_product_attention_2_v
float[batch,576,768] node_scaled_dot_product_attention_3_k
float[batch,576,768] node_scaled_dot_product_attention_3_q
float[batch,576,768] node_scaled_dot_product_attention_3_v
float[batch,576,768] node_scaled_dot_product_attention_4_k
float[batch,576,768] node_scaled_dot_product_attention_4_q
float[batch,576,768] node_scaled_dot_product_attention_4_v
float[batch,576,768] node_scaled_dot_product_attention_5_k
float[batch,576,768] node_scaled_dot_product_attention_5_q
float[batch,576,768] node_scaled_dot_product_attention_5_v
float[batch,576,768] node_scaled_dot_product_attention_6_k
float[batch,576,768] node_scaled_dot_product_attention_6_q
float[batch,576,768] node_scaled_dot_product_attention_6_v
float[batch,576,768] node_scaled_dot_product_attention_7_k
float[batch,576,768] node_scaled_dot_product_attention_7_q
float[batch,576,768] node_scaled_dot_product_attention_7_v
float[batch,576,768] node_scaled_dot_product_attention_8_k
float[batch,576,768] node_scaled_dot_product_attention_8_q
float[batch,576,768] node_scaled_dot_product_attention_8_v
float[batch,576,768] node_scaled_dot_product_attention_9_k
float[batch,576,768] node_scaled_dot_product_attention_9_q
float[batch,576,768] node_scaled_dot_product_attention_9_v
float[batch,576,768] node_scaled_dot_product_attention_k
float[batch,576,768] node_scaled_dot_product_attention_q
float[batch,576,768] node_scaled_dot_product_attention_v
float[batch,576,768] scaled_dot_product_attention
float[batch,576,768] scaled_dot_product_attention_1
float[batch,576,768] scaled_dot_product_attention_10
float[batch,576,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_12
float[batch,576,768] scaled_dot_product_attention_2
float[batch,576,768] scaled_dot_product_attention_3
float[batch,576,768] scaled_dot_product_attention_4
float[batch,576,768] scaled_dot_product_attention_5
float[batch,576,768] scaled_dot_product_attention_6
float[batch,576,768] scaled_dot_product_attention_7
float[batch,576,768] scaled_dot_product_attention_8
float[batch,576,768] scaled_dot_product_attention_9
float[batch,768] select
float[batch,576,768] transpose
float[batch,576,768] val_100
float[batch,576,3072] val_101
float[batch,576,768] val_102
float[batch,576,1536] val_103
float[batch,1,768] val_104
float[batch,1,3072] val_105
float[batch,1,768] val_106
float[batch,576,2304] val_55
float[batch,576,768] val_56
float[batch,576,3072] val_57
float[batch,576,768] val_58
float[batch,576,2304] val_59
float[batch,576,768] val_60
float[batch,576,3072] val_61
float[batch,576,768] val_62
float[batch,576,2304] val_63
float[batch,576,768] val_64
float[batch,576,3072] val_65
float[batch,576,768] val_66
float[batch,576,2304] val_67
float[batch,576,768] val_68
float[batch,576,3072] val_69
float[batch,576,768] val_70
float[batch,576,2304] val_71
float[batch,576,768] val_72
float[batch,576,3072] val_73
float[batch,576,768] val_74
float[batch,576,2304] val_75
float[batch,576,768] val_76
float[batch,576,3072] val_77
float[batch,576,768] val_78
float[batch,576,2304] val_79
float[batch,576,768] val_80
float[batch,576,3072] val_81
float[batch,576,768] val_82
float[batch,576,2304] val_83
float[batch,576,768] val_84
float[batch,576,3072] val_85
float[batch,576,768] val_86
float[batch,576,2304] val_87
float[batch,576,768] val_88
float[batch,576,3072] val_89
float[batch,576,768] val_90
float[batch,576,2304] val_91
float[batch,576,768] val_92
float[batch,576,3072] val_93
float[batch,576,768] val_94
float[batch,576,2304] val_95
float[batch,576,768] val_96
float[batch,576,3072] val_97
float[batch,576,768] val_98
float[batch,576,2304] val_99
float[batch,768,576] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
add_13 = Add (transpose, "visual.trunk.pos_embed")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
val_55 = MatMul (layer_norm, val_3)
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
val_56 = MatMul (scaled_dot_product_attention, val_4)
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
add_78 = Add (add_13, linear_1)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
val_57 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_58 = MatMul (gelu, val_6)
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
add_107 = Add (add_78, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
val_59 = MatMul (layer_norm_2, val_7)
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
add_168 = Add (add_107, linear_5)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
val_61 = MatMul (layer_norm_3, val_9)
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_62 = MatMul (gelu_1, val_10)
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
add_197 = Add (add_168, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
val_63 = MatMul (layer_norm_4, val_11)
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
add_258 = Add (add_197, linear_9)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
val_65 = MatMul (layer_norm_5, val_13)
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_66 = MatMul (gelu_2, val_14)
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
add_287 = Add (add_258, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
val_67 = MatMul (layer_norm_6, val_15)
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
add_348 = Add (add_287, linear_13)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
val_69 = MatMul (layer_norm_7, val_17)
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_70 = MatMul (gelu_3, val_18)
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
add_377 = Add (add_348, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
val_71 = MatMul (layer_norm_8, val_19)
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
add_438 = Add (add_377, linear_17)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
val_73 = MatMul (layer_norm_9, val_21)
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_74 = MatMul (gelu_4, val_22)
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
add_467 = Add (add_438, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
val_75 = MatMul (layer_norm_10, val_23)
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
add_528 = Add (add_467, linear_21)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
val_77 = MatMul (layer_norm_11, val_25)
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_78 = MatMul (gelu_5, val_26)
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
add_557 = Add (add_528, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
val_79 = MatMul (layer_norm_12, val_27)
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
add_618 = Add (add_557, linear_25)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
val_81 = MatMul (layer_norm_13, val_29)
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_82 = MatMul (gelu_6, val_30)
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
add_647 = Add (add_618, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
val_83 = MatMul (layer_norm_14, val_31)
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
add_708 = Add (add_647, linear_29)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
val_85 = MatMul (layer_norm_15, val_33)
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_86 = MatMul (gelu_7, val_34)
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
add_737 = Add (add_708, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
val_87 = MatMul (layer_norm_16, val_35)
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
add_798 = Add (add_737, linear_33)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
val_89 = MatMul (layer_norm_17, val_37)
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_90 = MatMul (gelu_8, val_38)
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
add_827 = Add (add_798, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
val_91 = MatMul (layer_norm_18, val_39)
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
add_888 = Add (add_827, linear_37)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
val_93 = MatMul (layer_norm_19, val_41)
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_94 = MatMul (gelu_9, val_42)
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
add_917 = Add (add_888, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
val_95 = MatMul (layer_norm_20, val_43)
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
add_978 = Add (add_917, linear_41)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
val_97 = MatMul (layer_norm_21, val_45)
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_98 = MatMul (gelu_10, val_46)
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
add_1007 = Add (add_978, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
val_99 = MatMul (layer_norm_22, val_47)
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
add_1068 = Add (add_1007, linear_45)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
val_101 = MatMul (layer_norm_23, val_49)
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_102 = MatMul (gelu_11, val_50)
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
add_1097 = Add (add_1068, linear_47)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
val_103 = MatMul (layer_norm_24, val_51)
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
val_105 = MatMul (layer_norm_25, val_53)
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
val_106 = MatMul (gelu_12, val_54)
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
add_1195 = Add (linear_50, linear_52)
select = Squeeze (add_1195, val_2)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
attn3d_split_2x768 INT64[2] 6b8b40015c71
attn3d_split_3x768 INT64[3] eca50b2daf34
image_ez_axes INT64[3] e2e2033ae7e1
image_ez_ends INT64[3] 605390e5a369
image_ez_starts INT64[3] 9d908ecfb6b2
image_ez_zero FLOAT[] df3f619804a9
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] dffc0d264ff1
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[3072,768] 32cd85868898
val_11 FLOAT[768,2304] 0c95f36ac6d8
val_12 FLOAT[768,768] dc0376d94bd3
val_13 FLOAT[768,3072] d32dcfd11534
val_14 FLOAT[3072,768] ec29e8c9b643
val_15 FLOAT[768,2304] 807c2301ee50
val_16 FLOAT[768,768] 188e9408f9d1
val_17 FLOAT[768,3072] ba83e1632c83
val_18 FLOAT[3072,768] ce69886f3a25
val_19 FLOAT[768,2304] f80dfd5f872e
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,768] 300dc013ea62
val_21 FLOAT[768,3072] 8d41909dffcc
val_22 FLOAT[3072,768] 40f90beee17e
val_23 FLOAT[768,2304] e10a2f2b9e15
val_24 FLOAT[768,768] f56e07886a8e
val_25 FLOAT[768,3072] 961b5e11a6c5
val_26 FLOAT[3072,768] 93bf5664b0b4
val_27 FLOAT[768,2304] 1978daad9423
val_28 FLOAT[768,768] f3ea6414c3e8
val_29 FLOAT[768,3072] 71619d740a6b
val_3 FLOAT[768,2304] 72ec385c7c4b
val_30 FLOAT[3072,768] 3aea33a66e61
val_31 FLOAT[768,2304] 52e79e2b56a9
val_32 FLOAT[768,768] 33505e27cf19
val_33 FLOAT[768,3072] 422c73ab1e1f
val_34 FLOAT[3072,768] 188e76ccc2ae
val_35 FLOAT[768,2304] 48497931487f
val_36 FLOAT[768,768] 5bec50b866d7
val_37 FLOAT[768,3072] f5017e94bcdd
val_38 FLOAT[3072,768] 1d962a7c6db9
val_39 FLOAT[768,2304] 666ec36c4f2f
val_4 FLOAT[768,768] de718acfb152
val_40 FLOAT[768,768] 37e9f2efb165
val_41 FLOAT[768,3072] 7a23d8b465d8
val_42 FLOAT[3072,768] 43c8c05ceb08
val_43 FLOAT[768,2304] 24740324f5b8
val_44 FLOAT[768,768] 5ea9b10dad3e
val_45 FLOAT[768,3072] 3b8aa8a5871f
val_46 FLOAT[3072,768] 6918855e7f0c
val_47 FLOAT[768,2304] e21fd24e37c6
val_48 FLOAT[768,768] 596e5623a177
val_49 FLOAT[768,3072] c4756558133d
val_5 FLOAT[768,3072] c9dad04cda7e
val_50 FLOAT[3072,768] 00b4b147ba1c
val_51 FLOAT[768,1536] d9a820c601e1
val_52 FLOAT[768,768] 2850e68de8ab
val_53 FLOAT[768,3072] 630e2665c2b3
val_54 FLOAT[3072,768] bd2bbab71426
val_6 FLOAT[3072,768] b950b44d8157
val_7 FLOAT[768,2304] ddbfcdb6ded7
val_8 FLOAT[768,768] d3126cb5cc9e
val_9 FLOAT[768,3072] 326343a14a92
view_target INT64[3] 8d30e545cb18
visual.trunk.attn_pool.kv.bias FLOAT[1536] 5ea0f83309db
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] 82abe8523fc5
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] f36c88ccdd1c
visual.trunk.attn_pool.norm.bias FLOAT[768] c8e6a0807c68
visual.trunk.attn_pool.norm.weight FLOAT[768] e835a27353ba
visual.trunk.attn_pool.proj.bias FLOAT[768] 4d52d9b8b89f
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] fb32c6be05e3
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] 55e049eacf53
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] b9b570ce2dea
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] fd77992c093c
visual.trunk.blocks.0.norm1.bias FLOAT[768] 7379ec576226
visual.trunk.blocks.0.norm1.weight FLOAT[768] 9e4c9a1b13b4
visual.trunk.blocks.0.norm2.bias FLOAT[768] f08a93181100
visual.trunk.blocks.0.norm2.weight FLOAT[768] b8011a1d95f1
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] 1cbc4b64b3e8
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] 0b8c21d1ff53
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] a2adbf3d4bbb
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] a959e5bc92b9
visual.trunk.blocks.1.norm1.bias FLOAT[768] 56ce557ea4bf
visual.trunk.blocks.1.norm1.weight FLOAT[768] 4ddc2b23debf
visual.trunk.blocks.1.norm2.bias FLOAT[768] 7194924db9f7
visual.trunk.blocks.1.norm2.weight FLOAT[768] a8abd52f9560
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] 0f20cecf99fe
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] 19e6fe9db881
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] f1afe1d3b7b1
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] b8d433a102d7
visual.trunk.blocks.10.norm1.bias FLOAT[768] 8e627d2fa6de
visual.trunk.blocks.10.norm1.weight FLOAT[768] 3d73b0510054
visual.trunk.blocks.10.norm2.bias FLOAT[768] cbdd4a408d1e
visual.trunk.blocks.10.norm2.weight FLOAT[768] 43bfc6ab20d1
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] 44482ba61475
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] e059ac53b0fc
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 7e19edd90652
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] b39fc33767ba
visual.trunk.blocks.11.norm1.bias FLOAT[768] a271ce503b17
visual.trunk.blocks.11.norm1.weight FLOAT[768] d98f5440e39a
visual.trunk.blocks.11.norm2.bias FLOAT[768] 35f33989da53
visual.trunk.blocks.11.norm2.weight FLOAT[768] 988b9e3b7e42
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] fcbb3274615d
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 28e262d42ccb
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 38f84a2c14f5
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] 7f2f7e1c60a6
visual.trunk.blocks.2.norm1.bias FLOAT[768] 535579aeb4c9
visual.trunk.blocks.2.norm1.weight FLOAT[768] 2384c7e1e9d9
visual.trunk.blocks.2.norm2.bias FLOAT[768] 92d37fb6398d
visual.trunk.blocks.2.norm2.weight FLOAT[768] 09e1542afd4f
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 7011ffd49dbe
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 85e3c91f6f45
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] 655f94f08630
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] 40062e1d2dfc
visual.trunk.blocks.3.norm1.bias FLOAT[768] 5163b075cc33
visual.trunk.blocks.3.norm1.weight FLOAT[768] b6303a1bf974
visual.trunk.blocks.3.norm2.bias FLOAT[768] b89747ae9c38
visual.trunk.blocks.3.norm2.weight FLOAT[768] 53330c999e0c
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] 9ffd9b3ea44b
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 7783677dfe2e
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] 3d45a716fe0a
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] b593d876de9d
visual.trunk.blocks.4.norm1.bias FLOAT[768] ecb8263f1456
visual.trunk.blocks.4.norm1.weight FLOAT[768] b57a681c5c74
visual.trunk.blocks.4.norm2.bias FLOAT[768] f2a9edc8f8fa
visual.trunk.blocks.4.norm2.weight FLOAT[768] 2f18b6c7d914
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] c91ad71190de
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] 8244e316061c
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] a48a6a380283
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 3e38a87eb086
visual.trunk.blocks.5.norm1.bias FLOAT[768] a2ee084997fa
visual.trunk.blocks.5.norm1.weight FLOAT[768] 59287c46aa60
visual.trunk.blocks.5.norm2.bias FLOAT[768] 4babc45cb3fc
visual.trunk.blocks.5.norm2.weight FLOAT[768] 212beef92293
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 896920c19ea9
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] 92c34260cd0b
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] c76a297dd8a2
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] ea8ee09f2755
visual.trunk.blocks.6.norm1.bias FLOAT[768] 2db5744a1bed
visual.trunk.blocks.6.norm1.weight FLOAT[768] 8b4b086907da
visual.trunk.blocks.6.norm2.bias FLOAT[768] b4a1ec75fa58
visual.trunk.blocks.6.norm2.weight FLOAT[768] 7ad41d612a60
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] 801aa993b1fd
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 56149f5cebb8
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] ab0cc1552be0
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] 1bf8a4aad1bc
visual.trunk.blocks.7.norm1.bias FLOAT[768] 250aa82d3076
visual.trunk.blocks.7.norm1.weight FLOAT[768] 3fc4c9edbbde
visual.trunk.blocks.7.norm2.bias FLOAT[768] 19305c0b6e66
visual.trunk.blocks.7.norm2.weight FLOAT[768] c477fdc172b6
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] fc01102ca7e2
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] d7b14a7a9c9d
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] 1b417b9a2220
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] e18b0d0221b2
visual.trunk.blocks.8.norm1.bias FLOAT[768] d4592155ea6a
visual.trunk.blocks.8.norm1.weight FLOAT[768] c8daa76e003e
visual.trunk.blocks.8.norm2.bias FLOAT[768] 7e1cf2d8d005
visual.trunk.blocks.8.norm2.weight FLOAT[768] 15fef7298d14
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] 5ca6136dedf3
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] a0dd0ebd8544
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] b91a525b1353
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] eec0491754ac
visual.trunk.blocks.9.norm1.bias FLOAT[768] e9d6b6770f4c
visual.trunk.blocks.9.norm1.weight FLOAT[768] 0728df499e34
visual.trunk.blocks.9.norm2.bias FLOAT[768] dd570703020f
visual.trunk.blocks.9.norm2.weight FLOAT[768] 1007bbaba35d
visual.trunk.norm.bias FLOAT[768] 0996d37acedf
visual.trunk.norm.weight FLOAT[768] e0220bdaf431
visual.trunk.patch_embed.proj.bias FLOAT[768] f242e94ef0bb
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] 6720fd78d7a5
visual.trunk.pos_embed FLOAT[1,576,768] 8f050e0de1a7
@@ -0,0 +1,571 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
<
float[batch,64,768] add_1071
float[batch,64,768] add_1092
float[batch,64,768] add_119
float[batch,64,768] add_1207
float[batch,64,768] add_1228
float[batch,64,768] add_1343
float[batch,64,768] add_1364
float[batch,64,768] add_140
float[batch,64,768] add_1479
float[batch,64,768] add_1500
float[batch,1,768] add_1500_pooled
float[batch,1,768] add_1615
float[batch,1,768] add_1636
float[batch,64,768] add_255
float[batch,64,768] add_276
float[batch,64,768] add_391
float[batch,64,768] add_4
float[batch,64,768] add_412
float[batch,64,768] add_527
float[batch,64,768] add_548
float[batch,64,768] add_663
float[batch,64,768] add_684
float[batch,64,768] add_799
float[batch,64,768] add_820
float[batch,64,768] add_935
float[batch,64,768] add_956
float[batch,1] clamp_min
float[batch,64,768] embedding
float[batch,64,3072] gelu
float[batch,64,3072] gelu_1
float[batch,64,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,64,3072] gelu_2
float[batch,64,3072] gelu_3
float[batch,64,3072] gelu_4
float[batch,64,3072] gelu_5
float[batch,64,3072] gelu_6
float[batch,64,3072] gelu_7
float[batch,64,3072] gelu_8
float[batch,64,3072] gelu_9
float[batch,64,768] layer_norm
float[batch,64,768] layer_norm_1
float[batch,64,768] layer_norm_10
float[batch,64,768] layer_norm_11
float[batch,64,768] layer_norm_12
float[batch,64,768] layer_norm_13
float[batch,64,768] layer_norm_14
float[batch,64,768] layer_norm_15
float[batch,64,768] layer_norm_16
float[batch,64,768] layer_norm_17
float[batch,64,768] layer_norm_18
float[batch,64,768] layer_norm_19
float[batch,64,768] layer_norm_2
float[batch,64,768] layer_norm_20
float[batch,64,768] layer_norm_21
float[batch,64,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,64,768] layer_norm_3
float[batch,64,768] layer_norm_4
float[batch,64,768] layer_norm_5
float[batch,64,768] layer_norm_6
float[batch,64,768] layer_norm_7
float[batch,64,768] layer_norm_8
float[batch,64,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,64,3072] linear_10
float[batch,64,768] linear_11
float[batch,64,3072] linear_14
float[batch,64,768] linear_15
float[batch,64,3072] linear_18
float[batch,64,768] linear_19
float[batch,64,3072] linear_2
float[batch,64,3072] linear_22
float[batch,64,768] linear_23
float[batch,64,3072] linear_26
float[batch,64,768] linear_27
float[batch,64,768] linear_3
float[batch,64,3072] linear_30
float[batch,64,768] linear_31
float[batch,64,3072] linear_34
float[batch,64,768] linear_35
float[batch,64,3072] linear_38
float[batch,64,768] linear_39
float[batch,64,3072] linear_42
float[batch,64,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,768] linear_48
float[batch,64,3072] linear_6
float[batch,64,768] linear_7
float[batch,64,768] node_scaled_dot_product_attention_10_k
float[batch,64,768] node_scaled_dot_product_attention_10_out
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_q
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_v
float[batch,64,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_v
float[batch,64,768] node_scaled_dot_product_attention_1_k
float[batch,64,768] node_scaled_dot_product_attention_1_out
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_q
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_v
float[batch,64,768] node_scaled_dot_product_attention_2_k
float[batch,64,768] node_scaled_dot_product_attention_2_out
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_q
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_v
float[batch,64,768] node_scaled_dot_product_attention_3_k
float[batch,64,768] node_scaled_dot_product_attention_3_out
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_q
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_v
float[batch,64,768] node_scaled_dot_product_attention_4_k
float[batch,64,768] node_scaled_dot_product_attention_4_out
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_q
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_v
float[batch,64,768] node_scaled_dot_product_attention_5_k
float[batch,64,768] node_scaled_dot_product_attention_5_out
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_q
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_v
float[batch,64,768] node_scaled_dot_product_attention_6_k
float[batch,64,768] node_scaled_dot_product_attention_6_out
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_q
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_v
float[batch,64,768] node_scaled_dot_product_attention_7_k
float[batch,64,768] node_scaled_dot_product_attention_7_out
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_q
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_v
float[batch,64,768] node_scaled_dot_product_attention_8_k
float[batch,64,768] node_scaled_dot_product_attention_8_out
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_q
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_v
float[batch,64,768] node_scaled_dot_product_attention_9_k
float[batch,64,768] node_scaled_dot_product_attention_9_out
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_q
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_v
float[batch,64,768] node_scaled_dot_product_attention_k
float[batch,64,768] node_scaled_dot_product_attention_out
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_q
float[batch,64,2304] node_scaled_dot_product_attention_qkv
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_v
float[batch,64,768] scaled_dot_product_attention
float[batch,64,768] scaled_dot_product_attention_1
float[batch,64,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,64,768] scaled_dot_product_attention_2
float[batch,64,768] scaled_dot_product_attention_3
float[batch,64,768] scaled_dot_product_attention_4
float[batch,64,768] scaled_dot_product_attention_5
float[batch,64,768] scaled_dot_product_attention_6
float[batch,64,768] scaled_dot_product_attention_7
float[batch,64,768] scaled_dot_product_attention_8
float[batch,64,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,64,3072] val_41
float[batch,64,768] val_42
float[batch,64,3072] val_43
float[batch,64,768] val_44
float[batch,64,3072] val_45
float[batch,64,768] val_46
float[batch,64,3072] val_47
float[batch,64,768] val_48
float[batch,64,3072] val_49
float[batch,64,768] val_50
float[batch,64,3072] val_51
float[batch,64,768] val_52
float[batch,64,3072] val_53
float[batch,64,768] val_54
float[batch,64,3072] val_55
float[batch,64,768] val_56
float[batch,64,3072] val_57
float[batch,64,768] val_58
float[batch,64,3072] val_59
float[batch,64,768] val_60
float[batch,64,3072] val_61
float[batch,64,768] val_62
float[batch,1,3072] val_63
float[batch,1,768] val_64
float[batch,768] val_65
>
{
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_40)
add_4 = Add (embedding, "text.positional_embedding")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
val_41 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_42 = MatMul (gelu, val_6)
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
val_43 = MatMul (layer_norm_3, val_8)
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_44 = MatMul (gelu_1, val_9)
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
val_45 = MatMul (layer_norm_5, val_11)
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_46 = MatMul (gelu_2, val_12)
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
val_47 = MatMul (layer_norm_7, val_14)
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_48 = MatMul (gelu_3, val_15)
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
val_49 = MatMul (layer_norm_9, val_17)
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_50 = MatMul (gelu_4, val_18)
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
val_51 = MatMul (layer_norm_11, val_20)
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_52 = MatMul (gelu_5, val_21)
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
val_53 = MatMul (layer_norm_13, val_23)
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_54 = MatMul (gelu_6, val_24)
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
val_55 = MatMul (layer_norm_15, val_26)
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_56 = MatMul (gelu_7, val_27)
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
val_57 = MatMul (layer_norm_17, val_29)
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_58 = MatMul (gelu_8, val_30)
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
val_59 = MatMul (layer_norm_19, val_32)
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_60 = MatMul (gelu_9, val_33)
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
val_61 = MatMul (layer_norm_21, val_35)
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_62 = MatMul (gelu_10, val_36)
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_38)
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_39)
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = Squeeze (add_1636, val_2)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (linear_48, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 6ba79357c30f
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 4b1ddc6e492b
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 877f58bc8d5e
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] a400a0d2284d
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 136a0439673f
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] efa8bfcc0468
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 7ebc473e0c67
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 808f58703d53
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] bf41d7f218e7
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] bfa0b242e98e
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 9bb696ce96a2
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 1eee065ad1d7
text.ln_final.bias FLOAT[768] 57465e4439b6
text.ln_final.weight FLOAT[768] 33970b26ac8c
text.positional_embedding FLOAT[64,768] 2fb594ece2f6
text.text_projection.bias FLOAT[768] 6a8a19e9845d
text.text_projection.weight FLOAT[768,768] 9a6d56977451
text.token_embedding.weight_fp16 FLOAT16[32000,768] 110fd8f05bd0
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 66b671c1db6b
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 7a18cbdedf5a
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 207ac02736e6
text.transformer.resblocks.0.ln_1.weight FLOAT[768] 4d0fbe0741e8
text.transformer.resblocks.0.ln_2.bias FLOAT[768] 675702d0f93d
text.transformer.resblocks.0.ln_2.weight FLOAT[768] 7859cb1ff0ff
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 39ebec3b8666
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] dcdb834f2df8
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] dcb7c551d148
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] c0bf9a549e15
text.transformer.resblocks.1.ln_1.bias FLOAT[768] a4680e0cf44c
text.transformer.resblocks.1.ln_1.weight FLOAT[768] 9496d1756c47
text.transformer.resblocks.1.ln_2.bias FLOAT[768] ff098dc177e6
text.transformer.resblocks.1.ln_2.weight FLOAT[768] 64f9e45c2f2b
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] e1c60cbca356
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 66292143bf63
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] e177c867d81c
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] c725b4556d5a
text.transformer.resblocks.10.ln_1.bias FLOAT[768] 9f545eb46e16
text.transformer.resblocks.10.ln_1.weight FLOAT[768] a8774563fbd6
text.transformer.resblocks.10.ln_2.bias FLOAT[768] a46a989b931a
text.transformer.resblocks.10.ln_2.weight FLOAT[768] a2ec3e78aa0f
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 581183669e7a
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] be7da1153591
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] f018a305e6d5
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] ca4bfc9c5b6b
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 61ecf317c49d
text.transformer.resblocks.11.ln_1.weight FLOAT[768] 72f6b88f32e2
text.transformer.resblocks.11.ln_2.bias FLOAT[768] 2a6e44de4724
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 715f2614316a
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 6e66a8255a49
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 888af118ba52
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 5f1aed4ea0a3
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 9d26fbba9180
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 3c9926631cd9
text.transformer.resblocks.2.ln_1.weight FLOAT[768] 95ba7d892285
text.transformer.resblocks.2.ln_2.bias FLOAT[768] 3a38d3c34b74
text.transformer.resblocks.2.ln_2.weight FLOAT[768] a8305d1b2252
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 558f2b9e04e4
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] c98c17ec1f16
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 6780fc876aa5
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 660027138caf
text.transformer.resblocks.3.ln_1.bias FLOAT[768] ad13e0cf783e
text.transformer.resblocks.3.ln_1.weight FLOAT[768] f398199424fc
text.transformer.resblocks.3.ln_2.bias FLOAT[768] 02545d22e3da
text.transformer.resblocks.3.ln_2.weight FLOAT[768] 3aacb64ff6e1
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] fb7ca374d32d
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 7529aa51d192
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 4edf26c79746
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 5684946bdaf5
text.transformer.resblocks.4.ln_1.bias FLOAT[768] 29ed62127138
text.transformer.resblocks.4.ln_1.weight FLOAT[768] 6a0e5d1fc213
text.transformer.resblocks.4.ln_2.bias FLOAT[768] 0694c7707ded
text.transformer.resblocks.4.ln_2.weight FLOAT[768] 013af0c71025
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] d2391b21f973
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 203d8a892fab
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 1a84960f6f8a
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 221280b961ae
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 645e04e18c41
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 3df6a09380fe
text.transformer.resblocks.5.ln_2.bias FLOAT[768] 786343a66bde
text.transformer.resblocks.5.ln_2.weight FLOAT[768] 9a287fe8b9b9
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 52b65545322e
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 277816d453bf
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] bd7f5a41f22f
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] e0ad2c251723
text.transformer.resblocks.6.ln_1.bias FLOAT[768] eb4433bffc34
text.transformer.resblocks.6.ln_1.weight FLOAT[768] d6387f478c3b
text.transformer.resblocks.6.ln_2.bias FLOAT[768] 3c8ed19dce5b
text.transformer.resblocks.6.ln_2.weight FLOAT[768] ec90838abeae
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] cb8be5437b7b
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 0d634ef58d90
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] d8cfb755668b
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 2865f5509d57
text.transformer.resblocks.7.ln_1.bias FLOAT[768] 8c773bd1d4ed
text.transformer.resblocks.7.ln_1.weight FLOAT[768] 1ce9dbde64f4
text.transformer.resblocks.7.ln_2.bias FLOAT[768] 05300982752d
text.transformer.resblocks.7.ln_2.weight FLOAT[768] 3a537f0d95ec
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 48b7fba0d3d1
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] fbd0f21ba6d7
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 024f3cb4b670
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 0c2a4fde1e9e
text.transformer.resblocks.8.ln_1.bias FLOAT[768] bd944cacf24e
text.transformer.resblocks.8.ln_1.weight FLOAT[768] 6a5a9226f597
text.transformer.resblocks.8.ln_2.bias FLOAT[768] 848deb6f0c3f
text.transformer.resblocks.8.ln_2.weight FLOAT[768] 66b125b72cd8
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] ad5f5ae8c667
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 8af7c56be4f2
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] d42879e3608c
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] d055358d7fa3
text.transformer.resblocks.9.ln_1.bias FLOAT[768] 56e801c60ce6
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 02965338286d
text.transformer.resblocks.9.ln_2.bias FLOAT[768] b27773465b33
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 795382f81d78
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 65aac8dd514b
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 0374b5d468d4
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,2304] 377faddb0a78
val_11 FLOAT[768,3072] 611e2bc6cd68
val_12 FLOAT[3072,768] 3df8c38b32dc
val_13 FLOAT[768,2304] 4b2f023e5ddf
val_14 FLOAT[768,3072] 09efd5a73efb
val_15 FLOAT[3072,768] bd66a2437a1f
val_16 FLOAT[768,2304] 2eb86ec2bb92
val_17 FLOAT[768,3072] d10774ed3c6c
val_18 FLOAT[3072,768] 39d5d212d523
val_19 FLOAT[768,2304] 3e8232489dd0
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,3072] 75cfd2da34d2
val_21 FLOAT[3072,768] 7f4c3b76c2a1
val_22 FLOAT[768,2304] 3bfc473cd4a0
val_23 FLOAT[768,3072] f7c92f8f5ecd
val_24 FLOAT[3072,768] 240f3a7f74bc
val_25 FLOAT[768,2304] 122096577b9d
val_26 FLOAT[768,3072] 9859d543226f
val_27 FLOAT[3072,768] f458d33ca49a
val_28 FLOAT[768,2304] 01324ce84670
val_29 FLOAT[768,3072] fe5bf3262a7e
val_3 INT64[1] 6a69a6cc7473
val_30 FLOAT[3072,768] e5d13d645376
val_31 FLOAT[768,2304] 29fb7a47f3b1
val_32 FLOAT[768,3072] 2ae0681cface
val_33 FLOAT[3072,768] a2849bf07df5
val_34 FLOAT[768,2304] 2b4760103d2b
val_35 FLOAT[768,3072] bfe3de788380
val_36 FLOAT[3072,768] e1ae98945aaf
val_37 FLOAT[768,2304] 87f7a9af7b53
val_38 FLOAT[768,3072] 54abd13d24b4
val_39 FLOAT[3072,768] 8070df859cb4
val_4 FLOAT[768,2304] e1b94c96af5b
val_5 FLOAT[768,3072] b69c45b25902
val_6 FLOAT[3072,768] 950a7224555f
val_7 FLOAT[768,2304] e24de944afa4
val_8 FLOAT[768,3072] dabbb46e413d
val_9 FLOAT[3072,768] 7e04386f1219
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,512,512,3] image) => (float[batch,768] image_embedding)
<
float[batch,1024,768] add_1007
float[batch,1024,768] add_1068
float[batch,1024,768] add_107
float[batch,1024,768] add_1097
float[batch,1,768] add_1195
float[batch,1024,768] add_13
float[batch,1024,768] add_168
float[batch,1024,768] add_197
float[batch,1024,768] add_258
float[batch,1024,768] add_287
float[batch,1024,768] add_348
float[batch,1024,768] add_377
float[batch,1024,768] add_438
float[batch,1024,768] add_467
float[batch,1024,768] add_528
float[batch,1024,768] add_557
float[batch,1024,768] add_618
float[batch,1024,768] add_647
float[batch,1024,768] add_708
float[batch,1024,768] add_737
float[batch,1024,768] add_78
float[batch,1024,768] add_798
float[batch,1024,768] add_827
float[batch,1024,768] add_888
float[batch,1024,768] add_917
float[batch,1024,768] add_978
float[batch,1] clamp_min
float[batch,768,32,32] conv2d
float[batch,1024,3072] gelu
float[batch,1024,3072] gelu_1
float[batch,1024,3072] gelu_10
float[batch,1024,3072] gelu_11
float[batch,1,3072] gelu_12
float[batch,1024,3072] gelu_2
float[batch,1024,3072] gelu_3
float[batch,1024,3072] gelu_4
float[batch,1024,3072] gelu_5
float[batch,1024,3072] gelu_6
float[batch,1024,3072] gelu_7
float[batch,1024,3072] gelu_8
float[batch,1024,3072] gelu_9
float[batch,3,512,512] image_chw
float[batch] image_ez
float[batch] image_ez_r
float[batch,1,1,1] image_ez_s
float[batch,512,512,3] image_f32
float[batch,1024,768] layer_norm
float[batch,1024,768] layer_norm_1
float[batch,1024,768] layer_norm_10
float[batch,1024,768] layer_norm_11
float[batch,1024,768] layer_norm_12
float[batch,1024,768] layer_norm_13
float[batch,1024,768] layer_norm_14
float[batch,1024,768] layer_norm_15
float[batch,1024,768] layer_norm_16
float[batch,1024,768] layer_norm_17
float[batch,1024,768] layer_norm_18
float[batch,1024,768] layer_norm_19
float[batch,1024,768] layer_norm_2
float[batch,1024,768] layer_norm_20
float[batch,1024,768] layer_norm_21
float[batch,1024,768] layer_norm_22
float[batch,1024,768] layer_norm_23
float[batch,1024,768] layer_norm_24
float[batch,1,768] layer_norm_25
float[batch,1024,768] layer_norm_3
float[batch,1024,768] layer_norm_4
float[batch,1024,768] layer_norm_5
float[batch,1024,768] layer_norm_6
float[batch,1024,768] layer_norm_7
float[batch,1024,768] layer_norm_8
float[batch,1024,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,1024,2304] linear
float[batch,1024,768] linear_1
float[batch,1024,3072] linear_10
float[batch,1024,768] linear_11
float[batch,1024,2304] linear_12
float[batch,1024,768] linear_13
float[batch,1024,3072] linear_14
float[batch,1024,768] linear_15
float[batch,1024,2304] linear_16
float[batch,1024,768] linear_17
float[batch,1024,3072] linear_18
float[batch,1024,768] linear_19
float[batch,1024,3072] linear_2
float[batch,1024,2304] linear_20
float[batch,1024,768] linear_21
float[batch,1024,3072] linear_22
float[batch,1024,768] linear_23
float[batch,1024,2304] linear_24
float[batch,1024,768] linear_25
float[batch,1024,3072] linear_26
float[batch,1024,768] linear_27
float[batch,1024,2304] linear_28
float[batch,1024,768] linear_29
float[batch,1024,768] linear_3
float[batch,1024,3072] linear_30
float[batch,1024,768] linear_31
float[batch,1024,2304] linear_32
float[batch,1024,768] linear_33
float[batch,1024,3072] linear_34
float[batch,1024,768] linear_35
float[batch,1024,2304] linear_36
float[batch,1024,768] linear_37
float[batch,1024,3072] linear_38
float[batch,1024,768] linear_39
float[batch,1024,2304] linear_4
float[batch,1024,2304] linear_40
float[batch,1024,768] linear_41
float[batch,1024,3072] linear_42
float[batch,1024,768] linear_43
float[batch,1024,2304] linear_44
float[batch,1024,768] linear_45
float[batch,1024,3072] linear_46
float[batch,1024,768] linear_47
float[batch,1024,1536] linear_49
float[batch,1024,768] linear_5
float[batch,1,768] linear_50
float[batch,1,3072] linear_51
float[batch,1,768] linear_52
float[batch,1024,3072] linear_6
float[batch,1024,768] linear_7
float[batch,1024,2304] linear_8
float[batch,1024,768] linear_9
float[batch,1024,768] node_scaled_dot_product_attention_10_k
float[batch,1024,768] node_scaled_dot_product_attention_10_q
float[batch,1024,768] node_scaled_dot_product_attention_10_v
float[batch,1024,768] node_scaled_dot_product_attention_11_k
float[batch,1024,768] node_scaled_dot_product_attention_11_q
float[batch,1024,768] node_scaled_dot_product_attention_11_v
float[batch,1024,768] node_scaled_dot_product_attention_12_k
float[batch,1,768] node_scaled_dot_product_attention_12_q
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
float[batch,1024,768] node_scaled_dot_product_attention_12_v
float[batch,1024,768] node_scaled_dot_product_attention_1_k
float[batch,1024,768] node_scaled_dot_product_attention_1_q
float[batch,1024,768] node_scaled_dot_product_attention_1_v
float[batch,1024,768] node_scaled_dot_product_attention_2_k
float[batch,1024,768] node_scaled_dot_product_attention_2_q
float[batch,1024,768] node_scaled_dot_product_attention_2_v
float[batch,1024,768] node_scaled_dot_product_attention_3_k
float[batch,1024,768] node_scaled_dot_product_attention_3_q
float[batch,1024,768] node_scaled_dot_product_attention_3_v
float[batch,1024,768] node_scaled_dot_product_attention_4_k
float[batch,1024,768] node_scaled_dot_product_attention_4_q
float[batch,1024,768] node_scaled_dot_product_attention_4_v
float[batch,1024,768] node_scaled_dot_product_attention_5_k
float[batch,1024,768] node_scaled_dot_product_attention_5_q
float[batch,1024,768] node_scaled_dot_product_attention_5_v
float[batch,1024,768] node_scaled_dot_product_attention_6_k
float[batch,1024,768] node_scaled_dot_product_attention_6_q
float[batch,1024,768] node_scaled_dot_product_attention_6_v
float[batch,1024,768] node_scaled_dot_product_attention_7_k
float[batch,1024,768] node_scaled_dot_product_attention_7_q
float[batch,1024,768] node_scaled_dot_product_attention_7_v
float[batch,1024,768] node_scaled_dot_product_attention_8_k
float[batch,1024,768] node_scaled_dot_product_attention_8_q
float[batch,1024,768] node_scaled_dot_product_attention_8_v
float[batch,1024,768] node_scaled_dot_product_attention_9_k
float[batch,1024,768] node_scaled_dot_product_attention_9_q
float[batch,1024,768] node_scaled_dot_product_attention_9_v
float[batch,1024,768] node_scaled_dot_product_attention_k
float[batch,1024,768] node_scaled_dot_product_attention_q
float[batch,1024,768] node_scaled_dot_product_attention_v
float[batch,1024,768] scaled_dot_product_attention
float[batch,1024,768] scaled_dot_product_attention_1
float[batch,1024,768] scaled_dot_product_attention_10
float[batch,1024,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_12
float[batch,1024,768] scaled_dot_product_attention_2
float[batch,1024,768] scaled_dot_product_attention_3
float[batch,1024,768] scaled_dot_product_attention_4
float[batch,1024,768] scaled_dot_product_attention_5
float[batch,1024,768] scaled_dot_product_attention_6
float[batch,1024,768] scaled_dot_product_attention_7
float[batch,1024,768] scaled_dot_product_attention_8
float[batch,1024,768] scaled_dot_product_attention_9
float[batch,768] select
float[batch,1024,768] transpose
float[batch,1024,768] val_100
float[batch,1024,3072] val_101
float[batch,1024,768] val_102
float[batch,1024,1536] val_103
float[batch,1,768] val_104
float[batch,1,3072] val_105
float[batch,1,768] val_106
float[batch,1024,2304] val_55
float[batch,1024,768] val_56
float[batch,1024,3072] val_57
float[batch,1024,768] val_58
float[batch,1024,2304] val_59
float[batch,1024,768] val_60
float[batch,1024,3072] val_61
float[batch,1024,768] val_62
float[batch,1024,2304] val_63
float[batch,1024,768] val_64
float[batch,1024,3072] val_65
float[batch,1024,768] val_66
float[batch,1024,2304] val_67
float[batch,1024,768] val_68
float[batch,1024,3072] val_69
float[batch,1024,768] val_70
float[batch,1024,2304] val_71
float[batch,1024,768] val_72
float[batch,1024,3072] val_73
float[batch,1024,768] val_74
float[batch,1024,2304] val_75
float[batch,1024,768] val_76
float[batch,1024,3072] val_77
float[batch,1024,768] val_78
float[batch,1024,2304] val_79
float[batch,1024,768] val_80
float[batch,1024,3072] val_81
float[batch,1024,768] val_82
float[batch,1024,2304] val_83
float[batch,1024,768] val_84
float[batch,1024,3072] val_85
float[batch,1024,768] val_86
float[batch,1024,2304] val_87
float[batch,1024,768] val_88
float[batch,1024,3072] val_89
float[batch,1024,768] val_90
float[batch,1024,2304] val_91
float[batch,1024,768] val_92
float[batch,1024,3072] val_93
float[batch,1024,768] val_94
float[batch,1024,2304] val_95
float[batch,1024,768] val_96
float[batch,1024,3072] val_97
float[batch,1024,768] val_98
float[batch,1024,2304] val_99
float[batch,768,1024] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
add_13 = Add (transpose, "visual.trunk.pos_embed")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
val_55 = MatMul (layer_norm, val_3)
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
val_56 = MatMul (scaled_dot_product_attention, val_4)
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
add_78 = Add (add_13, linear_1)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
val_57 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_58 = MatMul (gelu, val_6)
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
add_107 = Add (add_78, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
val_59 = MatMul (layer_norm_2, val_7)
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
add_168 = Add (add_107, linear_5)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
val_61 = MatMul (layer_norm_3, val_9)
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_62 = MatMul (gelu_1, val_10)
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
add_197 = Add (add_168, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
val_63 = MatMul (layer_norm_4, val_11)
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
add_258 = Add (add_197, linear_9)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
val_65 = MatMul (layer_norm_5, val_13)
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_66 = MatMul (gelu_2, val_14)
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
add_287 = Add (add_258, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
val_67 = MatMul (layer_norm_6, val_15)
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
add_348 = Add (add_287, linear_13)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
val_69 = MatMul (layer_norm_7, val_17)
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_70 = MatMul (gelu_3, val_18)
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
add_377 = Add (add_348, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
val_71 = MatMul (layer_norm_8, val_19)
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
add_438 = Add (add_377, linear_17)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
val_73 = MatMul (layer_norm_9, val_21)
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_74 = MatMul (gelu_4, val_22)
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
add_467 = Add (add_438, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
val_75 = MatMul (layer_norm_10, val_23)
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
add_528 = Add (add_467, linear_21)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
val_77 = MatMul (layer_norm_11, val_25)
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_78 = MatMul (gelu_5, val_26)
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
add_557 = Add (add_528, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
val_79 = MatMul (layer_norm_12, val_27)
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
add_618 = Add (add_557, linear_25)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
val_81 = MatMul (layer_norm_13, val_29)
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_82 = MatMul (gelu_6, val_30)
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
add_647 = Add (add_618, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
val_83 = MatMul (layer_norm_14, val_31)
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
add_708 = Add (add_647, linear_29)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
val_85 = MatMul (layer_norm_15, val_33)
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_86 = MatMul (gelu_7, val_34)
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
add_737 = Add (add_708, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
val_87 = MatMul (layer_norm_16, val_35)
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
add_798 = Add (add_737, linear_33)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
val_89 = MatMul (layer_norm_17, val_37)
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_90 = MatMul (gelu_8, val_38)
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
add_827 = Add (add_798, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
val_91 = MatMul (layer_norm_18, val_39)
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
add_888 = Add (add_827, linear_37)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
val_93 = MatMul (layer_norm_19, val_41)
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_94 = MatMul (gelu_9, val_42)
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
add_917 = Add (add_888, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
val_95 = MatMul (layer_norm_20, val_43)
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
add_978 = Add (add_917, linear_41)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
val_97 = MatMul (layer_norm_21, val_45)
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_98 = MatMul (gelu_10, val_46)
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
add_1007 = Add (add_978, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
val_99 = MatMul (layer_norm_22, val_47)
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
add_1068 = Add (add_1007, linear_45)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
val_101 = MatMul (layer_norm_23, val_49)
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_102 = MatMul (gelu_11, val_50)
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
add_1097 = Add (add_1068, linear_47)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
val_103 = MatMul (layer_norm_24, val_51)
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
val_105 = MatMul (layer_norm_25, val_53)
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
val_106 = MatMul (gelu_12, val_54)
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
add_1195 = Add (linear_50, linear_52)
select = Squeeze (add_1195, val_2)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
attn3d_split_2x768 INT64[2] 6b8b40015c71
attn3d_split_3x768 INT64[3] eca50b2daf34
image_ez_axes INT64[3] e2e2033ae7e1
image_ez_ends INT64[3] 605390e5a369
image_ez_starts INT64[3] 9d908ecfb6b2
image_ez_zero FLOAT[] df3f619804a9
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] 34742d1490e2
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[3072,768] fdc33f239ed3
val_11 FLOAT[768,2304] 68eebbe79ac2
val_12 FLOAT[768,768] a52893c36b3c
val_13 FLOAT[768,3072] 952ea859eb3c
val_14 FLOAT[3072,768] a292ee7baa95
val_15 FLOAT[768,2304] 03bf8fa1df14
val_16 FLOAT[768,768] e488f37d7d17
val_17 FLOAT[768,3072] a9366183ca6d
val_18 FLOAT[3072,768] a5756d657a84
val_19 FLOAT[768,2304] 9674cfe51852
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,768] 7a5ae0413b89
val_21 FLOAT[768,3072] a8de826e8c12
val_22 FLOAT[3072,768] 3799d8ea969a
val_23 FLOAT[768,2304] f7be2aed6c58
val_24 FLOAT[768,768] 9d843801e3ad
val_25 FLOAT[768,3072] 831b82e35f75
val_26 FLOAT[3072,768] d0a81f0e25e8
val_27 FLOAT[768,2304] 9b8601477fd9
val_28 FLOAT[768,768] 329a523602e8
val_29 FLOAT[768,3072] c58c7d37c3c9
val_3 FLOAT[768,2304] 56ee64394fb9
val_30 FLOAT[3072,768] efedaa6fda4b
val_31 FLOAT[768,2304] 34bc7faf25f3
val_32 FLOAT[768,768] 0923ef7528fd
val_33 FLOAT[768,3072] 6ad40a5c6c66
val_34 FLOAT[3072,768] 43b63de8436e
val_35 FLOAT[768,2304] 6ee9c4c323e5
val_36 FLOAT[768,768] d9c30f5bf59e
val_37 FLOAT[768,3072] c1ed93febfad
val_38 FLOAT[3072,768] 5345cee715e6
val_39 FLOAT[768,2304] a6c5d0fa35b3
val_4 FLOAT[768,768] b16bf2a58dc8
val_40 FLOAT[768,768] 9c198f0029d7
val_41 FLOAT[768,3072] cc61dfcdd914
val_42 FLOAT[3072,768] f0bcc7665ad5
val_43 FLOAT[768,2304] 1a25cc5a6f5a
val_44 FLOAT[768,768] 735337c313c6
val_45 FLOAT[768,3072] db74d17e368c
val_46 FLOAT[3072,768] b3a13633aec9
val_47 FLOAT[768,2304] c1e1ec88ec87
val_48 FLOAT[768,768] 664fbf93ff40
val_49 FLOAT[768,3072] e2b409717cd0
val_5 FLOAT[768,3072] 2715fe6c040a
val_50 FLOAT[3072,768] 0c3a36034a71
val_51 FLOAT[768,1536] 6c572173f65c
val_52 FLOAT[768,768] 6768f14993a4
val_53 FLOAT[768,3072] 2843229c3716
val_54 FLOAT[3072,768] a21a5a4f19fa
val_6 FLOAT[3072,768] 44fd207ec409
val_7 FLOAT[768,2304] a53041b4a5de
val_8 FLOAT[768,768] fbff11e274b7
val_9 FLOAT[768,3072] a9a4cd837ec0
view_target INT64[3] 21dbf3aa40f3
visual.trunk.attn_pool.kv.bias FLOAT[1536] 2aac800a9e43
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] 86271ec2cab9
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] 98480087fbd5
visual.trunk.attn_pool.norm.bias FLOAT[768] b6abe709f3fd
visual.trunk.attn_pool.norm.weight FLOAT[768] 13d1c276a202
visual.trunk.attn_pool.proj.bias FLOAT[768] 235a21dd3541
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] a4b802abe41a
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] 66fb70cc5d4c
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] 022f27289ae8
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] d0914dd54798
visual.trunk.blocks.0.norm1.bias FLOAT[768] 00c5ece9972d
visual.trunk.blocks.0.norm1.weight FLOAT[768] 58ea93711142
visual.trunk.blocks.0.norm2.bias FLOAT[768] 1aeff3804c64
visual.trunk.blocks.0.norm2.weight FLOAT[768] 6fd66903b703
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] 4ba36ce690e5
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] dc85b481545d
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] 1d8919ead89a
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] cb7f0a39fd38
visual.trunk.blocks.1.norm1.bias FLOAT[768] 682f51ea6937
visual.trunk.blocks.1.norm1.weight FLOAT[768] aa8eb2714c56
visual.trunk.blocks.1.norm2.bias FLOAT[768] 4bc5f01008b8
visual.trunk.blocks.1.norm2.weight FLOAT[768] da9134c0b5e9
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] e5072671d659
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] d207c5998244
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] ef10941e627f
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] 700190371c89
visual.trunk.blocks.10.norm1.bias FLOAT[768] e4cd8e46a090
visual.trunk.blocks.10.norm1.weight FLOAT[768] 750488b2d089
visual.trunk.blocks.10.norm2.bias FLOAT[768] c86eb65eb0a4
visual.trunk.blocks.10.norm2.weight FLOAT[768] 963d9e60cb7b
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] cc4c8310ae53
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] abefde6ffca9
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 20a04971b59c
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] 65bdba30d1be
visual.trunk.blocks.11.norm1.bias FLOAT[768] 3a2585631ee1
visual.trunk.blocks.11.norm1.weight FLOAT[768] 626ca097d024
visual.trunk.blocks.11.norm2.bias FLOAT[768] 79ce5ef9f88b
visual.trunk.blocks.11.norm2.weight FLOAT[768] b7162459669d
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] 2298c10cf369
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 8b455824b462
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 04c5024a7436
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] 2fe83b2190d3
visual.trunk.blocks.2.norm1.bias FLOAT[768] 4ed5ff479b0c
visual.trunk.blocks.2.norm1.weight FLOAT[768] 2a2abe9b5a0d
visual.trunk.blocks.2.norm2.bias FLOAT[768] 5030e1c8ef24
visual.trunk.blocks.2.norm2.weight FLOAT[768] a34a2e1eee8d
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 4979161cd7cc
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 33dc504070b1
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] 2fbcf754434e
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] d2e73bd43ae7
visual.trunk.blocks.3.norm1.bias FLOAT[768] 2459224866e5
visual.trunk.blocks.3.norm1.weight FLOAT[768] a22ed0538217
visual.trunk.blocks.3.norm2.bias FLOAT[768] 4d04f3079114
visual.trunk.blocks.3.norm2.weight FLOAT[768] be05b7599c75
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] ccc3cf1ff785
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 56661af2ac95
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] ee2f6c6948a2
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] 44efe9ed8bc9
visual.trunk.blocks.4.norm1.bias FLOAT[768] 8d7ca5e70070
visual.trunk.blocks.4.norm1.weight FLOAT[768] c35d38604fdc
visual.trunk.blocks.4.norm2.bias FLOAT[768] 4d5a7b00bacc
visual.trunk.blocks.4.norm2.weight FLOAT[768] 0ce4cce3fd34
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] 31916e5110c4
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] 9082b09b69fa
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] 707846cbc66e
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 3d5c56868a59
visual.trunk.blocks.5.norm1.bias FLOAT[768] 3d980631879b
visual.trunk.blocks.5.norm1.weight FLOAT[768] faa7e462e158
visual.trunk.blocks.5.norm2.bias FLOAT[768] a0f75bf613ed
visual.trunk.blocks.5.norm2.weight FLOAT[768] 8f6ec59de320
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 7f0ca600fe12
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] 905415fe02f2
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 8b5037fb373d
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] 650ab18c27a4
visual.trunk.blocks.6.norm1.bias FLOAT[768] c9a0f7f3ea5f
visual.trunk.blocks.6.norm1.weight FLOAT[768] 893435510775
visual.trunk.blocks.6.norm2.bias FLOAT[768] 99c75b408d98
visual.trunk.blocks.6.norm2.weight FLOAT[768] 66ce9bc8596a
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] e4c1211d9b0b
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 528c681ee054
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] 521b1541c573
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] d0a4e2901174
visual.trunk.blocks.7.norm1.bias FLOAT[768] f2a5edcaf655
visual.trunk.blocks.7.norm1.weight FLOAT[768] 73d0eee31a2d
visual.trunk.blocks.7.norm2.bias FLOAT[768] 8135c6ebc6ba
visual.trunk.blocks.7.norm2.weight FLOAT[768] 57f082d536e3
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] 566ccde1cd2b
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] b133ce03767f
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] e981698de991
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] 6edc3e57a0ce
visual.trunk.blocks.8.norm1.bias FLOAT[768] ba67031ccfb3
visual.trunk.blocks.8.norm1.weight FLOAT[768] 274281a3f7f7
visual.trunk.blocks.8.norm2.bias FLOAT[768] 0530fb8e4725
visual.trunk.blocks.8.norm2.weight FLOAT[768] 5642ad33affc
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] 98850a6ece2b
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] 07da11efab57
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] 5ce71d4e90e4
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] b01ff2065960
visual.trunk.blocks.9.norm1.bias FLOAT[768] 9ba613c26109
visual.trunk.blocks.9.norm1.weight FLOAT[768] a087b59f1ded
visual.trunk.blocks.9.norm2.bias FLOAT[768] 64fab6454cd1
visual.trunk.blocks.9.norm2.weight FLOAT[768] 0bc30a031b7e
visual.trunk.norm.bias FLOAT[768] 0600232fd1e6
visual.trunk.norm.weight FLOAT[768] 9f87651b62ab
visual.trunk.patch_embed.proj.bias FLOAT[768] 365ed08fb925
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] 5f4728cf617b
visual.trunk.pos_embed FLOAT[1,1024,768] b48bda250b73
@@ -0,0 +1,571 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
<
float[batch,64,768] add_1071
float[batch,64,768] add_1092
float[batch,64,768] add_119
float[batch,64,768] add_1207
float[batch,64,768] add_1228
float[batch,64,768] add_1343
float[batch,64,768] add_1364
float[batch,64,768] add_140
float[batch,64,768] add_1479
float[batch,64,768] add_1500
float[batch,1,768] add_1500_pooled
float[batch,1,768] add_1615
float[batch,1,768] add_1636
float[batch,64,768] add_255
float[batch,64,768] add_276
float[batch,64,768] add_391
float[batch,64,768] add_4
float[batch,64,768] add_412
float[batch,64,768] add_527
float[batch,64,768] add_548
float[batch,64,768] add_663
float[batch,64,768] add_684
float[batch,64,768] add_799
float[batch,64,768] add_820
float[batch,64,768] add_935
float[batch,64,768] add_956
float[batch,1] clamp_min
float[batch,64,768] embedding
float[batch,64,3072] gelu
float[batch,64,3072] gelu_1
float[batch,64,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,64,3072] gelu_2
float[batch,64,3072] gelu_3
float[batch,64,3072] gelu_4
float[batch,64,3072] gelu_5
float[batch,64,3072] gelu_6
float[batch,64,3072] gelu_7
float[batch,64,3072] gelu_8
float[batch,64,3072] gelu_9
float[batch,64,768] layer_norm
float[batch,64,768] layer_norm_1
float[batch,64,768] layer_norm_10
float[batch,64,768] layer_norm_11
float[batch,64,768] layer_norm_12
float[batch,64,768] layer_norm_13
float[batch,64,768] layer_norm_14
float[batch,64,768] layer_norm_15
float[batch,64,768] layer_norm_16
float[batch,64,768] layer_norm_17
float[batch,64,768] layer_norm_18
float[batch,64,768] layer_norm_19
float[batch,64,768] layer_norm_2
float[batch,64,768] layer_norm_20
float[batch,64,768] layer_norm_21
float[batch,64,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,64,768] layer_norm_3
float[batch,64,768] layer_norm_4
float[batch,64,768] layer_norm_5
float[batch,64,768] layer_norm_6
float[batch,64,768] layer_norm_7
float[batch,64,768] layer_norm_8
float[batch,64,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,64,3072] linear_10
float[batch,64,768] linear_11
float[batch,64,3072] linear_14
float[batch,64,768] linear_15
float[batch,64,3072] linear_18
float[batch,64,768] linear_19
float[batch,64,3072] linear_2
float[batch,64,3072] linear_22
float[batch,64,768] linear_23
float[batch,64,3072] linear_26
float[batch,64,768] linear_27
float[batch,64,768] linear_3
float[batch,64,3072] linear_30
float[batch,64,768] linear_31
float[batch,64,3072] linear_34
float[batch,64,768] linear_35
float[batch,64,3072] linear_38
float[batch,64,768] linear_39
float[batch,64,3072] linear_42
float[batch,64,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,768] linear_48
float[batch,64,3072] linear_6
float[batch,64,768] linear_7
float[batch,64,768] node_scaled_dot_product_attention_10_k
float[batch,64,768] node_scaled_dot_product_attention_10_out
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_q
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_v
float[batch,64,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_v
float[batch,64,768] node_scaled_dot_product_attention_1_k
float[batch,64,768] node_scaled_dot_product_attention_1_out
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_q
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_v
float[batch,64,768] node_scaled_dot_product_attention_2_k
float[batch,64,768] node_scaled_dot_product_attention_2_out
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_q
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_v
float[batch,64,768] node_scaled_dot_product_attention_3_k
float[batch,64,768] node_scaled_dot_product_attention_3_out
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_q
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_v
float[batch,64,768] node_scaled_dot_product_attention_4_k
float[batch,64,768] node_scaled_dot_product_attention_4_out
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_q
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_v
float[batch,64,768] node_scaled_dot_product_attention_5_k
float[batch,64,768] node_scaled_dot_product_attention_5_out
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_q
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_v
float[batch,64,768] node_scaled_dot_product_attention_6_k
float[batch,64,768] node_scaled_dot_product_attention_6_out
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_q
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_v
float[batch,64,768] node_scaled_dot_product_attention_7_k
float[batch,64,768] node_scaled_dot_product_attention_7_out
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_q
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_v
float[batch,64,768] node_scaled_dot_product_attention_8_k
float[batch,64,768] node_scaled_dot_product_attention_8_out
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_q
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_v
float[batch,64,768] node_scaled_dot_product_attention_9_k
float[batch,64,768] node_scaled_dot_product_attention_9_out
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_q
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_v
float[batch,64,768] node_scaled_dot_product_attention_k
float[batch,64,768] node_scaled_dot_product_attention_out
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_q
float[batch,64,2304] node_scaled_dot_product_attention_qkv
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_v
float[batch,64,768] scaled_dot_product_attention
float[batch,64,768] scaled_dot_product_attention_1
float[batch,64,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,64,768] scaled_dot_product_attention_2
float[batch,64,768] scaled_dot_product_attention_3
float[batch,64,768] scaled_dot_product_attention_4
float[batch,64,768] scaled_dot_product_attention_5
float[batch,64,768] scaled_dot_product_attention_6
float[batch,64,768] scaled_dot_product_attention_7
float[batch,64,768] scaled_dot_product_attention_8
float[batch,64,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,64,3072] val_41
float[batch,64,768] val_42
float[batch,64,3072] val_43
float[batch,64,768] val_44
float[batch,64,3072] val_45
float[batch,64,768] val_46
float[batch,64,3072] val_47
float[batch,64,768] val_48
float[batch,64,3072] val_49
float[batch,64,768] val_50
float[batch,64,3072] val_51
float[batch,64,768] val_52
float[batch,64,3072] val_53
float[batch,64,768] val_54
float[batch,64,3072] val_55
float[batch,64,768] val_56
float[batch,64,3072] val_57
float[batch,64,768] val_58
float[batch,64,3072] val_59
float[batch,64,768] val_60
float[batch,64,3072] val_61
float[batch,64,768] val_62
float[batch,1,3072] val_63
float[batch,1,768] val_64
float[batch,768] val_65
>
{
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_40)
add_4 = Add (embedding, "text.positional_embedding")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
val_41 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_42 = MatMul (gelu, val_6)
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
val_43 = MatMul (layer_norm_3, val_8)
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_44 = MatMul (gelu_1, val_9)
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
val_45 = MatMul (layer_norm_5, val_11)
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_46 = MatMul (gelu_2, val_12)
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
val_47 = MatMul (layer_norm_7, val_14)
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_48 = MatMul (gelu_3, val_15)
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
val_49 = MatMul (layer_norm_9, val_17)
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_50 = MatMul (gelu_4, val_18)
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
val_51 = MatMul (layer_norm_11, val_20)
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_52 = MatMul (gelu_5, val_21)
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
val_53 = MatMul (layer_norm_13, val_23)
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_54 = MatMul (gelu_6, val_24)
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
val_55 = MatMul (layer_norm_15, val_26)
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_56 = MatMul (gelu_7, val_27)
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
val_57 = MatMul (layer_norm_17, val_29)
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_58 = MatMul (gelu_8, val_30)
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
val_59 = MatMul (layer_norm_19, val_32)
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_60 = MatMul (gelu_9, val_33)
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
val_61 = MatMul (layer_norm_21, val_35)
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_62 = MatMul (gelu_10, val_36)
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_38)
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_39)
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = Squeeze (add_1636, val_2)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (linear_48, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 99d641c43921
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] f63c4907cf25
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 2e7a8a9daa18
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 4665233ce048
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 2b062970103e
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 94fefabc678f
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 7d08ec807ad2
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 6a3fa7f2d345
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] ee6684d21f4f
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 5b252a2abf1d
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 16c5431008fc
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 5fbc1d7280d3
text.ln_final.bias FLOAT[768] c34a98b95a68
text.ln_final.weight FLOAT[768] b3ac9475265e
text.positional_embedding FLOAT[64,768] 2a9ff11479b7
text.text_projection.bias FLOAT[768] 89aea87697af
text.text_projection.weight FLOAT[768,768] edbdc89b11b8
text.token_embedding.weight_fp16 FLOAT16[250000,768] 374ea2c0e2f0
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 1d63ff75f4cb
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 1a772042ed81
text.transformer.resblocks.0.ln_1.bias FLOAT[768] e80788a1492f
text.transformer.resblocks.0.ln_1.weight FLOAT[768] dc0187141516
text.transformer.resblocks.0.ln_2.bias FLOAT[768] eb935be1409c
text.transformer.resblocks.0.ln_2.weight FLOAT[768] 07ce61e2a610
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 1e0373c3bfc1
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] f53aef54690c
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 0090889e87fc
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] b2fe377badb7
text.transformer.resblocks.1.ln_1.bias FLOAT[768] 2eb82ef8df2e
text.transformer.resblocks.1.ln_1.weight FLOAT[768] e6e3a90268b1
text.transformer.resblocks.1.ln_2.bias FLOAT[768] 62c8537bbbd6
text.transformer.resblocks.1.ln_2.weight FLOAT[768] fa5e9a39e253
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 1a4696696dda
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 9e63c064887c
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 19cdf3ed088b
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] e334c099159c
text.transformer.resblocks.10.ln_1.bias FLOAT[768] 67f007d3f632
text.transformer.resblocks.10.ln_1.weight FLOAT[768] 9e53c8e9a884
text.transformer.resblocks.10.ln_2.bias FLOAT[768] e7428524b783
text.transformer.resblocks.10.ln_2.weight FLOAT[768] 5001d48cdd37
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 7e757501f921
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 6d22e40dbd8a
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] f3e77b3887ad
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 267d0825b959
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 4512a1cb20cf
text.transformer.resblocks.11.ln_1.weight FLOAT[768] 0415fc5da59c
text.transformer.resblocks.11.ln_2.bias FLOAT[768] 9424661c79e2
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 81504b43352d
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 1fc24f5fa3b6
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] a3cef3ca4b83
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 61d0da43c323
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] f5b83b02c5e7
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 96c4e143b649
text.transformer.resblocks.2.ln_1.weight FLOAT[768] c3af1333ea4b
text.transformer.resblocks.2.ln_2.bias FLOAT[768] 9de286180adb
text.transformer.resblocks.2.ln_2.weight FLOAT[768] 6e72b5947969
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] f5a5c9ceb772
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 31d4ea9b95ea
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 88fdb45446d5
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] de5d5d3080d5
text.transformer.resblocks.3.ln_1.bias FLOAT[768] 8183d3f91410
text.transformer.resblocks.3.ln_1.weight FLOAT[768] 78c2193abf68
text.transformer.resblocks.3.ln_2.bias FLOAT[768] 699b66e1c4dd
text.transformer.resblocks.3.ln_2.weight FLOAT[768] efd3ca1c09c7
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 4a7c1a6ab6a5
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] b545b9e5b324
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 42b7c90054eb
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] bd4cb705d15d
text.transformer.resblocks.4.ln_1.bias FLOAT[768] 22b024c60076
text.transformer.resblocks.4.ln_1.weight FLOAT[768] aa18110c0f85
text.transformer.resblocks.4.ln_2.bias FLOAT[768] 8d7b78a66759
text.transformer.resblocks.4.ln_2.weight FLOAT[768] 6f9136a6613c
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 5470c83680d9
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] da59adb870e8
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 7adc98d68c8b
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 1f9ab3e07b4d
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 5f59b748457d
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 4f42b2368354
text.transformer.resblocks.5.ln_2.bias FLOAT[768] 6a5d8fd1f57c
text.transformer.resblocks.5.ln_2.weight FLOAT[768] 41ef4560332e
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 6ea843d06d6f
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 3ba09abc72e4
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 1a9b5b673c8f
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 895d3f9d24e0
text.transformer.resblocks.6.ln_1.bias FLOAT[768] aa96239e5013
text.transformer.resblocks.6.ln_1.weight FLOAT[768] 75b9a14b1927
text.transformer.resblocks.6.ln_2.bias FLOAT[768] ac7a29794b0f
text.transformer.resblocks.6.ln_2.weight FLOAT[768] b64fa2da3452
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 87148e21d8cf
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 09b5a2d09824
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 2aa7ee25a9c0
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] a37865e3deda
text.transformer.resblocks.7.ln_1.bias FLOAT[768] 3787e03dabc4
text.transformer.resblocks.7.ln_1.weight FLOAT[768] 9545528674e4
text.transformer.resblocks.7.ln_2.bias FLOAT[768] 44e4edfa46b8
text.transformer.resblocks.7.ln_2.weight FLOAT[768] 514e041120af
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 10b4e283af81
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 301db5f3e50d
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 0605c31d11d4
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 44a74dc5cfc9
text.transformer.resblocks.8.ln_1.bias FLOAT[768] 3512d3d2474e
text.transformer.resblocks.8.ln_1.weight FLOAT[768] 3ba01671177c
text.transformer.resblocks.8.ln_2.bias FLOAT[768] c2c8544eea1b
text.transformer.resblocks.8.ln_2.weight FLOAT[768] c554a2659ead
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 33e3792a2525
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 8a934076786b
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] a61e175a7e49
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] d9051c811b46
text.transformer.resblocks.9.ln_1.bias FLOAT[768] 596aa7812eb4
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 049a09a1840d
text.transformer.resblocks.9.ln_2.bias FLOAT[768] 1f2d8790c582
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 3c38f00292d8
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 4f1d07255c03
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] c0bbd5877662
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,2304] db5df112c9e6
val_11 FLOAT[768,3072] 4ce00dc9f7a8
val_12 FLOAT[3072,768] 307e87ad9223
val_13 FLOAT[768,2304] bf9292631d32
val_14 FLOAT[768,3072] 10362b7c4747
val_15 FLOAT[3072,768] 1651c30aa716
val_16 FLOAT[768,2304] d5405ebd0e99
val_17 FLOAT[768,3072] 2f18af5c9632
val_18 FLOAT[3072,768] 1ecbd70008c0
val_19 FLOAT[768,2304] 45cf3ecf6c7c
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,3072] f8839c9153d1
val_21 FLOAT[3072,768] 0176acc99d8b
val_22 FLOAT[768,2304] 705ad19f914d
val_23 FLOAT[768,3072] c8a0a4a40aec
val_24 FLOAT[3072,768] 98aaad431455
val_25 FLOAT[768,2304] 6bb06480a085
val_26 FLOAT[768,3072] 0b8ba90d2f42
val_27 FLOAT[3072,768] be68aee42e1a
val_28 FLOAT[768,2304] 82d236054403
val_29 FLOAT[768,3072] 722d941b90bd
val_3 INT64[1] 6a69a6cc7473
val_30 FLOAT[3072,768] 1c360472662c
val_31 FLOAT[768,2304] b0e73cb95be5
val_32 FLOAT[768,3072] 3d67402e1d4f
val_33 FLOAT[3072,768] c17d2e4ae58f
val_34 FLOAT[768,2304] 5e1c8f0649ce
val_35 FLOAT[768,3072] 542f70f9ac8b
val_36 FLOAT[3072,768] 127fb672ebb0
val_37 FLOAT[768,2304] 124f886c1d94
val_38 FLOAT[768,3072] 5b3c170d2b8d
val_39 FLOAT[3072,768] e8c3488791a6
val_4 FLOAT[768,2304] 6270ccea47d1
val_5 FLOAT[768,3072] 251677b853aa
val_6 FLOAT[3072,768] ac2711e86fe1
val_7 FLOAT[768,2304] 5c3cca16470e
val_8 FLOAT[768,3072] c8450fdb9f3c
val_9 FLOAT[3072,768] 6387d9273663
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,256,256,3] image) => (float[batch,768] image_embedding)
<
float[batch,256,768] add_1007
float[batch,256,768] add_1068
float[batch,256,768] add_107
float[batch,256,768] add_1097
float[batch,1,768] add_1195
float[batch,256,768] add_13
float[batch,256,768] add_168
float[batch,256,768] add_197
float[batch,256,768] add_258
float[batch,256,768] add_287
float[batch,256,768] add_348
float[batch,256,768] add_377
float[batch,256,768] add_438
float[batch,256,768] add_467
float[batch,256,768] add_528
float[batch,256,768] add_557
float[batch,256,768] add_618
float[batch,256,768] add_647
float[batch,256,768] add_708
float[batch,256,768] add_737
float[batch,256,768] add_78
float[batch,256,768] add_798
float[batch,256,768] add_827
float[batch,256,768] add_888
float[batch,256,768] add_917
float[batch,256,768] add_978
float[batch,1] clamp_min
float[batch,768,16,16] conv2d
float[batch,256,3072] gelu
float[batch,256,3072] gelu_1
float[batch,256,3072] gelu_10
float[batch,256,3072] gelu_11
float[batch,1,3072] gelu_12
float[batch,256,3072] gelu_2
float[batch,256,3072] gelu_3
float[batch,256,3072] gelu_4
float[batch,256,3072] gelu_5
float[batch,256,3072] gelu_6
float[batch,256,3072] gelu_7
float[batch,256,3072] gelu_8
float[batch,256,3072] gelu_9
float[batch,3,256,256] image_chw
float[batch] image_ez
float[batch] image_ez_r
float[batch,1,1,1] image_ez_s
float[batch,256,256,3] image_f32
float[batch,256,768] layer_norm
float[batch,256,768] layer_norm_1
float[batch,256,768] layer_norm_10
float[batch,256,768] layer_norm_11
float[batch,256,768] layer_norm_12
float[batch,256,768] layer_norm_13
float[batch,256,768] layer_norm_14
float[batch,256,768] layer_norm_15
float[batch,256,768] layer_norm_16
float[batch,256,768] layer_norm_17
float[batch,256,768] layer_norm_18
float[batch,256,768] layer_norm_19
float[batch,256,768] layer_norm_2
float[batch,256,768] layer_norm_20
float[batch,256,768] layer_norm_21
float[batch,256,768] layer_norm_22
float[batch,256,768] layer_norm_23
float[batch,256,768] layer_norm_24
float[batch,1,768] layer_norm_25
float[batch,256,768] layer_norm_3
float[batch,256,768] layer_norm_4
float[batch,256,768] layer_norm_5
float[batch,256,768] layer_norm_6
float[batch,256,768] layer_norm_7
float[batch,256,768] layer_norm_8
float[batch,256,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,256,2304] linear
float[batch,256,768] linear_1
float[batch,256,3072] linear_10
float[batch,256,768] linear_11
float[batch,256,2304] linear_12
float[batch,256,768] linear_13
float[batch,256,3072] linear_14
float[batch,256,768] linear_15
float[batch,256,2304] linear_16
float[batch,256,768] linear_17
float[batch,256,3072] linear_18
float[batch,256,768] linear_19
float[batch,256,3072] linear_2
float[batch,256,2304] linear_20
float[batch,256,768] linear_21
float[batch,256,3072] linear_22
float[batch,256,768] linear_23
float[batch,256,2304] linear_24
float[batch,256,768] linear_25
float[batch,256,3072] linear_26
float[batch,256,768] linear_27
float[batch,256,2304] linear_28
float[batch,256,768] linear_29
float[batch,256,768] linear_3
float[batch,256,3072] linear_30
float[batch,256,768] linear_31
float[batch,256,2304] linear_32
float[batch,256,768] linear_33
float[batch,256,3072] linear_34
float[batch,256,768] linear_35
float[batch,256,2304] linear_36
float[batch,256,768] linear_37
float[batch,256,3072] linear_38
float[batch,256,768] linear_39
float[batch,256,2304] linear_4
float[batch,256,2304] linear_40
float[batch,256,768] linear_41
float[batch,256,3072] linear_42
float[batch,256,768] linear_43
float[batch,256,2304] linear_44
float[batch,256,768] linear_45
float[batch,256,3072] linear_46
float[batch,256,768] linear_47
float[batch,256,1536] linear_49
float[batch,256,768] linear_5
float[batch,1,768] linear_50
float[batch,1,3072] linear_51
float[batch,1,768] linear_52
float[batch,256,3072] linear_6
float[batch,256,768] linear_7
float[batch,256,2304] linear_8
float[batch,256,768] linear_9
float[batch,256,768] node_scaled_dot_product_attention_10_k
float[batch,256,768] node_scaled_dot_product_attention_10_q
float[batch,256,768] node_scaled_dot_product_attention_10_v
float[batch,256,768] node_scaled_dot_product_attention_11_k
float[batch,256,768] node_scaled_dot_product_attention_11_q
float[batch,256,768] node_scaled_dot_product_attention_11_v
float[batch,256,768] node_scaled_dot_product_attention_12_k
float[batch,1,768] node_scaled_dot_product_attention_12_q
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
float[batch,256,768] node_scaled_dot_product_attention_12_v
float[batch,256,768] node_scaled_dot_product_attention_1_k
float[batch,256,768] node_scaled_dot_product_attention_1_q
float[batch,256,768] node_scaled_dot_product_attention_1_v
float[batch,256,768] node_scaled_dot_product_attention_2_k
float[batch,256,768] node_scaled_dot_product_attention_2_q
float[batch,256,768] node_scaled_dot_product_attention_2_v
float[batch,256,768] node_scaled_dot_product_attention_3_k
float[batch,256,768] node_scaled_dot_product_attention_3_q
float[batch,256,768] node_scaled_dot_product_attention_3_v
float[batch,256,768] node_scaled_dot_product_attention_4_k
float[batch,256,768] node_scaled_dot_product_attention_4_q
float[batch,256,768] node_scaled_dot_product_attention_4_v
float[batch,256,768] node_scaled_dot_product_attention_5_k
float[batch,256,768] node_scaled_dot_product_attention_5_q
float[batch,256,768] node_scaled_dot_product_attention_5_v
float[batch,256,768] node_scaled_dot_product_attention_6_k
float[batch,256,768] node_scaled_dot_product_attention_6_q
float[batch,256,768] node_scaled_dot_product_attention_6_v
float[batch,256,768] node_scaled_dot_product_attention_7_k
float[batch,256,768] node_scaled_dot_product_attention_7_q
float[batch,256,768] node_scaled_dot_product_attention_7_v
float[batch,256,768] node_scaled_dot_product_attention_8_k
float[batch,256,768] node_scaled_dot_product_attention_8_q
float[batch,256,768] node_scaled_dot_product_attention_8_v
float[batch,256,768] node_scaled_dot_product_attention_9_k
float[batch,256,768] node_scaled_dot_product_attention_9_q
float[batch,256,768] node_scaled_dot_product_attention_9_v
float[batch,256,768] node_scaled_dot_product_attention_k
float[batch,256,768] node_scaled_dot_product_attention_q
float[batch,256,768] node_scaled_dot_product_attention_v
float[batch,256,768] scaled_dot_product_attention
float[batch,256,768] scaled_dot_product_attention_1
float[batch,256,768] scaled_dot_product_attention_10
float[batch,256,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_12
float[batch,256,768] scaled_dot_product_attention_2
float[batch,256,768] scaled_dot_product_attention_3
float[batch,256,768] scaled_dot_product_attention_4
float[batch,256,768] scaled_dot_product_attention_5
float[batch,256,768] scaled_dot_product_attention_6
float[batch,256,768] scaled_dot_product_attention_7
float[batch,256,768] scaled_dot_product_attention_8
float[batch,256,768] scaled_dot_product_attention_9
float[batch,768] select
float[batch,256,768] transpose
float[batch,256,768] val_100
float[batch,256,3072] val_101
float[batch,256,768] val_102
float[batch,256,1536] val_103
float[batch,1,768] val_104
float[batch,1,3072] val_105
float[batch,1,768] val_106
float[batch,256,2304] val_55
float[batch,256,768] val_56
float[batch,256,3072] val_57
float[batch,256,768] val_58
float[batch,256,2304] val_59
float[batch,256,768] val_60
float[batch,256,3072] val_61
float[batch,256,768] val_62
float[batch,256,2304] val_63
float[batch,256,768] val_64
float[batch,256,3072] val_65
float[batch,256,768] val_66
float[batch,256,2304] val_67
float[batch,256,768] val_68
float[batch,256,3072] val_69
float[batch,256,768] val_70
float[batch,256,2304] val_71
float[batch,256,768] val_72
float[batch,256,3072] val_73
float[batch,256,768] val_74
float[batch,256,2304] val_75
float[batch,256,768] val_76
float[batch,256,3072] val_77
float[batch,256,768] val_78
float[batch,256,2304] val_79
float[batch,256,768] val_80
float[batch,256,3072] val_81
float[batch,256,768] val_82
float[batch,256,2304] val_83
float[batch,256,768] val_84
float[batch,256,3072] val_85
float[batch,256,768] val_86
float[batch,256,2304] val_87
float[batch,256,768] val_88
float[batch,256,3072] val_89
float[batch,256,768] val_90
float[batch,256,2304] val_91
float[batch,256,768] val_92
float[batch,256,3072] val_93
float[batch,256,768] val_94
float[batch,256,2304] val_95
float[batch,256,768] val_96
float[batch,256,3072] val_97
float[batch,256,768] val_98
float[batch,256,2304] val_99
float[batch,768,256] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
add_13 = Add (transpose, "visual.trunk.pos_embed")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
val_55 = MatMul (layer_norm, val_3)
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
val_56 = MatMul (scaled_dot_product_attention, val_4)
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
add_78 = Add (add_13, linear_1)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
val_57 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_58 = MatMul (gelu, val_6)
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
add_107 = Add (add_78, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
val_59 = MatMul (layer_norm_2, val_7)
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
add_168 = Add (add_107, linear_5)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
val_61 = MatMul (layer_norm_3, val_9)
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_62 = MatMul (gelu_1, val_10)
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
add_197 = Add (add_168, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
val_63 = MatMul (layer_norm_4, val_11)
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
add_258 = Add (add_197, linear_9)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
val_65 = MatMul (layer_norm_5, val_13)
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_66 = MatMul (gelu_2, val_14)
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
add_287 = Add (add_258, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
val_67 = MatMul (layer_norm_6, val_15)
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
add_348 = Add (add_287, linear_13)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
val_69 = MatMul (layer_norm_7, val_17)
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_70 = MatMul (gelu_3, val_18)
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
add_377 = Add (add_348, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
val_71 = MatMul (layer_norm_8, val_19)
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
add_438 = Add (add_377, linear_17)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
val_73 = MatMul (layer_norm_9, val_21)
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_74 = MatMul (gelu_4, val_22)
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
add_467 = Add (add_438, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
val_75 = MatMul (layer_norm_10, val_23)
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
add_528 = Add (add_467, linear_21)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
val_77 = MatMul (layer_norm_11, val_25)
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_78 = MatMul (gelu_5, val_26)
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
add_557 = Add (add_528, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
val_79 = MatMul (layer_norm_12, val_27)
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
add_618 = Add (add_557, linear_25)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
val_81 = MatMul (layer_norm_13, val_29)
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_82 = MatMul (gelu_6, val_30)
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
add_647 = Add (add_618, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
val_83 = MatMul (layer_norm_14, val_31)
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
add_708 = Add (add_647, linear_29)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
val_85 = MatMul (layer_norm_15, val_33)
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_86 = MatMul (gelu_7, val_34)
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
add_737 = Add (add_708, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
val_87 = MatMul (layer_norm_16, val_35)
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
add_798 = Add (add_737, linear_33)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
val_89 = MatMul (layer_norm_17, val_37)
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_90 = MatMul (gelu_8, val_38)
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
add_827 = Add (add_798, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
val_91 = MatMul (layer_norm_18, val_39)
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
add_888 = Add (add_827, linear_37)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
val_93 = MatMul (layer_norm_19, val_41)
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_94 = MatMul (gelu_9, val_42)
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
add_917 = Add (add_888, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
val_95 = MatMul (layer_norm_20, val_43)
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
add_978 = Add (add_917, linear_41)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
val_97 = MatMul (layer_norm_21, val_45)
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_98 = MatMul (gelu_10, val_46)
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
add_1007 = Add (add_978, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
val_99 = MatMul (layer_norm_22, val_47)
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
add_1068 = Add (add_1007, linear_45)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
val_101 = MatMul (layer_norm_23, val_49)
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_102 = MatMul (gelu_11, val_50)
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
add_1097 = Add (add_1068, linear_47)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
val_103 = MatMul (layer_norm_24, val_51)
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
val_105 = MatMul (layer_norm_25, val_53)
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
val_106 = MatMul (gelu_12, val_54)
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
add_1195 = Add (linear_50, linear_52)
select = Squeeze (add_1195, val_2)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
attn3d_split_2x768 INT64[2] 6b8b40015c71
attn3d_split_3x768 INT64[3] eca50b2daf34
image_ez_axes INT64[3] e2e2033ae7e1
image_ez_ends INT64[3] 605390e5a369
image_ez_starts INT64[3] 9d908ecfb6b2
image_ez_zero FLOAT[] df3f619804a9
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] 3fd3017ed70f
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[3072,768] 87f0f11b9a4f
val_11 FLOAT[768,2304] 317287ef836f
val_12 FLOAT[768,768] 46f62109daf4
val_13 FLOAT[768,3072] a873b1ff3926
val_14 FLOAT[3072,768] c983658029d5
val_15 FLOAT[768,2304] 28259308cb75
val_16 FLOAT[768,768] fe1d26e590aa
val_17 FLOAT[768,3072] 5d041873d459
val_18 FLOAT[3072,768] 84058714c88b
val_19 FLOAT[768,2304] 6c4b66ec1a67
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,768] c61a706f3654
val_21 FLOAT[768,3072] 4edaa22d1e3d
val_22 FLOAT[3072,768] 96ef1a611912
val_23 FLOAT[768,2304] 8d01089c60f9
val_24 FLOAT[768,768] 62de1eb6e976
val_25 FLOAT[768,3072] cbeb5db24725
val_26 FLOAT[3072,768] dcde2f0ab141
val_27 FLOAT[768,2304] 95339a67df7a
val_28 FLOAT[768,768] 8e2c5fd6eb13
val_29 FLOAT[768,3072] 984631acfcd0
val_3 FLOAT[768,2304] 6f917f460ba1
val_30 FLOAT[3072,768] 033fdc532e9a
val_31 FLOAT[768,2304] c00c27e3ba3b
val_32 FLOAT[768,768] 5f46bdaa414b
val_33 FLOAT[768,3072] 46a58dcf2f60
val_34 FLOAT[3072,768] afee1a4c05fd
val_35 FLOAT[768,2304] a04c7677cf2c
val_36 FLOAT[768,768] 0d7758669a98
val_37 FLOAT[768,3072] 5b109895d8bf
val_38 FLOAT[3072,768] fbc0c1781300
val_39 FLOAT[768,2304] 43de689cec58
val_4 FLOAT[768,768] ba4a825b42ce
val_40 FLOAT[768,768] 4ac8b966240e
val_41 FLOAT[768,3072] 8b0078dc2047
val_42 FLOAT[3072,768] 1e95f0fbecd8
val_43 FLOAT[768,2304] 1d5dda1a832e
val_44 FLOAT[768,768] 1424c4f18e00
val_45 FLOAT[768,3072] 2cc5eec5fe95
val_46 FLOAT[3072,768] 01e98a4c181d
val_47 FLOAT[768,2304] fda3f6ddd293
val_48 FLOAT[768,768] 71b6f1df39fa
val_49 FLOAT[768,3072] 9b2fb74d32ef
val_5 FLOAT[768,3072] 0d73229eacdc
val_50 FLOAT[3072,768] 2d92ccf931a6
val_51 FLOAT[768,1536] 10b84bbb975b
val_52 FLOAT[768,768] 880bcfa612fa
val_53 FLOAT[768,3072] a894a4996866
val_54 FLOAT[3072,768] 7fe5fcd9225f
val_6 FLOAT[3072,768] f642a01655dc
val_7 FLOAT[768,2304] b9b4e987590f
val_8 FLOAT[768,768] 648c348917da
val_9 FLOAT[768,3072] 047dbdf01cb1
view_target INT64[3] 74424dcdaa1f
visual.trunk.attn_pool.kv.bias FLOAT[1536] ba218e3215a2
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] 344ae5ace9a4
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] e38f54608c4e
visual.trunk.attn_pool.norm.bias FLOAT[768] 85116e971b1c
visual.trunk.attn_pool.norm.weight FLOAT[768] a59bc18da7f3
visual.trunk.attn_pool.proj.bias FLOAT[768] cf885cc722e8
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] f8e6ba889ba4
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] dec9afb0039e
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] 865097236c6b
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] 925a7eaae553
visual.trunk.blocks.0.norm1.bias FLOAT[768] 374e5f157627
visual.trunk.blocks.0.norm1.weight FLOAT[768] 48d4cb25e44e
visual.trunk.blocks.0.norm2.bias FLOAT[768] 3af2e51a7aa3
visual.trunk.blocks.0.norm2.weight FLOAT[768] e493154f793b
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] c7ded069c210
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] a3a6ae06b194
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] 5b7178d21bc6
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] 093dd63b7b49
visual.trunk.blocks.1.norm1.bias FLOAT[768] 0041edbce40f
visual.trunk.blocks.1.norm1.weight FLOAT[768] 2a226519f57c
visual.trunk.blocks.1.norm2.bias FLOAT[768] fd159632c46c
visual.trunk.blocks.1.norm2.weight FLOAT[768] f0e9ff3a4fe8
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] 6618ef012fb4
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] bb10ab250113
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] f177c26205b5
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] d379c54c4dba
visual.trunk.blocks.10.norm1.bias FLOAT[768] 6401f8710aa5
visual.trunk.blocks.10.norm1.weight FLOAT[768] a686c8c00f66
visual.trunk.blocks.10.norm2.bias FLOAT[768] ba8f7e328787
visual.trunk.blocks.10.norm2.weight FLOAT[768] ab6e3b23bc86
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] e7e09934e01c
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] 98b768755149
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 26244c69cc97
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] 443b27848b48
visual.trunk.blocks.11.norm1.bias FLOAT[768] f9ac5cd4204d
visual.trunk.blocks.11.norm1.weight FLOAT[768] 49e4ff7990cb
visual.trunk.blocks.11.norm2.bias FLOAT[768] 1b4163bbe747
visual.trunk.blocks.11.norm2.weight FLOAT[768] 762bc88e2cf0
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] 8465081650fd
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 566397074da2
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] e8d6fc366020
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] f4cad3fe44e2
visual.trunk.blocks.2.norm1.bias FLOAT[768] fb3a3084619c
visual.trunk.blocks.2.norm1.weight FLOAT[768] d2111dc9527a
visual.trunk.blocks.2.norm2.bias FLOAT[768] 5a50790f26e0
visual.trunk.blocks.2.norm2.weight FLOAT[768] b24a72a03828
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 34dd46f7e76c
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 5aa68c1e8912
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] b048ae964b87
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] 08f0f5e1cbf2
visual.trunk.blocks.3.norm1.bias FLOAT[768] 11101218b248
visual.trunk.blocks.3.norm1.weight FLOAT[768] bc54dda137b2
visual.trunk.blocks.3.norm2.bias FLOAT[768] 1f8b867e85d5
visual.trunk.blocks.3.norm2.weight FLOAT[768] 317775b41385
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] e8626a08e878
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] e4685f016100
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] 4d0c3aa1afec
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] 1b104d84a9b3
visual.trunk.blocks.4.norm1.bias FLOAT[768] 68572b6dcc2e
visual.trunk.blocks.4.norm1.weight FLOAT[768] 71af182aa814
visual.trunk.blocks.4.norm2.bias FLOAT[768] 5a377521c987
visual.trunk.blocks.4.norm2.weight FLOAT[768] a9bc50db9bbb
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] 36694b2f99a7
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] 4379d41b5449
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] 14bcab126b3c
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 8cad8b720d6d
visual.trunk.blocks.5.norm1.bias FLOAT[768] 35e5e2afd4aa
visual.trunk.blocks.5.norm1.weight FLOAT[768] 77979a2d475b
visual.trunk.blocks.5.norm2.bias FLOAT[768] 7f374dbdb1e2
visual.trunk.blocks.5.norm2.weight FLOAT[768] a0b27a097fa6
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 4971b9a1fea8
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] 651ac9c43b79
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 5c6c42b496e6
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] ed46593e0140
visual.trunk.blocks.6.norm1.bias FLOAT[768] 37bb1f3d7bf9
visual.trunk.blocks.6.norm1.weight FLOAT[768] 383a62e7fe70
visual.trunk.blocks.6.norm2.bias FLOAT[768] 9ee4703f6df1
visual.trunk.blocks.6.norm2.weight FLOAT[768] ef32a757a005
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] 453aa19e602e
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] a950ac539fc4
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] bcb8e9189feb
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] 2ac5dcd2fd9c
visual.trunk.blocks.7.norm1.bias FLOAT[768] 6346ca7e0e7e
visual.trunk.blocks.7.norm1.weight FLOAT[768] 4af9fef4eb7d
visual.trunk.blocks.7.norm2.bias FLOAT[768] fc8817ff470f
visual.trunk.blocks.7.norm2.weight FLOAT[768] 60432418db8e
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] 9fa12e603f20
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] 35a200dbf3d5
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] 3706dbb2cff8
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] 44e78538a0da
visual.trunk.blocks.8.norm1.bias FLOAT[768] fb59326421c0
visual.trunk.blocks.8.norm1.weight FLOAT[768] 55d09f232a21
visual.trunk.blocks.8.norm2.bias FLOAT[768] d3782eb40ff7
visual.trunk.blocks.8.norm2.weight FLOAT[768] 3f05440c287b
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] 98cd8fb2cefa
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] d528377b506f
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] 634e08ef480f
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] eb4207ba4a6a
visual.trunk.blocks.9.norm1.bias FLOAT[768] 5ab44edd1b87
visual.trunk.blocks.9.norm1.weight FLOAT[768] 8410561f140e
visual.trunk.blocks.9.norm2.bias FLOAT[768] c226838fc535
visual.trunk.blocks.9.norm2.weight FLOAT[768] 4844f65a713e
visual.trunk.norm.bias FLOAT[768] c755132aec46
visual.trunk.norm.weight FLOAT[768] b4037fb4010c
visual.trunk.patch_embed.proj.bias FLOAT[768] bcd1bd740fdb
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] 3d95e8118369
visual.trunk.pos_embed FLOAT[1,256,768] dbf531a1ab09
@@ -0,0 +1,571 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
<
float[batch,64,768] add_1071
float[batch,64,768] add_1092
float[batch,64,768] add_119
float[batch,64,768] add_1207
float[batch,64,768] add_1228
float[batch,64,768] add_1343
float[batch,64,768] add_1364
float[batch,64,768] add_140
float[batch,64,768] add_1479
float[batch,64,768] add_1500
float[batch,1,768] add_1500_pooled
float[batch,1,768] add_1615
float[batch,1,768] add_1636
float[batch,64,768] add_255
float[batch,64,768] add_276
float[batch,64,768] add_391
float[batch,64,768] add_4
float[batch,64,768] add_412
float[batch,64,768] add_527
float[batch,64,768] add_548
float[batch,64,768] add_663
float[batch,64,768] add_684
float[batch,64,768] add_799
float[batch,64,768] add_820
float[batch,64,768] add_935
float[batch,64,768] add_956
float[batch,1] clamp_min
float[batch,64,768] embedding
float[batch,64,3072] gelu
float[batch,64,3072] gelu_1
float[batch,64,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,64,3072] gelu_2
float[batch,64,3072] gelu_3
float[batch,64,3072] gelu_4
float[batch,64,3072] gelu_5
float[batch,64,3072] gelu_6
float[batch,64,3072] gelu_7
float[batch,64,3072] gelu_8
float[batch,64,3072] gelu_9
float[batch,64,768] layer_norm
float[batch,64,768] layer_norm_1
float[batch,64,768] layer_norm_10
float[batch,64,768] layer_norm_11
float[batch,64,768] layer_norm_12
float[batch,64,768] layer_norm_13
float[batch,64,768] layer_norm_14
float[batch,64,768] layer_norm_15
float[batch,64,768] layer_norm_16
float[batch,64,768] layer_norm_17
float[batch,64,768] layer_norm_18
float[batch,64,768] layer_norm_19
float[batch,64,768] layer_norm_2
float[batch,64,768] layer_norm_20
float[batch,64,768] layer_norm_21
float[batch,64,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,64,768] layer_norm_3
float[batch,64,768] layer_norm_4
float[batch,64,768] layer_norm_5
float[batch,64,768] layer_norm_6
float[batch,64,768] layer_norm_7
float[batch,64,768] layer_norm_8
float[batch,64,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,64,3072] linear_10
float[batch,64,768] linear_11
float[batch,64,3072] linear_14
float[batch,64,768] linear_15
float[batch,64,3072] linear_18
float[batch,64,768] linear_19
float[batch,64,3072] linear_2
float[batch,64,3072] linear_22
float[batch,64,768] linear_23
float[batch,64,3072] linear_26
float[batch,64,768] linear_27
float[batch,64,768] linear_3
float[batch,64,3072] linear_30
float[batch,64,768] linear_31
float[batch,64,3072] linear_34
float[batch,64,768] linear_35
float[batch,64,3072] linear_38
float[batch,64,768] linear_39
float[batch,64,3072] linear_42
float[batch,64,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,768] linear_48
float[batch,64,3072] linear_6
float[batch,64,768] linear_7
float[batch,64,768] node_scaled_dot_product_attention_10_k
float[batch,64,768] node_scaled_dot_product_attention_10_out
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_q
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_v
float[batch,64,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_v
float[batch,64,768] node_scaled_dot_product_attention_1_k
float[batch,64,768] node_scaled_dot_product_attention_1_out
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_q
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_v
float[batch,64,768] node_scaled_dot_product_attention_2_k
float[batch,64,768] node_scaled_dot_product_attention_2_out
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_q
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_v
float[batch,64,768] node_scaled_dot_product_attention_3_k
float[batch,64,768] node_scaled_dot_product_attention_3_out
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_q
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_v
float[batch,64,768] node_scaled_dot_product_attention_4_k
float[batch,64,768] node_scaled_dot_product_attention_4_out
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_q
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_v
float[batch,64,768] node_scaled_dot_product_attention_5_k
float[batch,64,768] node_scaled_dot_product_attention_5_out
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_q
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_v
float[batch,64,768] node_scaled_dot_product_attention_6_k
float[batch,64,768] node_scaled_dot_product_attention_6_out
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_q
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_v
float[batch,64,768] node_scaled_dot_product_attention_7_k
float[batch,64,768] node_scaled_dot_product_attention_7_out
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_q
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_v
float[batch,64,768] node_scaled_dot_product_attention_8_k
float[batch,64,768] node_scaled_dot_product_attention_8_out
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_q
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_v
float[batch,64,768] node_scaled_dot_product_attention_9_k
float[batch,64,768] node_scaled_dot_product_attention_9_out
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_q
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_v
float[batch,64,768] node_scaled_dot_product_attention_k
float[batch,64,768] node_scaled_dot_product_attention_out
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_q
float[batch,64,2304] node_scaled_dot_product_attention_qkv
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_v
float[batch,64,768] scaled_dot_product_attention
float[batch,64,768] scaled_dot_product_attention_1
float[batch,64,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,64,768] scaled_dot_product_attention_2
float[batch,64,768] scaled_dot_product_attention_3
float[batch,64,768] scaled_dot_product_attention_4
float[batch,64,768] scaled_dot_product_attention_5
float[batch,64,768] scaled_dot_product_attention_6
float[batch,64,768] scaled_dot_product_attention_7
float[batch,64,768] scaled_dot_product_attention_8
float[batch,64,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,64,3072] val_41
float[batch,64,768] val_42
float[batch,64,3072] val_43
float[batch,64,768] val_44
float[batch,64,3072] val_45
float[batch,64,768] val_46
float[batch,64,3072] val_47
float[batch,64,768] val_48
float[batch,64,3072] val_49
float[batch,64,768] val_50
float[batch,64,3072] val_51
float[batch,64,768] val_52
float[batch,64,3072] val_53
float[batch,64,768] val_54
float[batch,64,3072] val_55
float[batch,64,768] val_56
float[batch,64,3072] val_57
float[batch,64,768] val_58
float[batch,64,3072] val_59
float[batch,64,768] val_60
float[batch,64,3072] val_61
float[batch,64,768] val_62
float[batch,1,3072] val_63
float[batch,1,768] val_64
float[batch,768] val_65
>
{
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_40)
add_4 = Add (embedding, "text.positional_embedding")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
val_41 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "tanh"> (linear_2)
val_42 = MatMul (gelu, val_6)
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
val_43 = MatMul (layer_norm_3, val_8)
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "tanh"> (linear_6)
val_44 = MatMul (gelu_1, val_9)
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
val_45 = MatMul (layer_norm_5, val_11)
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "tanh"> (linear_10)
val_46 = MatMul (gelu_2, val_12)
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
val_47 = MatMul (layer_norm_7, val_14)
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "tanh"> (linear_14)
val_48 = MatMul (gelu_3, val_15)
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
val_49 = MatMul (layer_norm_9, val_17)
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "tanh"> (linear_18)
val_50 = MatMul (gelu_4, val_18)
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
val_51 = MatMul (layer_norm_11, val_20)
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "tanh"> (linear_22)
val_52 = MatMul (gelu_5, val_21)
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
val_53 = MatMul (layer_norm_13, val_23)
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "tanh"> (linear_26)
val_54 = MatMul (gelu_6, val_24)
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
val_55 = MatMul (layer_norm_15, val_26)
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "tanh"> (linear_30)
val_56 = MatMul (gelu_7, val_27)
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
val_57 = MatMul (layer_norm_17, val_29)
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "tanh"> (linear_34)
val_58 = MatMul (gelu_8, val_30)
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
val_59 = MatMul (layer_norm_19, val_32)
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "tanh"> (linear_38)
val_60 = MatMul (gelu_9, val_33)
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
val_61 = MatMul (layer_norm_21, val_35)
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "tanh"> (linear_42)
val_62 = MatMul (gelu_10, val_36)
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_38)
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "tanh"> (linear_46)
val_64 = MatMul (gelu_11, val_39)
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = Squeeze (add_1636, val_2)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (linear_48, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 8431589bdb3b
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 7ded04f562b5
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] b2b30c211a8b
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 5b13713107ee
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 02f22c8203ba
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] f4092da035fd
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 180e93f37d8f
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 62474ad198c1
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 590dedf9e53e
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] d082cdedbd22
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 3ea507bc4b0a
node_scaled_dot_product_attention_wo_t FLOAT[768,768] f60682948813
text.ln_final.bias FLOAT[768] cef2730f7918
text.ln_final.weight FLOAT[768] 51441accecbf
text.positional_embedding FLOAT[64,768] 204dad64fb7d
text.text_projection.bias FLOAT[768] 51d664d67559
text.text_projection.weight FLOAT[768,768] 28d60b9c96d6
text.token_embedding.weight_fp16 FLOAT16[256000,768] 629234d79233
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] a4054ed4549e
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 060bed0b9af7
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 54f246c916f6
text.transformer.resblocks.0.ln_1.weight FLOAT[768] 8e9407d87c58
text.transformer.resblocks.0.ln_2.bias FLOAT[768] 3b4f773c2b16
text.transformer.resblocks.0.ln_2.weight FLOAT[768] a6a13916e634
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 784dc7dffd5e
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 905428733e5d
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 75be2687596f
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 6254f2095f9c
text.transformer.resblocks.1.ln_1.bias FLOAT[768] 2eb9cfad6bb2
text.transformer.resblocks.1.ln_1.weight FLOAT[768] 73273468c898
text.transformer.resblocks.1.ln_2.bias FLOAT[768] 2a65fb1075fd
text.transformer.resblocks.1.ln_2.weight FLOAT[768] b793ed7443cf
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 819d5786ca12
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 9e33202d5485
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] e7b0424b9d2e
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] d8ebcaef79a9
text.transformer.resblocks.10.ln_1.bias FLOAT[768] 05dfb4d4a0e8
text.transformer.resblocks.10.ln_1.weight FLOAT[768] e21a26d8607d
text.transformer.resblocks.10.ln_2.bias FLOAT[768] 661c90b4e6ef
text.transformer.resblocks.10.ln_2.weight FLOAT[768] fb6de4cfb4ae
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 0286313f8e03
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 0756b02f3dba
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] c290af208fe9
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 3f91d6f82bfb
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 364c75f30ce7
text.transformer.resblocks.11.ln_1.weight FLOAT[768] 718d7f40dc1a
text.transformer.resblocks.11.ln_2.bias FLOAT[768] e8eb52018864
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 1c2c5ca40a6d
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] a84800eea374
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 0f1e5c95ae34
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] a262ae14c3b3
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] df9b9874cf1e
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 45be869926ae
text.transformer.resblocks.2.ln_1.weight FLOAT[768] 601393259a51
text.transformer.resblocks.2.ln_2.bias FLOAT[768] 2ddffe3dcc17
text.transformer.resblocks.2.ln_2.weight FLOAT[768] f81afd335d04
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] e2c572e7ccc9
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 1176aad267ac
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] fff2afeb2e2e
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 5699a466abbd
text.transformer.resblocks.3.ln_1.bias FLOAT[768] a35f49b3a62c
text.transformer.resblocks.3.ln_1.weight FLOAT[768] 3c8b93ad6d40
text.transformer.resblocks.3.ln_2.bias FLOAT[768] c0fbb8a63d8e
text.transformer.resblocks.3.ln_2.weight FLOAT[768] 9df47c5106bd
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 6a6115476fe4
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] d6e60c5e90f9
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 5a39109a8696
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] d991d43151f0
text.transformer.resblocks.4.ln_1.bias FLOAT[768] cecbe2dcbc54
text.transformer.resblocks.4.ln_1.weight FLOAT[768] a4f52bd97602
text.transformer.resblocks.4.ln_2.bias FLOAT[768] 676d91dade2e
text.transformer.resblocks.4.ln_2.weight FLOAT[768] 56a5c586dd6a
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 259c54eb4cbf
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 860c4343d744
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 337b2d85decb
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 06e2ec68794f
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 2317d79b9e18
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 430d27b166a8
text.transformer.resblocks.5.ln_2.bias FLOAT[768] fb308860697a
text.transformer.resblocks.5.ln_2.weight FLOAT[768] 6475848a483e
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] f2016171e1cf
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 3e1e76c9901a
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] b56edd2c8e9f
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] f37f5b365510
text.transformer.resblocks.6.ln_1.bias FLOAT[768] 8085a42d00aa
text.transformer.resblocks.6.ln_1.weight FLOAT[768] ac47a71bdef6
text.transformer.resblocks.6.ln_2.bias FLOAT[768] 958d5d987b61
text.transformer.resblocks.6.ln_2.weight FLOAT[768] e09f65ec198a
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 6e6b1cdeed6c
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 496944794c7e
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 413927f70fb8
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 47bd2cc4764a
text.transformer.resblocks.7.ln_1.bias FLOAT[768] 9821666944fa
text.transformer.resblocks.7.ln_1.weight FLOAT[768] a2d4a146d7e6
text.transformer.resblocks.7.ln_2.bias FLOAT[768] f1183206def7
text.transformer.resblocks.7.ln_2.weight FLOAT[768] ebf4df1e199c
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 8eb8371d67fe
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 7dbd0de4f393
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 7ced04d6f5a8
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] f69bf0be56bb
text.transformer.resblocks.8.ln_1.bias FLOAT[768] 5df4e7623434
text.transformer.resblocks.8.ln_1.weight FLOAT[768] b69aa2a049d4
text.transformer.resblocks.8.ln_2.bias FLOAT[768] 6ea688f8ef55
text.transformer.resblocks.8.ln_2.weight FLOAT[768] d013abbfd30c
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 1daf354a3944
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] ea2346caa8ac
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] a06454c6ec9a
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] ec72390b796a
text.transformer.resblocks.9.ln_1.bias FLOAT[768] 2375142a49a0
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 82d0588feac4
text.transformer.resblocks.9.ln_2.bias FLOAT[768] 0ab336cbc57e
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 188276fe2617
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 2e3a59acc7a4
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 6ab580004bd6
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,2304] 968e49324323
val_11 FLOAT[768,3072] c2fa6db7b730
val_12 FLOAT[3072,768] 2eeffc871f58
val_13 FLOAT[768,2304] 163fd2e3e37e
val_14 FLOAT[768,3072] cd5178751406
val_15 FLOAT[3072,768] 3849e16c9388
val_16 FLOAT[768,2304] be370f211bff
val_17 FLOAT[768,3072] 7c162f3cae16
val_18 FLOAT[3072,768] b82b996e7038
val_19 FLOAT[768,2304] a521f34d2e49
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,3072] 82e4964bce64
val_21 FLOAT[3072,768] 735d54c432f0
val_22 FLOAT[768,2304] a1d32e5ac00d
val_23 FLOAT[768,3072] d77b88ff2ca3
val_24 FLOAT[3072,768] 993cccb541fa
val_25 FLOAT[768,2304] 132b3a0fffe4
val_26 FLOAT[768,3072] 27fccf08cdc1
val_27 FLOAT[3072,768] 0a8247ed6d60
val_28 FLOAT[768,2304] bcd7d168cf8f
val_29 FLOAT[768,3072] 1d5857266e50
val_3 INT64[1] 6a69a6cc7473
val_30 FLOAT[3072,768] c0e5334e45f5
val_31 FLOAT[768,2304] e415f0cb7519
val_32 FLOAT[768,3072] 2308195935ed
val_33 FLOAT[3072,768] b430434a806d
val_34 FLOAT[768,2304] 4e5ec7bb7193
val_35 FLOAT[768,3072] 114d557561fe
val_36 FLOAT[3072,768] dd0fcf8bb844
val_37 FLOAT[768,2304] bcb52066d056
val_38 FLOAT[768,3072] f94ab5e746c5
val_39 FLOAT[3072,768] 20fc1cafeab7
val_4 FLOAT[768,2304] a7fba1ba6269
val_5 FLOAT[768,3072] 22db71475497
val_6 FLOAT[3072,768] 5745a20bdb77
val_7 FLOAT[768,2304] 157c6602dc10
val_8 FLOAT[768,3072] b2c6f9e7a7be
val_9 FLOAT[3072,768] 7c377c157d61
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,768] image_embedding)
<
float[batch,196,768] add_1007
float[batch,196,768] add_1068
float[batch,196,768] add_107
float[batch,196,768] add_1097
float[batch,1,768] add_1195
float[batch,196,768] add_13
float[batch,196,768] add_168
float[batch,196,768] add_197
float[batch,196,768] add_258
float[batch,196,768] add_287
float[batch,196,768] add_348
float[batch,196,768] add_377
float[batch,196,768] add_438
float[batch,196,768] add_467
float[batch,196,768] add_528
float[batch,196,768] add_557
float[batch,196,768] add_618
float[batch,196,768] add_647
float[batch,196,768] add_708
float[batch,196,768] add_737
float[batch,196,768] add_78
float[batch,196,768] add_798
float[batch,196,768] add_827
float[batch,196,768] add_888
float[batch,196,768] add_917
float[batch,196,768] add_978
float[batch,1] clamp_min
float[batch,768,14,14] conv2d
float[batch,196,3072] gelu
float[batch,196,3072] gelu_1
float[batch,196,3072] gelu_10
float[batch,196,3072] gelu_11
float[batch,1,3072] gelu_12
float[batch,196,3072] gelu_2
float[batch,196,3072] gelu_3
float[batch,196,3072] gelu_4
float[batch,196,3072] gelu_5
float[batch,196,3072] gelu_6
float[batch,196,3072] gelu_7
float[batch,196,3072] gelu_8
float[batch,196,3072] gelu_9
float[batch,3,224,224] image_chw
float[batch] image_ez
float[batch] image_ez_r
float[batch,1,1,1] image_ez_s
float[batch,224,224,3] image_f32
float[batch,196,768] layer_norm
float[batch,196,768] layer_norm_1
float[batch,196,768] layer_norm_10
float[batch,196,768] layer_norm_11
float[batch,196,768] layer_norm_12
float[batch,196,768] layer_norm_13
float[batch,196,768] layer_norm_14
float[batch,196,768] layer_norm_15
float[batch,196,768] layer_norm_16
float[batch,196,768] layer_norm_17
float[batch,196,768] layer_norm_18
float[batch,196,768] layer_norm_19
float[batch,196,768] layer_norm_2
float[batch,196,768] layer_norm_20
float[batch,196,768] layer_norm_21
float[batch,196,768] layer_norm_22
float[batch,196,768] layer_norm_23
float[batch,196,768] layer_norm_24
float[batch,1,768] layer_norm_25
float[batch,196,768] layer_norm_3
float[batch,196,768] layer_norm_4
float[batch,196,768] layer_norm_5
float[batch,196,768] layer_norm_6
float[batch,196,768] layer_norm_7
float[batch,196,768] layer_norm_8
float[batch,196,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,196,2304] linear
float[batch,196,768] linear_1
float[batch,196,3072] linear_10
float[batch,196,768] linear_11
float[batch,196,2304] linear_12
float[batch,196,768] linear_13
float[batch,196,3072] linear_14
float[batch,196,768] linear_15
float[batch,196,2304] linear_16
float[batch,196,768] linear_17
float[batch,196,3072] linear_18
float[batch,196,768] linear_19
float[batch,196,3072] linear_2
float[batch,196,2304] linear_20
float[batch,196,768] linear_21
float[batch,196,3072] linear_22
float[batch,196,768] linear_23
float[batch,196,2304] linear_24
float[batch,196,768] linear_25
float[batch,196,3072] linear_26
float[batch,196,768] linear_27
float[batch,196,2304] linear_28
float[batch,196,768] linear_29
float[batch,196,768] linear_3
float[batch,196,3072] linear_30
float[batch,196,768] linear_31
float[batch,196,2304] linear_32
float[batch,196,768] linear_33
float[batch,196,3072] linear_34
float[batch,196,768] linear_35
float[batch,196,2304] linear_36
float[batch,196,768] linear_37
float[batch,196,3072] linear_38
float[batch,196,768] linear_39
float[batch,196,2304] linear_4
float[batch,196,2304] linear_40
float[batch,196,768] linear_41
float[batch,196,3072] linear_42
float[batch,196,768] linear_43
float[batch,196,2304] linear_44
float[batch,196,768] linear_45
float[batch,196,3072] linear_46
float[batch,196,768] linear_47
float[batch,196,1536] linear_49
float[batch,196,768] linear_5
float[batch,1,768] linear_50
float[batch,1,3072] linear_51
float[batch,1,768] linear_52
float[batch,196,3072] linear_6
float[batch,196,768] linear_7
float[batch,196,2304] linear_8
float[batch,196,768] linear_9
float[batch,196,768] node_scaled_dot_product_attention_10_k
float[batch,196,768] node_scaled_dot_product_attention_10_q
float[batch,196,768] node_scaled_dot_product_attention_10_v
float[batch,196,768] node_scaled_dot_product_attention_11_k
float[batch,196,768] node_scaled_dot_product_attention_11_q
float[batch,196,768] node_scaled_dot_product_attention_11_v
float[batch,196,768] node_scaled_dot_product_attention_12_k
float[batch,1,768] node_scaled_dot_product_attention_12_q
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
float[batch,196,768] node_scaled_dot_product_attention_12_v
float[batch,196,768] node_scaled_dot_product_attention_1_k
float[batch,196,768] node_scaled_dot_product_attention_1_q
float[batch,196,768] node_scaled_dot_product_attention_1_v
float[batch,196,768] node_scaled_dot_product_attention_2_k
float[batch,196,768] node_scaled_dot_product_attention_2_q
float[batch,196,768] node_scaled_dot_product_attention_2_v
float[batch,196,768] node_scaled_dot_product_attention_3_k
float[batch,196,768] node_scaled_dot_product_attention_3_q
float[batch,196,768] node_scaled_dot_product_attention_3_v
float[batch,196,768] node_scaled_dot_product_attention_4_k
float[batch,196,768] node_scaled_dot_product_attention_4_q
float[batch,196,768] node_scaled_dot_product_attention_4_v
float[batch,196,768] node_scaled_dot_product_attention_5_k
float[batch,196,768] node_scaled_dot_product_attention_5_q
float[batch,196,768] node_scaled_dot_product_attention_5_v
float[batch,196,768] node_scaled_dot_product_attention_6_k
float[batch,196,768] node_scaled_dot_product_attention_6_q
float[batch,196,768] node_scaled_dot_product_attention_6_v
float[batch,196,768] node_scaled_dot_product_attention_7_k
float[batch,196,768] node_scaled_dot_product_attention_7_q
float[batch,196,768] node_scaled_dot_product_attention_7_v
float[batch,196,768] node_scaled_dot_product_attention_8_k
float[batch,196,768] node_scaled_dot_product_attention_8_q
float[batch,196,768] node_scaled_dot_product_attention_8_v
float[batch,196,768] node_scaled_dot_product_attention_9_k
float[batch,196,768] node_scaled_dot_product_attention_9_q
float[batch,196,768] node_scaled_dot_product_attention_9_v
float[batch,196,768] node_scaled_dot_product_attention_k
float[batch,196,768] node_scaled_dot_product_attention_q
float[batch,196,768] node_scaled_dot_product_attention_v
float[batch,196,768] scaled_dot_product_attention
float[batch,196,768] scaled_dot_product_attention_1
float[batch,196,768] scaled_dot_product_attention_10
float[batch,196,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_12
float[batch,196,768] scaled_dot_product_attention_2
float[batch,196,768] scaled_dot_product_attention_3
float[batch,196,768] scaled_dot_product_attention_4
float[batch,196,768] scaled_dot_product_attention_5
float[batch,196,768] scaled_dot_product_attention_6
float[batch,196,768] scaled_dot_product_attention_7
float[batch,196,768] scaled_dot_product_attention_8
float[batch,196,768] scaled_dot_product_attention_9
float[batch,768] select
float[batch,196,768] transpose
float[batch,196,768] val_100
float[batch,196,3072] val_101
float[batch,196,768] val_102
float[batch,196,1536] val_103
float[batch,1,768] val_104
float[batch,1,3072] val_105
float[batch,1,768] val_106
float[batch,196,2304] val_55
float[batch,196,768] val_56
float[batch,196,3072] val_57
float[batch,196,768] val_58
float[batch,196,2304] val_59
float[batch,196,768] val_60
float[batch,196,3072] val_61
float[batch,196,768] val_62
float[batch,196,2304] val_63
float[batch,196,768] val_64
float[batch,196,3072] val_65
float[batch,196,768] val_66
float[batch,196,2304] val_67
float[batch,196,768] val_68
float[batch,196,3072] val_69
float[batch,196,768] val_70
float[batch,196,2304] val_71
float[batch,196,768] val_72
float[batch,196,3072] val_73
float[batch,196,768] val_74
float[batch,196,2304] val_75
float[batch,196,768] val_76
float[batch,196,3072] val_77
float[batch,196,768] val_78
float[batch,196,2304] val_79
float[batch,196,768] val_80
float[batch,196,3072] val_81
float[batch,196,768] val_82
float[batch,196,2304] val_83
float[batch,196,768] val_84
float[batch,196,3072] val_85
float[batch,196,768] val_86
float[batch,196,2304] val_87
float[batch,196,768] val_88
float[batch,196,3072] val_89
float[batch,196,768] val_90
float[batch,196,2304] val_91
float[batch,196,768] val_92
float[batch,196,3072] val_93
float[batch,196,768] val_94
float[batch,196,2304] val_95
float[batch,196,768] val_96
float[batch,196,3072] val_97
float[batch,196,768] val_98
float[batch,196,2304] val_99
float[batch,768,196] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
add_13 = Add (transpose, "visual.trunk.pos_embed")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
val_55 = MatMul (layer_norm, val_3)
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
val_56 = MatMul (scaled_dot_product_attention, val_4)
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
add_78 = Add (add_13, linear_1)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
val_57 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_58 = MatMul (gelu, val_6)
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
add_107 = Add (add_78, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
val_59 = MatMul (layer_norm_2, val_7)
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
add_168 = Add (add_107, linear_5)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
val_61 = MatMul (layer_norm_3, val_9)
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_62 = MatMul (gelu_1, val_10)
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
add_197 = Add (add_168, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
val_63 = MatMul (layer_norm_4, val_11)
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
add_258 = Add (add_197, linear_9)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
val_65 = MatMul (layer_norm_5, val_13)
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_66 = MatMul (gelu_2, val_14)
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
add_287 = Add (add_258, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
val_67 = MatMul (layer_norm_6, val_15)
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
add_348 = Add (add_287, linear_13)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
val_69 = MatMul (layer_norm_7, val_17)
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_70 = MatMul (gelu_3, val_18)
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
add_377 = Add (add_348, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
val_71 = MatMul (layer_norm_8, val_19)
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
add_438 = Add (add_377, linear_17)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
val_73 = MatMul (layer_norm_9, val_21)
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_74 = MatMul (gelu_4, val_22)
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
add_467 = Add (add_438, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
val_75 = MatMul (layer_norm_10, val_23)
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
add_528 = Add (add_467, linear_21)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
val_77 = MatMul (layer_norm_11, val_25)
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_78 = MatMul (gelu_5, val_26)
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
add_557 = Add (add_528, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
val_79 = MatMul (layer_norm_12, val_27)
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
add_618 = Add (add_557, linear_25)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
val_81 = MatMul (layer_norm_13, val_29)
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_82 = MatMul (gelu_6, val_30)
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
add_647 = Add (add_618, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
val_83 = MatMul (layer_norm_14, val_31)
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
add_708 = Add (add_647, linear_29)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
val_85 = MatMul (layer_norm_15, val_33)
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_86 = MatMul (gelu_7, val_34)
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
add_737 = Add (add_708, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
val_87 = MatMul (layer_norm_16, val_35)
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
add_798 = Add (add_737, linear_33)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
val_89 = MatMul (layer_norm_17, val_37)
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_90 = MatMul (gelu_8, val_38)
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
add_827 = Add (add_798, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
val_91 = MatMul (layer_norm_18, val_39)
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
add_888 = Add (add_827, linear_37)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
val_93 = MatMul (layer_norm_19, val_41)
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_94 = MatMul (gelu_9, val_42)
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
add_917 = Add (add_888, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
val_95 = MatMul (layer_norm_20, val_43)
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
add_978 = Add (add_917, linear_41)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
val_97 = MatMul (layer_norm_21, val_45)
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_98 = MatMul (gelu_10, val_46)
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
add_1007 = Add (add_978, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
val_99 = MatMul (layer_norm_22, val_47)
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
add_1068 = Add (add_1007, linear_45)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
val_101 = MatMul (layer_norm_23, val_49)
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_102 = MatMul (gelu_11, val_50)
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
add_1097 = Add (add_1068, linear_47)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
val_103 = MatMul (layer_norm_24, val_51)
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
val_105 = MatMul (layer_norm_25, val_53)
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
val_106 = MatMul (gelu_12, val_54)
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
add_1195 = Add (linear_50, linear_52)
select = Squeeze (add_1195, val_2)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
attn3d_split_2x768 INT64[2] 6b8b40015c71
attn3d_split_3x768 INT64[3] eca50b2daf34
image_ez_axes INT64[3] e2e2033ae7e1
image_ez_ends INT64[3] 605390e5a369
image_ez_starts INT64[3] 9d908ecfb6b2
image_ez_zero FLOAT[] df3f619804a9
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] b48b84a7c3c9
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[3072,768] 35151aa85350
val_11 FLOAT[768,2304] a7c5bd691526
val_12 FLOAT[768,768] fb20db441664
val_13 FLOAT[768,3072] 17c4a53c18b0
val_14 FLOAT[3072,768] c3e933107b71
val_15 FLOAT[768,2304] ca296ce4d6cc
val_16 FLOAT[768,768] 140fd6243318
val_17 FLOAT[768,3072] 63791f15aa57
val_18 FLOAT[3072,768] 3f51de15a1b5
val_19 FLOAT[768,2304] b8fd72400054
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,768] 6f24f369eece
val_21 FLOAT[768,3072] 35742b69f2f7
val_22 FLOAT[3072,768] 835fcddd2695
val_23 FLOAT[768,2304] 718d5b31a403
val_24 FLOAT[768,768] 7b086602fd9b
val_25 FLOAT[768,3072] 904e692e4093
val_26 FLOAT[3072,768] 179b2f567235
val_27 FLOAT[768,2304] c9862902a054
val_28 FLOAT[768,768] a538e6f1a6a5
val_29 FLOAT[768,3072] 33b181fb9769
val_3 FLOAT[768,2304] f6318d39ab5a
val_30 FLOAT[3072,768] f53a702bf92a
val_31 FLOAT[768,2304] bc944a30fbbb
val_32 FLOAT[768,768] db648935dd7e
val_33 FLOAT[768,3072] f3aead6169be
val_34 FLOAT[3072,768] a85d070cbd93
val_35 FLOAT[768,2304] 92779781ad9d
val_36 FLOAT[768,768] 2b93e82aeac4
val_37 FLOAT[768,3072] f9cd207b3f78
val_38 FLOAT[3072,768] f0bad2aa4a22
val_39 FLOAT[768,2304] a134515c85cc
val_4 FLOAT[768,768] 7d10477ea733
val_40 FLOAT[768,768] 959bf66f258b
val_41 FLOAT[768,3072] 3eb0a185a88e
val_42 FLOAT[3072,768] 5ee1cc6cfc31
val_43 FLOAT[768,2304] d1ae2f8d4321
val_44 FLOAT[768,768] ae979eab55a5
val_45 FLOAT[768,3072] 7fc404488610
val_46 FLOAT[3072,768] 386ef778fa66
val_47 FLOAT[768,2304] b14c30a50c68
val_48 FLOAT[768,768] 7c7c5488b8f4
val_49 FLOAT[768,3072] d09a6ec13524
val_5 FLOAT[768,3072] 107321df4216
val_50 FLOAT[3072,768] 15bcf7483d52
val_51 FLOAT[768,1536] b8e5e5efd44f
val_52 FLOAT[768,768] 525750710594
val_53 FLOAT[768,3072] a39433fea5ef
val_54 FLOAT[3072,768] 2c9682695036
val_6 FLOAT[3072,768] 6d75e39cc542
val_7 FLOAT[768,2304] ac7807bc55f3
val_8 FLOAT[768,768] fdba40e8eafb
val_9 FLOAT[768,3072] 75f4cbd61aca
view_target INT64[3] 8931c30473a4
visual.trunk.attn_pool.kv.bias FLOAT[1536] a2bfcfa4ee87
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] b71b933f7089
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] caeba7bdd532
visual.trunk.attn_pool.norm.bias FLOAT[768] 70bc0ccf76ad
visual.trunk.attn_pool.norm.weight FLOAT[768] 68a5af1db4e6
visual.trunk.attn_pool.proj.bias FLOAT[768] 4bf090435a36
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] b6e716489fa3
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] 5609c61fff4c
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] 9ebe756607e8
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] a3c64ed6b5e1
visual.trunk.blocks.0.norm1.bias FLOAT[768] f0f7de6d5b0f
visual.trunk.blocks.0.norm1.weight FLOAT[768] d7efee4154db
visual.trunk.blocks.0.norm2.bias FLOAT[768] 528dfadc7c39
visual.trunk.blocks.0.norm2.weight FLOAT[768] 3d701b13b3b4
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] bffb1197c5ae
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] 649bb5006251
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] 8cd761394c2c
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] da40ac44d758
visual.trunk.blocks.1.norm1.bias FLOAT[768] 25ad54ea9b5b
visual.trunk.blocks.1.norm1.weight FLOAT[768] b2b2bfd9ddf9
visual.trunk.blocks.1.norm2.bias FLOAT[768] d884538540ee
visual.trunk.blocks.1.norm2.weight FLOAT[768] e3cae880f839
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] d3634285be58
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] 64acfe9b9632
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] 17624c6e6c66
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] c0f8c366384f
visual.trunk.blocks.10.norm1.bias FLOAT[768] e4927d2af401
visual.trunk.blocks.10.norm1.weight FLOAT[768] 782fed983b74
visual.trunk.blocks.10.norm2.bias FLOAT[768] 5c4715ea1800
visual.trunk.blocks.10.norm2.weight FLOAT[768] 7f076494f4d1
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] f98171698aa5
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] dc2b684da991
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 023a65d838eb
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] 11425d9366ac
visual.trunk.blocks.11.norm1.bias FLOAT[768] c7d7fc2c313a
visual.trunk.blocks.11.norm1.weight FLOAT[768] 98ad9de03d3e
visual.trunk.blocks.11.norm2.bias FLOAT[768] 629ae37295f8
visual.trunk.blocks.11.norm2.weight FLOAT[768] 26f8702417f9
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] 1eae355622e9
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 4a760475e9b2
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 6c9acc24bf9d
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] fc078d045243
visual.trunk.blocks.2.norm1.bias FLOAT[768] 3fd4bbaaefae
visual.trunk.blocks.2.norm1.weight FLOAT[768] 5298a509f358
visual.trunk.blocks.2.norm2.bias FLOAT[768] 4cc7c3b5dadd
visual.trunk.blocks.2.norm2.weight FLOAT[768] d186b84b0a9b
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 95250d74a3c1
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 1492f968e45b
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] d75ddb61fd70
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] f75ed3aa14cb
visual.trunk.blocks.3.norm1.bias FLOAT[768] 070528d4d68d
visual.trunk.blocks.3.norm1.weight FLOAT[768] 1638f2d4c6f5
visual.trunk.blocks.3.norm2.bias FLOAT[768] 8c9377373812
visual.trunk.blocks.3.norm2.weight FLOAT[768] 1269dcb6fbeb
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] 245c1a0448b7
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 4e0a691d4fca
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] 0053fb691da4
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] 4ab6f1f985a7
visual.trunk.blocks.4.norm1.bias FLOAT[768] 2942938b1199
visual.trunk.blocks.4.norm1.weight FLOAT[768] 4ce22463a52d
visual.trunk.blocks.4.norm2.bias FLOAT[768] 2298de068435
visual.trunk.blocks.4.norm2.weight FLOAT[768] 2a18f5a32c8b
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] a61bbd55553f
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] 08458730cda8
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] b2dc30be4d7d
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] e885fae30f1d
visual.trunk.blocks.5.norm1.bias FLOAT[768] d5032acb4dd0
visual.trunk.blocks.5.norm1.weight FLOAT[768] 318595094627
visual.trunk.blocks.5.norm2.bias FLOAT[768] 724b180361e1
visual.trunk.blocks.5.norm2.weight FLOAT[768] 8eccf2eba1e4
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 6685ffe0cd0a
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] e87c29ba1c40
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 337fe92f0637
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] a055aa89bed4
visual.trunk.blocks.6.norm1.bias FLOAT[768] 8ffc0bb7155d
visual.trunk.blocks.6.norm1.weight FLOAT[768] a8e0cb724947
visual.trunk.blocks.6.norm2.bias FLOAT[768] 4d9c8495ca1c
visual.trunk.blocks.6.norm2.weight FLOAT[768] efbaafa5219b
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] c5191f2bd49c
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 710cbcc8faaf
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] 487786c474f5
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] 2ae6b7092f8a
visual.trunk.blocks.7.norm1.bias FLOAT[768] 2e1f4027f439
visual.trunk.blocks.7.norm1.weight FLOAT[768] 1c55e3a4ec71
visual.trunk.blocks.7.norm2.bias FLOAT[768] 193fa7303488
visual.trunk.blocks.7.norm2.weight FLOAT[768] 46d93834ff5f
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] 44afc74aacf1
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] 681f08aa0cff
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] e3c8ff237051
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] df5fabc3b264
visual.trunk.blocks.8.norm1.bias FLOAT[768] 8c04de6b311a
visual.trunk.blocks.8.norm1.weight FLOAT[768] 5457157fe0ef
visual.trunk.blocks.8.norm2.bias FLOAT[768] 2db1a7c1df6e
visual.trunk.blocks.8.norm2.weight FLOAT[768] 7af932d026d2
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] 6272d3730f90
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] 9426d177af88
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] a35ee9a5bb76
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] 55d67866b742
visual.trunk.blocks.9.norm1.bias FLOAT[768] 63554bdd695c
visual.trunk.blocks.9.norm1.weight FLOAT[768] 32a05d48dee6
visual.trunk.blocks.9.norm2.bias FLOAT[768] ede8316b8289
visual.trunk.blocks.9.norm2.weight FLOAT[768] a204262c790c
visual.trunk.norm.bias FLOAT[768] a8ea2601baa1
visual.trunk.norm.weight FLOAT[768] 7566d8181da9
visual.trunk.patch_embed.proj.bias FLOAT[768] de13f191eb69
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] 6ee4b806817b
visual.trunk.pos_embed FLOAT[1,196,768] 0d8d7830ccaa
@@ -0,0 +1,571 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
<
float[batch,64,768] add_1071
float[batch,64,768] add_1092
float[batch,64,768] add_119
float[batch,64,768] add_1207
float[batch,64,768] add_1228
float[batch,64,768] add_1343
float[batch,64,768] add_1364
float[batch,64,768] add_140
float[batch,64,768] add_1479
float[batch,64,768] add_1500
float[batch,1,768] add_1500_pooled
float[batch,1,768] add_1615
float[batch,1,768] add_1636
float[batch,64,768] add_255
float[batch,64,768] add_276
float[batch,64,768] add_391
float[batch,64,768] add_4
float[batch,64,768] add_412
float[batch,64,768] add_527
float[batch,64,768] add_548
float[batch,64,768] add_663
float[batch,64,768] add_684
float[batch,64,768] add_799
float[batch,64,768] add_820
float[batch,64,768] add_935
float[batch,64,768] add_956
float[batch,1] clamp_min
float[batch,64,768] embedding
float[batch,64,3072] gelu
float[batch,64,3072] gelu_1
float[batch,64,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,64,3072] gelu_2
float[batch,64,3072] gelu_3
float[batch,64,3072] gelu_4
float[batch,64,3072] gelu_5
float[batch,64,3072] gelu_6
float[batch,64,3072] gelu_7
float[batch,64,3072] gelu_8
float[batch,64,3072] gelu_9
float[batch,64,768] layer_norm
float[batch,64,768] layer_norm_1
float[batch,64,768] layer_norm_10
float[batch,64,768] layer_norm_11
float[batch,64,768] layer_norm_12
float[batch,64,768] layer_norm_13
float[batch,64,768] layer_norm_14
float[batch,64,768] layer_norm_15
float[batch,64,768] layer_norm_16
float[batch,64,768] layer_norm_17
float[batch,64,768] layer_norm_18
float[batch,64,768] layer_norm_19
float[batch,64,768] layer_norm_2
float[batch,64,768] layer_norm_20
float[batch,64,768] layer_norm_21
float[batch,64,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,64,768] layer_norm_3
float[batch,64,768] layer_norm_4
float[batch,64,768] layer_norm_5
float[batch,64,768] layer_norm_6
float[batch,64,768] layer_norm_7
float[batch,64,768] layer_norm_8
float[batch,64,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,64,3072] linear_10
float[batch,64,768] linear_11
float[batch,64,3072] linear_14
float[batch,64,768] linear_15
float[batch,64,3072] linear_18
float[batch,64,768] linear_19
float[batch,64,3072] linear_2
float[batch,64,3072] linear_22
float[batch,64,768] linear_23
float[batch,64,3072] linear_26
float[batch,64,768] linear_27
float[batch,64,768] linear_3
float[batch,64,3072] linear_30
float[batch,64,768] linear_31
float[batch,64,3072] linear_34
float[batch,64,768] linear_35
float[batch,64,3072] linear_38
float[batch,64,768] linear_39
float[batch,64,3072] linear_42
float[batch,64,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,768] linear_48
float[batch,64,3072] linear_6
float[batch,64,768] linear_7
float[batch,64,768] node_scaled_dot_product_attention_10_k
float[batch,64,768] node_scaled_dot_product_attention_10_out
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_q
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_v
float[batch,64,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_v
float[batch,64,768] node_scaled_dot_product_attention_1_k
float[batch,64,768] node_scaled_dot_product_attention_1_out
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_q
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_v
float[batch,64,768] node_scaled_dot_product_attention_2_k
float[batch,64,768] node_scaled_dot_product_attention_2_out
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_q
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_v
float[batch,64,768] node_scaled_dot_product_attention_3_k
float[batch,64,768] node_scaled_dot_product_attention_3_out
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_q
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_v
float[batch,64,768] node_scaled_dot_product_attention_4_k
float[batch,64,768] node_scaled_dot_product_attention_4_out
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_q
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_v
float[batch,64,768] node_scaled_dot_product_attention_5_k
float[batch,64,768] node_scaled_dot_product_attention_5_out
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_q
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_v
float[batch,64,768] node_scaled_dot_product_attention_6_k
float[batch,64,768] node_scaled_dot_product_attention_6_out
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_q
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_v
float[batch,64,768] node_scaled_dot_product_attention_7_k
float[batch,64,768] node_scaled_dot_product_attention_7_out
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_q
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_v
float[batch,64,768] node_scaled_dot_product_attention_8_k
float[batch,64,768] node_scaled_dot_product_attention_8_out
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_q
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_v
float[batch,64,768] node_scaled_dot_product_attention_9_k
float[batch,64,768] node_scaled_dot_product_attention_9_out
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_q
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_v
float[batch,64,768] node_scaled_dot_product_attention_k
float[batch,64,768] node_scaled_dot_product_attention_out
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_q
float[batch,64,2304] node_scaled_dot_product_attention_qkv
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_v
float[batch,64,768] scaled_dot_product_attention
float[batch,64,768] scaled_dot_product_attention_1
float[batch,64,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,64,768] scaled_dot_product_attention_2
float[batch,64,768] scaled_dot_product_attention_3
float[batch,64,768] scaled_dot_product_attention_4
float[batch,64,768] scaled_dot_product_attention_5
float[batch,64,768] scaled_dot_product_attention_6
float[batch,64,768] scaled_dot_product_attention_7
float[batch,64,768] scaled_dot_product_attention_8
float[batch,64,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,64,3072] val_41
float[batch,64,768] val_42
float[batch,64,3072] val_43
float[batch,64,768] val_44
float[batch,64,3072] val_45
float[batch,64,768] val_46
float[batch,64,3072] val_47
float[batch,64,768] val_48
float[batch,64,3072] val_49
float[batch,64,768] val_50
float[batch,64,3072] val_51
float[batch,64,768] val_52
float[batch,64,3072] val_53
float[batch,64,768] val_54
float[batch,64,3072] val_55
float[batch,64,768] val_56
float[batch,64,3072] val_57
float[batch,64,768] val_58
float[batch,64,3072] val_59
float[batch,64,768] val_60
float[batch,64,3072] val_61
float[batch,64,768] val_62
float[batch,1,3072] val_63
float[batch,1,768] val_64
float[batch,768] val_65
>
{
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_40)
add_4 = Add (embedding, "text.positional_embedding")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
val_41 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_42 = MatMul (gelu, val_6)
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
val_43 = MatMul (layer_norm_3, val_8)
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_44 = MatMul (gelu_1, val_9)
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
val_45 = MatMul (layer_norm_5, val_11)
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_46 = MatMul (gelu_2, val_12)
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
val_47 = MatMul (layer_norm_7, val_14)
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_48 = MatMul (gelu_3, val_15)
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
val_49 = MatMul (layer_norm_9, val_17)
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_50 = MatMul (gelu_4, val_18)
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
val_51 = MatMul (layer_norm_11, val_20)
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_52 = MatMul (gelu_5, val_21)
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
val_53 = MatMul (layer_norm_13, val_23)
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_54 = MatMul (gelu_6, val_24)
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
val_55 = MatMul (layer_norm_15, val_26)
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_56 = MatMul (gelu_7, val_27)
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
val_57 = MatMul (layer_norm_17, val_29)
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_58 = MatMul (gelu_8, val_30)
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
val_59 = MatMul (layer_norm_19, val_32)
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_60 = MatMul (gelu_9, val_33)
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
val_61 = MatMul (layer_norm_21, val_35)
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_62 = MatMul (gelu_10, val_36)
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_38)
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_39)
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = Squeeze (add_1636, val_2)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (linear_48, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 1b00565e585f
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 9d982efec485
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] ef25fb2e5410
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] b8a0d0f8e10a
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] c183187e9ce6
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] c208a790c139
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] b8afeea57a2c
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 72061febaa01
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 200be726a00c
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 89e742de8c8e
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] b15cf74471bc
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 134cf8952541
text.ln_final.bias FLOAT[768] 660a2e63b5d5
text.ln_final.weight FLOAT[768] d0248021e7b5
text.positional_embedding FLOAT[64,768] 72e17f3cdeb3
text.text_projection.bias FLOAT[768] e2c224fee5fb
text.text_projection.weight FLOAT[768,768] 9d8750a1dfa1
text.token_embedding.weight_fp16 FLOAT16[32000,768] d074e16c3e6c
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] aea850261075
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 3e1b0af0542b
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 64ac656935d8
text.transformer.resblocks.0.ln_1.weight FLOAT[768] 413f89947f3c
text.transformer.resblocks.0.ln_2.bias FLOAT[768] 56e8bcdddb68
text.transformer.resblocks.0.ln_2.weight FLOAT[768] 06da630777f6
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] ddf2c3004873
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 5d15c65e0292
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 5620fd7033dd
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] ad1f60e0a90f
text.transformer.resblocks.1.ln_1.bias FLOAT[768] ed050d599fc6
text.transformer.resblocks.1.ln_1.weight FLOAT[768] dbd6c76768d6
text.transformer.resblocks.1.ln_2.bias FLOAT[768] 4394a50b4e1f
text.transformer.resblocks.1.ln_2.weight FLOAT[768] 8562f1c678a7
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] c13a27eb8542
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 4825187527af
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] f1ed8076697c
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 7f97d84b0550
text.transformer.resblocks.10.ln_1.bias FLOAT[768] bb08fc127c92
text.transformer.resblocks.10.ln_1.weight FLOAT[768] 2f9d7d6f4952
text.transformer.resblocks.10.ln_2.bias FLOAT[768] 7eaea1490fad
text.transformer.resblocks.10.ln_2.weight FLOAT[768] f2d170c0824e
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 178c433b0691
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] d548058a90b2
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 10fa75e59dfa
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] adffb8aa58f5
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 82f00885ced8
text.transformer.resblocks.11.ln_1.weight FLOAT[768] 17d28940260f
text.transformer.resblocks.11.ln_2.bias FLOAT[768] c3d73efab8b7
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 8d251d108183
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] d414b7672362
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 7d2ce222e73e
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 36cbffcf9321
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 91cdbae2d6af
text.transformer.resblocks.2.ln_1.bias FLOAT[768] 91ef9c1a7ee0
text.transformer.resblocks.2.ln_1.weight FLOAT[768] 95f1e2345699
text.transformer.resblocks.2.ln_2.bias FLOAT[768] fe051a7687d7
text.transformer.resblocks.2.ln_2.weight FLOAT[768] cf7f1b0e3cea
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 33bc6cf7f147
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] f504ca795e87
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 6a3587367621
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 6211efdeb674
text.transformer.resblocks.3.ln_1.bias FLOAT[768] 95a5f9eab59f
text.transformer.resblocks.3.ln_1.weight FLOAT[768] c174a2277205
text.transformer.resblocks.3.ln_2.bias FLOAT[768] 1bb5579c0d8a
text.transformer.resblocks.3.ln_2.weight FLOAT[768] 0bd66178be0a
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 32e68aefc9cb
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 692f61cf4d0e
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 11fc53ff556d
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 0a622530344a
text.transformer.resblocks.4.ln_1.bias FLOAT[768] ae7b7d196db7
text.transformer.resblocks.4.ln_1.weight FLOAT[768] cb40f2e44acf
text.transformer.resblocks.4.ln_2.bias FLOAT[768] c580ec5fd0d7
text.transformer.resblocks.4.ln_2.weight FLOAT[768] e5b497d1f031
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 1406227cd1a1
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] d1ac8452f846
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 0bc2318d0f5f
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 35ee210c7ac5
text.transformer.resblocks.5.ln_1.bias FLOAT[768] 7be32c6a22da
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 6da86731f403
text.transformer.resblocks.5.ln_2.bias FLOAT[768] 39a4909a31f4
text.transformer.resblocks.5.ln_2.weight FLOAT[768] 6c4c25d2a5d7
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] ad08840b9937
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] bf82490da501
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 6d1ae147f652
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 94f57492b2f5
text.transformer.resblocks.6.ln_1.bias FLOAT[768] af423ea4170c
text.transformer.resblocks.6.ln_1.weight FLOAT[768] 72dfa1e6d49d
text.transformer.resblocks.6.ln_2.bias FLOAT[768] 8d49bca3bb80
text.transformer.resblocks.6.ln_2.weight FLOAT[768] b3a68be3161c
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] b0b0fb1ce12b
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 89abe6146344
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 98fa6767a45c
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] cac2b8467865
text.transformer.resblocks.7.ln_1.bias FLOAT[768] a3569e9d825b
text.transformer.resblocks.7.ln_1.weight FLOAT[768] 7d2f8a5c1101
text.transformer.resblocks.7.ln_2.bias FLOAT[768] 0d6c63e25ab1
text.transformer.resblocks.7.ln_2.weight FLOAT[768] f7d278baacac
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] a9a0d4df2603
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] e64b6d15251b
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] e3b3ecbaf55d
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 4cb98b66c534
text.transformer.resblocks.8.ln_1.bias FLOAT[768] 182a2a6ed013
text.transformer.resblocks.8.ln_1.weight FLOAT[768] 0a6f67fcf6e7
text.transformer.resblocks.8.ln_2.bias FLOAT[768] f575a6a0a37c
text.transformer.resblocks.8.ln_2.weight FLOAT[768] d16423825839
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] bab748a333ed
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] c5b5fe322f5d
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 23093760d5e4
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] eb19340ede13
text.transformer.resblocks.9.ln_1.bias FLOAT[768] d85363ea3897
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 64f9eb8a018d
text.transformer.resblocks.9.ln_2.bias FLOAT[768] 1c3b492dac7b
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 0c4c5fe2d1c8
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 54a530b69c31
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 29bf7b109346
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,2304] 2cef91802373
val_11 FLOAT[768,3072] c715245f15a7
val_12 FLOAT[3072,768] a437378b76b5
val_13 FLOAT[768,2304] 1ff1419da1af
val_14 FLOAT[768,3072] 24dbe3f778c4
val_15 FLOAT[3072,768] bc0a941a8d48
val_16 FLOAT[768,2304] 01bdfa7ee26b
val_17 FLOAT[768,3072] a54f74155dd1
val_18 FLOAT[3072,768] 6832f0d024eb
val_19 FLOAT[768,2304] 7dd4be981a98
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,3072] 788026237a3c
val_21 FLOAT[3072,768] e4257b5e866b
val_22 FLOAT[768,2304] 01636d7ebf57
val_23 FLOAT[768,3072] 8eafc994a84e
val_24 FLOAT[3072,768] e5909ad0223d
val_25 FLOAT[768,2304] 53e50dd49de0
val_26 FLOAT[768,3072] 3304cdf1311f
val_27 FLOAT[3072,768] d742317f99b4
val_28 FLOAT[768,2304] eb2870e0d90f
val_29 FLOAT[768,3072] 1267428b22ce
val_3 INT64[1] 6a69a6cc7473
val_30 FLOAT[3072,768] 29e93b7dc451
val_31 FLOAT[768,2304] fd36a3462ebd
val_32 FLOAT[768,3072] ea827d006bbe
val_33 FLOAT[3072,768] c9b3f77d82b0
val_34 FLOAT[768,2304] d3780ece80d7
val_35 FLOAT[768,3072] f08ab5789c48
val_36 FLOAT[3072,768] 09d244f71288
val_37 FLOAT[768,2304] b77964b17dd0
val_38 FLOAT[768,3072] 2a4921986ef6
val_39 FLOAT[3072,768] 5573a4974986
val_4 FLOAT[768,2304] b276a89b4af8
val_5 FLOAT[768,3072] 53938137724e
val_6 FLOAT[3072,768] 0df07bbfe222
val_7 FLOAT[768,2304] 9bbcc0e5c786
val_8 FLOAT[768,3072] f731ca5aaf9a
val_9 FLOAT[3072,768] f4aab1716b68
+625
View File
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,768] image_embedding)
<
float[batch,196,768] add_1007
float[batch,196,768] add_1068
float[batch,196,768] add_107
float[batch,196,768] add_1097
float[batch,1,768] add_1195
float[batch,196,768] add_13
float[batch,196,768] add_168
float[batch,196,768] add_197
float[batch,196,768] add_258
float[batch,196,768] add_287
float[batch,196,768] add_348
float[batch,196,768] add_377
float[batch,196,768] add_438
float[batch,196,768] add_467
float[batch,196,768] add_528
float[batch,196,768] add_557
float[batch,196,768] add_618
float[batch,196,768] add_647
float[batch,196,768] add_708
float[batch,196,768] add_737
float[batch,196,768] add_78
float[batch,196,768] add_798
float[batch,196,768] add_827
float[batch,196,768] add_888
float[batch,196,768] add_917
float[batch,196,768] add_978
float[batch,1] clamp_min
float[batch,768,14,14] conv2d
float[batch,196,3072] gelu
float[batch,196,3072] gelu_1
float[batch,196,3072] gelu_10
float[batch,196,3072] gelu_11
float[batch,1,3072] gelu_12
float[batch,196,3072] gelu_2
float[batch,196,3072] gelu_3
float[batch,196,3072] gelu_4
float[batch,196,3072] gelu_5
float[batch,196,3072] gelu_6
float[batch,196,3072] gelu_7
float[batch,196,3072] gelu_8
float[batch,196,3072] gelu_9
float[batch,3,224,224] image_chw
float[batch] image_ez
float[batch] image_ez_r
float[batch,1,1,1] image_ez_s
float[batch,224,224,3] image_f32
float[batch,196,768] layer_norm
float[batch,196,768] layer_norm_1
float[batch,196,768] layer_norm_10
float[batch,196,768] layer_norm_11
float[batch,196,768] layer_norm_12
float[batch,196,768] layer_norm_13
float[batch,196,768] layer_norm_14
float[batch,196,768] layer_norm_15
float[batch,196,768] layer_norm_16
float[batch,196,768] layer_norm_17
float[batch,196,768] layer_norm_18
float[batch,196,768] layer_norm_19
float[batch,196,768] layer_norm_2
float[batch,196,768] layer_norm_20
float[batch,196,768] layer_norm_21
float[batch,196,768] layer_norm_22
float[batch,196,768] layer_norm_23
float[batch,196,768] layer_norm_24
float[batch,1,768] layer_norm_25
float[batch,196,768] layer_norm_3
float[batch,196,768] layer_norm_4
float[batch,196,768] layer_norm_5
float[batch,196,768] layer_norm_6
float[batch,196,768] layer_norm_7
float[batch,196,768] layer_norm_8
float[batch,196,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,196,2304] linear
float[batch,196,768] linear_1
float[batch,196,3072] linear_10
float[batch,196,768] linear_11
float[batch,196,2304] linear_12
float[batch,196,768] linear_13
float[batch,196,3072] linear_14
float[batch,196,768] linear_15
float[batch,196,2304] linear_16
float[batch,196,768] linear_17
float[batch,196,3072] linear_18
float[batch,196,768] linear_19
float[batch,196,3072] linear_2
float[batch,196,2304] linear_20
float[batch,196,768] linear_21
float[batch,196,3072] linear_22
float[batch,196,768] linear_23
float[batch,196,2304] linear_24
float[batch,196,768] linear_25
float[batch,196,3072] linear_26
float[batch,196,768] linear_27
float[batch,196,2304] linear_28
float[batch,196,768] linear_29
float[batch,196,768] linear_3
float[batch,196,3072] linear_30
float[batch,196,768] linear_31
float[batch,196,2304] linear_32
float[batch,196,768] linear_33
float[batch,196,3072] linear_34
float[batch,196,768] linear_35
float[batch,196,2304] linear_36
float[batch,196,768] linear_37
float[batch,196,3072] linear_38
float[batch,196,768] linear_39
float[batch,196,2304] linear_4
float[batch,196,2304] linear_40
float[batch,196,768] linear_41
float[batch,196,3072] linear_42
float[batch,196,768] linear_43
float[batch,196,2304] linear_44
float[batch,196,768] linear_45
float[batch,196,3072] linear_46
float[batch,196,768] linear_47
float[batch,196,1536] linear_49
float[batch,196,768] linear_5
float[batch,1,768] linear_50
float[batch,1,3072] linear_51
float[batch,1,768] linear_52
float[batch,196,3072] linear_6
float[batch,196,768] linear_7
float[batch,196,2304] linear_8
float[batch,196,768] linear_9
float[batch,196,768] node_scaled_dot_product_attention_10_k
float[batch,196,768] node_scaled_dot_product_attention_10_q
float[batch,196,768] node_scaled_dot_product_attention_10_v
float[batch,196,768] node_scaled_dot_product_attention_11_k
float[batch,196,768] node_scaled_dot_product_attention_11_q
float[batch,196,768] node_scaled_dot_product_attention_11_v
float[batch,196,768] node_scaled_dot_product_attention_12_k
float[batch,1,768] node_scaled_dot_product_attention_12_q
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
float[batch,196,768] node_scaled_dot_product_attention_12_v
float[batch,196,768] node_scaled_dot_product_attention_1_k
float[batch,196,768] node_scaled_dot_product_attention_1_q
float[batch,196,768] node_scaled_dot_product_attention_1_v
float[batch,196,768] node_scaled_dot_product_attention_2_k
float[batch,196,768] node_scaled_dot_product_attention_2_q
float[batch,196,768] node_scaled_dot_product_attention_2_v
float[batch,196,768] node_scaled_dot_product_attention_3_k
float[batch,196,768] node_scaled_dot_product_attention_3_q
float[batch,196,768] node_scaled_dot_product_attention_3_v
float[batch,196,768] node_scaled_dot_product_attention_4_k
float[batch,196,768] node_scaled_dot_product_attention_4_q
float[batch,196,768] node_scaled_dot_product_attention_4_v
float[batch,196,768] node_scaled_dot_product_attention_5_k
float[batch,196,768] node_scaled_dot_product_attention_5_q
float[batch,196,768] node_scaled_dot_product_attention_5_v
float[batch,196,768] node_scaled_dot_product_attention_6_k
float[batch,196,768] node_scaled_dot_product_attention_6_q
float[batch,196,768] node_scaled_dot_product_attention_6_v
float[batch,196,768] node_scaled_dot_product_attention_7_k
float[batch,196,768] node_scaled_dot_product_attention_7_q
float[batch,196,768] node_scaled_dot_product_attention_7_v
float[batch,196,768] node_scaled_dot_product_attention_8_k
float[batch,196,768] node_scaled_dot_product_attention_8_q
float[batch,196,768] node_scaled_dot_product_attention_8_v
float[batch,196,768] node_scaled_dot_product_attention_9_k
float[batch,196,768] node_scaled_dot_product_attention_9_q
float[batch,196,768] node_scaled_dot_product_attention_9_v
float[batch,196,768] node_scaled_dot_product_attention_k
float[batch,196,768] node_scaled_dot_product_attention_q
float[batch,196,768] node_scaled_dot_product_attention_v
float[batch,196,768] scaled_dot_product_attention
float[batch,196,768] scaled_dot_product_attention_1
float[batch,196,768] scaled_dot_product_attention_10
float[batch,196,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_12
float[batch,196,768] scaled_dot_product_attention_2
float[batch,196,768] scaled_dot_product_attention_3
float[batch,196,768] scaled_dot_product_attention_4
float[batch,196,768] scaled_dot_product_attention_5
float[batch,196,768] scaled_dot_product_attention_6
float[batch,196,768] scaled_dot_product_attention_7
float[batch,196,768] scaled_dot_product_attention_8
float[batch,196,768] scaled_dot_product_attention_9
float[batch,768] select
float[batch,196,768] transpose
float[batch,196,768] val_100
float[batch,196,3072] val_101
float[batch,196,768] val_102
float[batch,196,1536] val_103
float[batch,1,768] val_104
float[batch,1,3072] val_105
float[batch,1,768] val_106
float[batch,196,2304] val_55
float[batch,196,768] val_56
float[batch,196,3072] val_57
float[batch,196,768] val_58
float[batch,196,2304] val_59
float[batch,196,768] val_60
float[batch,196,3072] val_61
float[batch,196,768] val_62
float[batch,196,2304] val_63
float[batch,196,768] val_64
float[batch,196,3072] val_65
float[batch,196,768] val_66
float[batch,196,2304] val_67
float[batch,196,768] val_68
float[batch,196,3072] val_69
float[batch,196,768] val_70
float[batch,196,2304] val_71
float[batch,196,768] val_72
float[batch,196,3072] val_73
float[batch,196,768] val_74
float[batch,196,2304] val_75
float[batch,196,768] val_76
float[batch,196,3072] val_77
float[batch,196,768] val_78
float[batch,196,2304] val_79
float[batch,196,768] val_80
float[batch,196,3072] val_81
float[batch,196,768] val_82
float[batch,196,2304] val_83
float[batch,196,768] val_84
float[batch,196,3072] val_85
float[batch,196,768] val_86
float[batch,196,2304] val_87
float[batch,196,768] val_88
float[batch,196,3072] val_89
float[batch,196,768] val_90
float[batch,196,2304] val_91
float[batch,196,768] val_92
float[batch,196,3072] val_93
float[batch,196,768] val_94
float[batch,196,2304] val_95
float[batch,196,768] val_96
float[batch,196,3072] val_97
float[batch,196,768] val_98
float[batch,196,2304] val_99
float[batch,768,196] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
add_13 = Add (transpose, "visual.trunk.pos_embed")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
val_55 = MatMul (layer_norm, val_3)
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
val_56 = MatMul (scaled_dot_product_attention, val_4)
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
add_78 = Add (add_13, linear_1)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
val_57 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_58 = MatMul (gelu, val_6)
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
add_107 = Add (add_78, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
val_59 = MatMul (layer_norm_2, val_7)
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
add_168 = Add (add_107, linear_5)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
val_61 = MatMul (layer_norm_3, val_9)
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_62 = MatMul (gelu_1, val_10)
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
add_197 = Add (add_168, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
val_63 = MatMul (layer_norm_4, val_11)
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
add_258 = Add (add_197, linear_9)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
val_65 = MatMul (layer_norm_5, val_13)
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_66 = MatMul (gelu_2, val_14)
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
add_287 = Add (add_258, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
val_67 = MatMul (layer_norm_6, val_15)
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
add_348 = Add (add_287, linear_13)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
val_69 = MatMul (layer_norm_7, val_17)
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_70 = MatMul (gelu_3, val_18)
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
add_377 = Add (add_348, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
val_71 = MatMul (layer_norm_8, val_19)
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
add_438 = Add (add_377, linear_17)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
val_73 = MatMul (layer_norm_9, val_21)
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_74 = MatMul (gelu_4, val_22)
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
add_467 = Add (add_438, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
val_75 = MatMul (layer_norm_10, val_23)
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
add_528 = Add (add_467, linear_21)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
val_77 = MatMul (layer_norm_11, val_25)
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_78 = MatMul (gelu_5, val_26)
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
add_557 = Add (add_528, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
val_79 = MatMul (layer_norm_12, val_27)
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
add_618 = Add (add_557, linear_25)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
val_81 = MatMul (layer_norm_13, val_29)
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_82 = MatMul (gelu_6, val_30)
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
add_647 = Add (add_618, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
val_83 = MatMul (layer_norm_14, val_31)
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
add_708 = Add (add_647, linear_29)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
val_85 = MatMul (layer_norm_15, val_33)
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_86 = MatMul (gelu_7, val_34)
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
add_737 = Add (add_708, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
val_87 = MatMul (layer_norm_16, val_35)
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
add_798 = Add (add_737, linear_33)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
val_89 = MatMul (layer_norm_17, val_37)
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_90 = MatMul (gelu_8, val_38)
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
add_827 = Add (add_798, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
val_91 = MatMul (layer_norm_18, val_39)
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
add_888 = Add (add_827, linear_37)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
val_93 = MatMul (layer_norm_19, val_41)
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_94 = MatMul (gelu_9, val_42)
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
add_917 = Add (add_888, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
val_95 = MatMul (layer_norm_20, val_43)
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
add_978 = Add (add_917, linear_41)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
val_97 = MatMul (layer_norm_21, val_45)
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_98 = MatMul (gelu_10, val_46)
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
add_1007 = Add (add_978, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
val_99 = MatMul (layer_norm_22, val_47)
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
add_1068 = Add (add_1007, linear_45)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
val_101 = MatMul (layer_norm_23, val_49)
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_102 = MatMul (gelu_11, val_50)
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
add_1097 = Add (add_1068, linear_47)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
val_103 = MatMul (layer_norm_24, val_51)
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
val_105 = MatMul (layer_norm_25, val_53)
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
gelu_12 = Gelu <approximate: string = "none"> (linear_51)
val_106 = MatMul (gelu_12, val_54)
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
add_1195 = Add (linear_50, linear_52)
select = Squeeze (add_1195, val_2)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
attn3d_split_2x768 INT64[2] 6b8b40015c71
attn3d_split_3x768 INT64[3] eca50b2daf34
image_ez_axes INT64[3] e2e2033ae7e1
image_ez_ends INT64[3] 605390e5a369
image_ez_starts INT64[3] 9d908ecfb6b2
image_ez_zero FLOAT[] df3f619804a9
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] cc637c65a769
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[3072,768] c89cb5efefe3
val_11 FLOAT[768,2304] 244da0ecbab8
val_12 FLOAT[768,768] 35f14ff7731c
val_13 FLOAT[768,3072] 21275030b0a4
val_14 FLOAT[3072,768] c1fc34a20814
val_15 FLOAT[768,2304] cbc637c917db
val_16 FLOAT[768,768] ef41fc0a4683
val_17 FLOAT[768,3072] 5e73fced44c8
val_18 FLOAT[3072,768] 51aa9e7d2542
val_19 FLOAT[768,2304] 0b498ccd5239
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,768] 9c716e702044
val_21 FLOAT[768,3072] 66120e3abadd
val_22 FLOAT[3072,768] ae432fe7b8ea
val_23 FLOAT[768,2304] 371d97f0ce3b
val_24 FLOAT[768,768] 0e743cedae04
val_25 FLOAT[768,3072] d2ecaf120cbe
val_26 FLOAT[3072,768] 366f8a641f78
val_27 FLOAT[768,2304] e77de0ea8451
val_28 FLOAT[768,768] 24b6d4f61033
val_29 FLOAT[768,3072] b04b7236b6a5
val_3 FLOAT[768,2304] 44ad594f4b6a
val_30 FLOAT[3072,768] dd6fe9c4943b
val_31 FLOAT[768,2304] 1687f8a0742d
val_32 FLOAT[768,768] abca07ad70dd
val_33 FLOAT[768,3072] a31937209ab5
val_34 FLOAT[3072,768] b1bc9e94e555
val_35 FLOAT[768,2304] 2fc424fa3d1d
val_36 FLOAT[768,768] bd59291edaba
val_37 FLOAT[768,3072] 8e8fdd174ab4
val_38 FLOAT[3072,768] 87e594e22eba
val_39 FLOAT[768,2304] 8d8c75f4a095
val_4 FLOAT[768,768] af18ab8da2bc
val_40 FLOAT[768,768] f51533167187
val_41 FLOAT[768,3072] 9c756fd8ea27
val_42 FLOAT[3072,768] a9645c6de2e2
val_43 FLOAT[768,2304] ee8e51d4dd00
val_44 FLOAT[768,768] df56972810f6
val_45 FLOAT[768,3072] 20729956ab62
val_46 FLOAT[3072,768] ed3233259086
val_47 FLOAT[768,2304] f4b9669bc6e9
val_48 FLOAT[768,768] b578b648d379
val_49 FLOAT[768,3072] 4adf993f72c3
val_5 FLOAT[768,3072] d7f406f6a581
val_50 FLOAT[3072,768] 14a4a0bf7d3d
val_51 FLOAT[768,1536] 437169d6662c
val_52 FLOAT[768,768] dd00fd5c26af
val_53 FLOAT[768,3072] aec8801a37a9
val_54 FLOAT[3072,768] 572f792ab230
val_6 FLOAT[3072,768] 1f690770888c
val_7 FLOAT[768,2304] 06fd3778639a
val_8 FLOAT[768,768] 76ca6e901d11
val_9 FLOAT[768,3072] 69c01c14ed7b
view_target INT64[3] 8931c30473a4
visual.trunk.attn_pool.kv.bias FLOAT[1536] f0c6bcf04428
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] 71f5baba6f58
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] 4b7523975440
visual.trunk.attn_pool.norm.bias FLOAT[768] 550fafbb99c0
visual.trunk.attn_pool.norm.weight FLOAT[768] 83f03337135d
visual.trunk.attn_pool.proj.bias FLOAT[768] 44f8ecd53ba2
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] 3e6ab8d9ffd0
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] cc36619f2d05
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] 2f3118ae82f2
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] 39d100533f03
visual.trunk.blocks.0.norm1.bias FLOAT[768] 3943eb6d3b2b
visual.trunk.blocks.0.norm1.weight FLOAT[768] 2f51b641875e
visual.trunk.blocks.0.norm2.bias FLOAT[768] e6312ca0b624
visual.trunk.blocks.0.norm2.weight FLOAT[768] b7863de98578
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] 6cb58552fdce
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] f50994b99fcb
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] df7626f5743d
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] 89502fb152fd
visual.trunk.blocks.1.norm1.bias FLOAT[768] 9c917e2b2eab
visual.trunk.blocks.1.norm1.weight FLOAT[768] 2a2bcafa5c7b
visual.trunk.blocks.1.norm2.bias FLOAT[768] b08ec4a74fbe
visual.trunk.blocks.1.norm2.weight FLOAT[768] cabef19f3fb5
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] 0fd85f0f8b11
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] 9f576619e829
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] b9df42dfa667
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] c64047f63168
visual.trunk.blocks.10.norm1.bias FLOAT[768] 5922e592b6a1
visual.trunk.blocks.10.norm1.weight FLOAT[768] 57fcdd029fd2
visual.trunk.blocks.10.norm2.bias FLOAT[768] 3427442e662d
visual.trunk.blocks.10.norm2.weight FLOAT[768] 763bd076d248
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] ba6b1a585e93
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] 1ea479b9e2c7
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] b0919fafd808
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] 02fbaf68b388
visual.trunk.blocks.11.norm1.bias FLOAT[768] a273213c79fb
visual.trunk.blocks.11.norm1.weight FLOAT[768] 90f95f03596e
visual.trunk.blocks.11.norm2.bias FLOAT[768] bcd87c270439
visual.trunk.blocks.11.norm2.weight FLOAT[768] f9c8b8d62eb0
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] 77c23f137591
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] 5d7a47f595d5
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 38b7f0c8eaed
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] 4c9fa2ca8577
visual.trunk.blocks.2.norm1.bias FLOAT[768] 2bd6d6cef389
visual.trunk.blocks.2.norm1.weight FLOAT[768] c6a658d8ab97
visual.trunk.blocks.2.norm2.bias FLOAT[768] 7267924894e8
visual.trunk.blocks.2.norm2.weight FLOAT[768] ac8da0bf8117
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] 8a1526d39a99
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] 0bed5ba702b2
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] 609c5765a303
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] 699eaea44faa
visual.trunk.blocks.3.norm1.bias FLOAT[768] 19889c69c418
visual.trunk.blocks.3.norm1.weight FLOAT[768] cc5715535d0a
visual.trunk.blocks.3.norm2.bias FLOAT[768] 61103b872f85
visual.trunk.blocks.3.norm2.weight FLOAT[768] 3c04ea86e45b
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] 8ca34a696fae
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 9d80c980c871
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] 6bfba51942fc
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] 19f3138200a1
visual.trunk.blocks.4.norm1.bias FLOAT[768] 34eefd59efe0
visual.trunk.blocks.4.norm1.weight FLOAT[768] 9d69a1617fb6
visual.trunk.blocks.4.norm2.bias FLOAT[768] c0fa5de5db84
visual.trunk.blocks.4.norm2.weight FLOAT[768] d96510b79d48
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] 417ad24564ce
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] f6290f0a3e34
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] 6e021710f599
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 8cdcd81a946f
visual.trunk.blocks.5.norm1.bias FLOAT[768] 2cfddfbb474f
visual.trunk.blocks.5.norm1.weight FLOAT[768] ed4500edaef8
visual.trunk.blocks.5.norm2.bias FLOAT[768] 376265e25520
visual.trunk.blocks.5.norm2.weight FLOAT[768] 3def78182a56
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 2abff0dd8575
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] 93ee9831e1c1
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 5d908edb35ed
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] 6515a2728caf
visual.trunk.blocks.6.norm1.bias FLOAT[768] 0aabb6562d55
visual.trunk.blocks.6.norm1.weight FLOAT[768] bf09dffff78e
visual.trunk.blocks.6.norm2.bias FLOAT[768] 39ca5db42202
visual.trunk.blocks.6.norm2.weight FLOAT[768] ff35526bdf06
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] 28da39783228
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 9140cbba2d41
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] 326df0f604bc
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] af4240695436
visual.trunk.blocks.7.norm1.bias FLOAT[768] 29a85f8c6876
visual.trunk.blocks.7.norm1.weight FLOAT[768] e7867633e14a
visual.trunk.blocks.7.norm2.bias FLOAT[768] 7bd18bd692ee
visual.trunk.blocks.7.norm2.weight FLOAT[768] ff665d5d0127
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] 6822992d1dfd
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] e82dd172e1f3
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] 5deabdb84266
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] 21b1e1f94bdd
visual.trunk.blocks.8.norm1.bias FLOAT[768] 87f3758dfe56
visual.trunk.blocks.8.norm1.weight FLOAT[768] e8a7ceb4a94a
visual.trunk.blocks.8.norm2.bias FLOAT[768] 1aeda61ddd85
visual.trunk.blocks.8.norm2.weight FLOAT[768] 14cd06846d2c
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] b3825bf85cd1
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] 4ac7b0b86d9a
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] 760c94491749
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] 44f2f4f3b3a5
visual.trunk.blocks.9.norm1.bias FLOAT[768] 8d17c2d0b5a7
visual.trunk.blocks.9.norm1.weight FLOAT[768] dc53aa4772d3
visual.trunk.blocks.9.norm2.bias FLOAT[768] b2c08a8ca534
visual.trunk.blocks.9.norm2.weight FLOAT[768] a827b498eaea
visual.trunk.norm.bias FLOAT[768] d314a0eda5cc
visual.trunk.norm.weight FLOAT[768] 7f51ec498090
visual.trunk.patch_embed.proj.bias FLOAT[768] ffbc3f4fc4fd
visual.trunk.patch_embed.proj.weight FLOAT[768,3,16,16] 5a10d2868d6f
visual.trunk.pos_embed FLOAT[1,196,768] d8ebb1f4c351
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,640] text_embedding)
<
float[batch,77,640] add_1071
float[batch,77,640] add_1092
float[batch,77,640] add_119
float[batch,77,640] add_1207
float[batch,77,640] add_1228
float[batch,77,640] add_1343
float[batch,77,640] add_1364
float[batch,77,640] add_140
float[batch,77,640] add_1479
float[batch,77,640] add_1500
float[batch,1,640] add_1500_pooled
float[batch,1,640] add_1615
float[batch,1,640] add_1636
float[batch,77,640] add_255
float[batch,77,640] add_276
float[batch,77,640] add_391
float[batch,77,640] add_4
float[batch,77,640] add_412
float[batch,77,640] add_527
float[batch,77,640] add_548
float[batch,77,640] add_663
float[batch,77,640] add_684
float[batch,77,640] add_799
float[batch,77,640] add_820
float[batch,77,640] add_935
float[batch,77,640] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,640] embedding
float[batch,77,2560] gelu
float[batch,77,2560] gelu_1
float[batch,77,2560] gelu_10
float[batch,1,2560] gelu_11
float[batch,77,2560] gelu_2
float[batch,77,2560] gelu_3
float[batch,77,2560] gelu_4
float[batch,77,2560] gelu_5
float[batch,77,2560] gelu_6
float[batch,77,2560] gelu_7
float[batch,77,2560] gelu_8
float[batch,77,2560] gelu_9
float[batch,77,640] layer_norm
float[batch,77,640] layer_norm_1
float[batch,77,640] layer_norm_10
float[batch,77,640] layer_norm_11
float[batch,77,640] layer_norm_12
float[batch,77,640] layer_norm_13
float[batch,77,640] layer_norm_14
float[batch,77,640] layer_norm_15
float[batch,77,640] layer_norm_16
float[batch,77,640] layer_norm_17
float[batch,77,640] layer_norm_18
float[batch,77,640] layer_norm_19
float[batch,77,640] layer_norm_2
float[batch,77,640] layer_norm_20
float[batch,77,640] layer_norm_21
float[batch,77,640] layer_norm_22
float[batch,1,640] layer_norm_23
float[batch,77,640] layer_norm_3
float[batch,77,640] layer_norm_4
float[batch,77,640] layer_norm_5
float[batch,77,640] layer_norm_6
float[batch,77,640] layer_norm_7
float[batch,77,640] layer_norm_8
float[batch,77,640] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2560] linear_10
float[batch,77,640] linear_11
float[batch,77,2560] linear_14
float[batch,77,640] linear_15
float[batch,77,2560] linear_18
float[batch,77,640] linear_19
float[batch,77,2560] linear_2
float[batch,77,2560] linear_22
float[batch,77,640] linear_23
float[batch,77,2560] linear_26
float[batch,77,640] linear_27
float[batch,77,640] linear_3
float[batch,77,2560] linear_30
float[batch,77,640] linear_31
float[batch,77,2560] linear_34
float[batch,77,640] linear_35
float[batch,77,2560] linear_38
float[batch,77,640] linear_39
float[batch,77,2560] linear_42
float[batch,77,640] linear_43
float[batch,1,2560] linear_46
float[batch,1,640] linear_47
float[batch,77,2560] linear_6
float[batch,77,640] linear_7
float[batch,640] matmul
float[batch,77,640] node_scaled_dot_product_attention_10_k
float[batch,77,640] node_scaled_dot_product_attention_10_out
float[batch,77,640] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_10_q
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_10_v
float[batch,77,640] node_scaled_dot_product_attention_11_k
float[batch,1,640] node_scaled_dot_product_attention_11_out
float[batch,1,640] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_11_q
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_11_v
float[batch,77,640] node_scaled_dot_product_attention_1_k
float[batch,77,640] node_scaled_dot_product_attention_1_out
float[batch,77,640] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_1_q
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_1_v
float[batch,77,640] node_scaled_dot_product_attention_2_k
float[batch,77,640] node_scaled_dot_product_attention_2_out
float[batch,77,640] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_2_q
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_2_v
float[batch,77,640] node_scaled_dot_product_attention_3_k
float[batch,77,640] node_scaled_dot_product_attention_3_out
float[batch,77,640] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_3_q
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_3_v
float[batch,77,640] node_scaled_dot_product_attention_4_k
float[batch,77,640] node_scaled_dot_product_attention_4_out
float[batch,77,640] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_4_q
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_4_v
float[batch,77,640] node_scaled_dot_product_attention_5_k
float[batch,77,640] node_scaled_dot_product_attention_5_out
float[batch,77,640] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_5_q
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_5_v
float[batch,77,640] node_scaled_dot_product_attention_6_k
float[batch,77,640] node_scaled_dot_product_attention_6_out
float[batch,77,640] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_6_q
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_6_v
float[batch,77,640] node_scaled_dot_product_attention_7_k
float[batch,77,640] node_scaled_dot_product_attention_7_out
float[batch,77,640] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_7_q
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_7_v
float[batch,77,640] node_scaled_dot_product_attention_8_k
float[batch,77,640] node_scaled_dot_product_attention_8_out
float[batch,77,640] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_8_q
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_8_v
float[batch,77,640] node_scaled_dot_product_attention_9_k
float[batch,77,640] node_scaled_dot_product_attention_9_out
float[batch,77,640] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_9_q
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_9_v
float[batch,77,640] node_scaled_dot_product_attention_k
float[batch,77,640] node_scaled_dot_product_attention_out
float[batch,77,640] node_scaled_dot_product_attention_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_q
float[batch,77,1920] node_scaled_dot_product_attention_qkv
float[batch,77,1920] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_v
float[batch,77,640] scaled_dot_product_attention
float[batch,77,640] scaled_dot_product_attention_1
float[batch,77,640] scaled_dot_product_attention_10
float[batch,77,640] scaled_dot_product_attention_11
float[batch,1,640] scaled_dot_product_attention_11_pooled
float[batch,77,640] scaled_dot_product_attention_2
float[batch,77,640] scaled_dot_product_attention_3
float[batch,77,640] scaled_dot_product_attention_4
float[batch,77,640] scaled_dot_product_attention_5
float[batch,77,640] scaled_dot_product_attention_6
float[batch,77,640] scaled_dot_product_attention_7
float[batch,77,640] scaled_dot_product_attention_8
float[batch,77,640] scaled_dot_product_attention_9
float[batch,77,2560] val_39
float[batch,77,640] val_40
float[batch,77,2560] val_41
float[batch,77,640] val_42
float[batch,77,2560] val_43
float[batch,77,640] val_44
float[batch,77,2560] val_45
float[batch,77,640] val_46
float[batch,77,2560] val_47
float[batch,77,640] val_48
float[batch,77,2560] val_49
float[batch,77,640] val_50
float[batch,77,2560] val_51
float[batch,77,640] val_52
float[batch,77,2560] val_53
float[batch,77,640] val_54
float[batch,77,2560] val_55
float[batch,77,640] val_56
float[batch,77,2560] val_57
float[batch,77,640] val_58
float[batch,77,2560] val_59
float[batch,77,640] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2560] val_63
float[batch,1,640] val_64
float[batch,1,640] val_65
float[batch,640] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x640)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x640)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x640)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x640)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x640)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x640)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x640)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x640)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x640)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x640)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x640)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x640)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x640 INT64[3] 96f437355f6e
ln_final.bias FLOAT[640] 2610f3f13c04
ln_final.weight FLOAT[640] bbc6361978ef
node_scaled_dot_product_attention_10_wo_t FLOAT[640,640] 72957367bc0b
node_scaled_dot_product_attention_11_wo_t FLOAT[640,640] 0ae34099890c
node_scaled_dot_product_attention_1_wo_t FLOAT[640,640] d00ab3994066
node_scaled_dot_product_attention_2_wo_t FLOAT[640,640] 8b1ad4a13581
node_scaled_dot_product_attention_3_wo_t FLOAT[640,640] 4fea02ff4795
node_scaled_dot_product_attention_4_wo_t FLOAT[640,640] a7f301f1d2ea
node_scaled_dot_product_attention_5_wo_t FLOAT[640,640] 45fdb4d4866d
node_scaled_dot_product_attention_6_wo_t FLOAT[640,640] 06a132f50b64
node_scaled_dot_product_attention_7_wo_t FLOAT[640,640] 194a7d77a130
node_scaled_dot_product_attention_8_wo_t FLOAT[640,640] 7ca454100438
node_scaled_dot_product_attention_9_wo_t FLOAT[640,640] 7b400e6f4628
node_scaled_dot_product_attention_wo_t FLOAT[640,640] fdac9343e635
positional_embedding FLOAT[77,640] fa836ed05c50
text_projection FLOAT[640,640] b41e9a00db5e
token_embedding.weight_fp16 FLOAT16[49408,640] e8f205ab41a4
transformer.resblocks.0.attn.in_proj_bias FLOAT[1920] f9f14729a87d
transformer.resblocks.0.attn.out_proj.bias FLOAT[640] b589e7a6c36f
transformer.resblocks.0.ln_1.bias FLOAT[640] 36ad86e9af58
transformer.resblocks.0.ln_1.weight FLOAT[640] 35ee8a6e14f1
transformer.resblocks.0.ln_2.bias FLOAT[640] 6df8e9a66e1c
transformer.resblocks.0.ln_2.weight FLOAT[640] 74d9e8b9fa1f
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2560] 0a521d40b6c7
transformer.resblocks.0.mlp.c_proj.bias FLOAT[640] 18da244a1a9b
transformer.resblocks.1.attn.in_proj_bias FLOAT[1920] 13df81528c3f
transformer.resblocks.1.attn.out_proj.bias FLOAT[640] 002d47959b81
transformer.resblocks.1.ln_1.bias FLOAT[640] 96490d1095d1
transformer.resblocks.1.ln_1.weight FLOAT[640] 8e34c486a7a3
transformer.resblocks.1.ln_2.bias FLOAT[640] c97f36f843f6
transformer.resblocks.1.ln_2.weight FLOAT[640] a44e3fddf7ed
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2560] c77111e1abb7
transformer.resblocks.1.mlp.c_proj.bias FLOAT[640] 2933029d5795
transformer.resblocks.10.attn.in_proj_bias FLOAT[1920] 8babb520d39c
transformer.resblocks.10.attn.out_proj.bias FLOAT[640] aa4e0deff979
transformer.resblocks.10.ln_1.bias FLOAT[640] f27c80fb4fd5
transformer.resblocks.10.ln_1.weight FLOAT[640] 0eb0b4dfe903
transformer.resblocks.10.ln_2.bias FLOAT[640] a08c573253a1
transformer.resblocks.10.ln_2.weight FLOAT[640] 2f16f3af0174
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2560] a7c96eb07f88
transformer.resblocks.10.mlp.c_proj.bias FLOAT[640] 2e6f4f347815
transformer.resblocks.11.attn.in_proj_bias FLOAT[1920] d029d535140d
transformer.resblocks.11.attn.out_proj.bias FLOAT[640] a94f93f3cb88
transformer.resblocks.11.ln_1.bias FLOAT[640] ca93d61bbb69
transformer.resblocks.11.ln_1.weight FLOAT[640] 6ccf48d581af
transformer.resblocks.11.ln_2.bias FLOAT[640] c61c764395c7
transformer.resblocks.11.ln_2.weight FLOAT[640] 8b1d7cb95479
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2560] 4b0efdb97954
transformer.resblocks.11.mlp.c_proj.bias FLOAT[640] a3736b2abc6a
transformer.resblocks.2.attn.in_proj_bias FLOAT[1920] 57bb6c5b8323
transformer.resblocks.2.attn.out_proj.bias FLOAT[640] 92e2a6a3e853
transformer.resblocks.2.ln_1.bias FLOAT[640] 74bfac4ba4dc
transformer.resblocks.2.ln_1.weight FLOAT[640] e6551460898f
transformer.resblocks.2.ln_2.bias FLOAT[640] 08b09b246fb5
transformer.resblocks.2.ln_2.weight FLOAT[640] 3bbdc400a9a0
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2560] 72e6d5bf1495
transformer.resblocks.2.mlp.c_proj.bias FLOAT[640] b669b1b37e48
transformer.resblocks.3.attn.in_proj_bias FLOAT[1920] 533c1c7cab5a
transformer.resblocks.3.attn.out_proj.bias FLOAT[640] b93991f2507b
transformer.resblocks.3.ln_1.bias FLOAT[640] b488b856e7aa
transformer.resblocks.3.ln_1.weight FLOAT[640] acafde77e6e7
transformer.resblocks.3.ln_2.bias FLOAT[640] c91ddbdf332b
transformer.resblocks.3.ln_2.weight FLOAT[640] aa5955413c23
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2560] 1da2cf75902a
transformer.resblocks.3.mlp.c_proj.bias FLOAT[640] 8ea65818597a
transformer.resblocks.4.attn.in_proj_bias FLOAT[1920] 8a39ba9e7924
transformer.resblocks.4.attn.out_proj.bias FLOAT[640] 24d2ae37fb75
transformer.resblocks.4.ln_1.bias FLOAT[640] 87ef355af11d
transformer.resblocks.4.ln_1.weight FLOAT[640] b0322d6d9841
transformer.resblocks.4.ln_2.bias FLOAT[640] e5d5a298615f
transformer.resblocks.4.ln_2.weight FLOAT[640] d809bee4b498
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2560] a44bfae94d69
transformer.resblocks.4.mlp.c_proj.bias FLOAT[640] 7daa0eee2be0
transformer.resblocks.5.attn.in_proj_bias FLOAT[1920] 9a1ad7b29f49
transformer.resblocks.5.attn.out_proj.bias FLOAT[640] a2ee3348d44e
transformer.resblocks.5.ln_1.bias FLOAT[640] 542ab252169f
transformer.resblocks.5.ln_1.weight FLOAT[640] d694a4e8656c
transformer.resblocks.5.ln_2.bias FLOAT[640] b956b6a021d4
transformer.resblocks.5.ln_2.weight FLOAT[640] 80feccecb1aa
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2560] 5146d34ab3a7
transformer.resblocks.5.mlp.c_proj.bias FLOAT[640] 67a75387d2e2
transformer.resblocks.6.attn.in_proj_bias FLOAT[1920] 50d5c41deef0
transformer.resblocks.6.attn.out_proj.bias FLOAT[640] 6b02c111b294
transformer.resblocks.6.ln_1.bias FLOAT[640] ef6e5c152ebd
transformer.resblocks.6.ln_1.weight FLOAT[640] 0413e6a38248
transformer.resblocks.6.ln_2.bias FLOAT[640] 2f15931f4e3b
transformer.resblocks.6.ln_2.weight FLOAT[640] 46513a95b743
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2560] 91f022a478e1
transformer.resblocks.6.mlp.c_proj.bias FLOAT[640] c9f20ca02b8b
transformer.resblocks.7.attn.in_proj_bias FLOAT[1920] d712c8b18a2b
transformer.resblocks.7.attn.out_proj.bias FLOAT[640] f22d9c09352b
transformer.resblocks.7.ln_1.bias FLOAT[640] 04ff81d9b9de
transformer.resblocks.7.ln_1.weight FLOAT[640] 60888aeab76d
transformer.resblocks.7.ln_2.bias FLOAT[640] a13bf3d22da3
transformer.resblocks.7.ln_2.weight FLOAT[640] 65d48358d8f1
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2560] 8e2b6500003b
transformer.resblocks.7.mlp.c_proj.bias FLOAT[640] b1db5d09c688
transformer.resblocks.8.attn.in_proj_bias FLOAT[1920] fe933f7246cb
transformer.resblocks.8.attn.out_proj.bias FLOAT[640] 9f1f34e16825
transformer.resblocks.8.ln_1.bias FLOAT[640] 36a1b4cc4217
transformer.resblocks.8.ln_1.weight FLOAT[640] 3874c0dc0eca
transformer.resblocks.8.ln_2.bias FLOAT[640] ae8ce1c4e525
transformer.resblocks.8.ln_2.weight FLOAT[640] 05ab1c4e51ad
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2560] edd54e1f4a38
transformer.resblocks.8.mlp.c_proj.bias FLOAT[640] 90a2d973abdd
transformer.resblocks.9.attn.in_proj_bias FLOAT[1920] f03083d4d58d
transformer.resblocks.9.attn.out_proj.bias FLOAT[640] 456d6c10ef26
transformer.resblocks.9.ln_1.bias FLOAT[640] be87f78d2b16
transformer.resblocks.9.ln_1.weight FLOAT[640] e51b0cc96b41
transformer.resblocks.9.ln_2.bias FLOAT[640] 68f458c34455
transformer.resblocks.9.ln_2.weight FLOAT[640] 624dfb1b52a2
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2560] e4437cbb550b
transformer.resblocks.9.mlp.c_proj.bias FLOAT[640] 41f4caf6c80b
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2560,640] 36a5936ce6ba
val_11 FLOAT[640,1920] 455e4617f9e3
val_12 FLOAT[640,2560] cbb7c629d8b2
val_13 FLOAT[2560,640] c3e0708e2496
val_14 FLOAT[640,1920] 7639d3683880
val_15 FLOAT[640,2560] f73cab321ca9
val_16 FLOAT[2560,640] f45c14cd32aa
val_17 FLOAT[640,1920] 3ba754ebd2b4
val_18 FLOAT[640,2560] fcbdc30bf353
val_19 FLOAT[2560,640] 051265270a87
val_2 FLOAT[640,1920] 4d884409852d
val_20 FLOAT[640,1920] f0ea42264bd6
val_21 FLOAT[640,2560] 62e98fd54365
val_22 FLOAT[2560,640] 717a394ed3de
val_23 FLOAT[640,1920] 1b19293358be
val_24 FLOAT[640,2560] 9a50acc3a4d0
val_25 FLOAT[2560,640] 6a5b952bbe19
val_26 FLOAT[640,1920] 9aa5bdad9721
val_27 FLOAT[640,2560] bc3ebab62871
val_28 FLOAT[2560,640] 80270659c045
val_29 FLOAT[640,1920] 6c4d62dcd425
val_3 FLOAT[640,2560] 79ba0bf52047
val_30 FLOAT[640,2560] ba4b0a5fd527
val_31 FLOAT[2560,640] f755bbe841e3
val_32 FLOAT[640,1920] d97256bfa0c0
val_33 FLOAT[640,2560] 48b5674790ff
val_34 FLOAT[2560,640] c85544302be5
val_35 FLOAT[640,1920] 8cb80817037a
val_36 FLOAT[640,2560] 887a5e56f897
val_37 FLOAT[2560,640] d3ff8f09820a
val_4 FLOAT[2560,640] c60111dc058e
val_5 FLOAT[640,1920] bd42d4e0e63e
val_6 FLOAT[640,2560] ed19ce4d1bce
val_7 FLOAT[2560,640] d46a866ca596
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[640,1920] 51c38a1f2134
val_9 FLOAT[640,2560] 3b5a9c71979c
@@ -0,0 +1,587 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,240,240,3] image) => (float[batch,640] image_embedding)
<
float[batch,226,896] add_1088
float[batch,226,896] add_1109
float[batch,226,896] add_1224
float[batch,226,896] add_1245
float[batch,226,896] add_136
float[batch,226,896] add_1360
float[batch,226,896] add_1381
float[batch,226,896] add_1496
float[batch,226,896] add_1517
float[batch,1,896] add_1517_pooled
float[batch,226,896] add_157
float[batch,1,896] add_1632
float[batch,1,896] add_1653
float[batch,226,896] add_17
float[batch,226,896] add_272
float[batch,226,896] add_293
float[batch,226,896] add_408
float[batch,226,896] add_429
float[batch,226,896] add_544
float[batch,226,896] add_565
float[batch,226,896] add_680
float[batch,226,896] add_701
float[batch,226,896] add_816
float[batch,226,896] add_837
float[batch,226,896] add_952
float[batch,226,896] add_973
float[batch,1] clamp_min
float[batch,896,15,15] conv2d
float[batch,226,3584] gelu
float[batch,226,3584] gelu_1
float[batch,226,3584] gelu_10
float[batch,1,3584] gelu_11
float[batch,226,3584] gelu_2
float[batch,226,3584] gelu_3
float[batch,226,3584] gelu_4
float[batch,226,3584] gelu_5
float[batch,226,3584] gelu_6
float[batch,226,3584] gelu_7
float[batch,226,3584] gelu_8
float[batch,226,3584] gelu_9
float[batch,3,240,240] image_chw
float[batch,240,240,3] image_f32
float[batch,226,896] layer_norm
float[batch,226,896] layer_norm_1
float[batch,226,896] layer_norm_10
float[batch,226,896] layer_norm_11
float[batch,226,896] layer_norm_12
float[batch,226,896] layer_norm_13
float[batch,226,896] layer_norm_14
float[batch,226,896] layer_norm_15
float[batch,226,896] layer_norm_16
float[batch,226,896] layer_norm_17
float[batch,226,896] layer_norm_18
float[batch,226,896] layer_norm_19
float[batch,226,896] layer_norm_2
float[batch,226,896] layer_norm_20
float[batch,226,896] layer_norm_21
float[batch,226,896] layer_norm_22
float[batch,226,896] layer_norm_23
float[batch,1,896] layer_norm_24
float[batch,226,896] layer_norm_3
float[batch,226,896] layer_norm_4
float[batch,226,896] layer_norm_5
float[batch,226,896] layer_norm_6
float[batch,226,896] layer_norm_7
float[batch,226,896] layer_norm_8
float[batch,226,896] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,226,3584] linear_10
float[batch,226,896] linear_11
float[batch,226,3584] linear_14
float[batch,226,896] linear_15
float[batch,226,3584] linear_18
float[batch,226,896] linear_19
float[batch,226,3584] linear_2
float[batch,226,3584] linear_22
float[batch,226,896] linear_23
float[batch,226,3584] linear_26
float[batch,226,896] linear_27
float[batch,226,896] linear_3
float[batch,226,3584] linear_30
float[batch,226,896] linear_31
float[batch,226,3584] linear_34
float[batch,226,896] linear_35
float[batch,226,3584] linear_38
float[batch,226,896] linear_39
float[batch,226,3584] linear_42
float[batch,226,896] linear_43
float[batch,1,3584] linear_46
float[batch,1,896] linear_47
float[batch,226,3584] linear_6
float[batch,226,896] linear_7
float[batch,640] matmul
float[batch,226,896] node_scaled_dot_product_attention_10_k
float[batch,226,896] node_scaled_dot_product_attention_10_out
float[batch,226,896] node_scaled_dot_product_attention_10_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_10_q
float[batch,226,2688] node_scaled_dot_product_attention_10_qkv
float[batch,226,2688] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_10_v
float[batch,226,896] node_scaled_dot_product_attention_11_k
float[batch,1,896] node_scaled_dot_product_attention_11_out
float[batch,1,896] node_scaled_dot_product_attention_11_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_11_q
float[batch,1,896] node_scaled_dot_product_attention_11_q_pooled
float[batch,226,2688] node_scaled_dot_product_attention_11_qkv
float[batch,226,2688] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_11_v
float[batch,226,896] node_scaled_dot_product_attention_1_k
float[batch,226,896] node_scaled_dot_product_attention_1_out
float[batch,226,896] node_scaled_dot_product_attention_1_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_1_q
float[batch,226,2688] node_scaled_dot_product_attention_1_qkv
float[batch,226,2688] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_1_v
float[batch,226,896] node_scaled_dot_product_attention_2_k
float[batch,226,896] node_scaled_dot_product_attention_2_out
float[batch,226,896] node_scaled_dot_product_attention_2_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_2_q
float[batch,226,2688] node_scaled_dot_product_attention_2_qkv
float[batch,226,2688] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_2_v
float[batch,226,896] node_scaled_dot_product_attention_3_k
float[batch,226,896] node_scaled_dot_product_attention_3_out
float[batch,226,896] node_scaled_dot_product_attention_3_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_3_q
float[batch,226,2688] node_scaled_dot_product_attention_3_qkv
float[batch,226,2688] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_3_v
float[batch,226,896] node_scaled_dot_product_attention_4_k
float[batch,226,896] node_scaled_dot_product_attention_4_out
float[batch,226,896] node_scaled_dot_product_attention_4_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_4_q
float[batch,226,2688] node_scaled_dot_product_attention_4_qkv
float[batch,226,2688] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_4_v
float[batch,226,896] node_scaled_dot_product_attention_5_k
float[batch,226,896] node_scaled_dot_product_attention_5_out
float[batch,226,896] node_scaled_dot_product_attention_5_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_5_q
float[batch,226,2688] node_scaled_dot_product_attention_5_qkv
float[batch,226,2688] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_5_v
float[batch,226,896] node_scaled_dot_product_attention_6_k
float[batch,226,896] node_scaled_dot_product_attention_6_out
float[batch,226,896] node_scaled_dot_product_attention_6_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_6_q
float[batch,226,2688] node_scaled_dot_product_attention_6_qkv
float[batch,226,2688] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_6_v
float[batch,226,896] node_scaled_dot_product_attention_7_k
float[batch,226,896] node_scaled_dot_product_attention_7_out
float[batch,226,896] node_scaled_dot_product_attention_7_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_7_q
float[batch,226,2688] node_scaled_dot_product_attention_7_qkv
float[batch,226,2688] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_7_v
float[batch,226,896] node_scaled_dot_product_attention_8_k
float[batch,226,896] node_scaled_dot_product_attention_8_out
float[batch,226,896] node_scaled_dot_product_attention_8_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_8_q
float[batch,226,2688] node_scaled_dot_product_attention_8_qkv
float[batch,226,2688] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_8_v
float[batch,226,896] node_scaled_dot_product_attention_9_k
float[batch,226,896] node_scaled_dot_product_attention_9_out
float[batch,226,896] node_scaled_dot_product_attention_9_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_9_q
float[batch,226,2688] node_scaled_dot_product_attention_9_qkv
float[batch,226,2688] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_9_v
float[batch,226,896] node_scaled_dot_product_attention_k
float[batch,226,896] node_scaled_dot_product_attention_out
float[batch,226,896] node_scaled_dot_product_attention_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_q
float[batch,226,2688] node_scaled_dot_product_attention_qkv
float[batch,226,2688] node_scaled_dot_product_attention_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_v
float[batch,225,896] permute
float[batch,226,896] scaled_dot_product_attention
float[batch,226,896] scaled_dot_product_attention_1
float[batch,226,896] scaled_dot_product_attention_10
float[batch,1,896] scaled_dot_product_attention_11
float[batch,226,896] scaled_dot_product_attention_2
float[batch,226,896] scaled_dot_product_attention_3
float[batch,226,896] scaled_dot_product_attention_4
float[batch,226,896] scaled_dot_product_attention_5
float[batch,226,896] scaled_dot_product_attention_6
float[batch,226,896] scaled_dot_product_attention_7
float[batch,226,896] scaled_dot_product_attention_8
float[batch,226,896] scaled_dot_product_attention_9
float[batch,896] select_36
float[batch,226,896] val_43
float[batch,226,3584] val_44
float[batch,226,896] val_45
float[batch,226,3584] val_46
float[batch,226,896] val_47
float[batch,226,3584] val_48
float[batch,226,896] val_49
float[batch,226,3584] val_50
float[batch,226,896] val_51
float[batch,226,3584] val_52
float[batch,226,896] val_53
float[batch,226,3584] val_54
float[batch,226,896] val_55
float[batch,226,3584] val_56
float[batch,226,896] val_57
float[batch,226,3584] val_58
float[batch,226,896] val_59
float[batch,226,3584] val_60
float[batch,226,896] val_61
float[batch,226,3584] val_62
float[batch,226,896] val_63
float[batch,226,3584] val_64
float[batch,226,896] val_65
float[batch,1,3584] val_66
float[batch,1,896] val_67
float[batch,896] val_68
float[batch,896,225] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_43 = Pad (permute, val_3, val_4)
add_17 = Add (val_43, val_42)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x896)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_44 = MatMul (layer_norm_2, val_7)
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_45 = MatMul (gelu, val_8)
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_157 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x896)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_46 = MatMul (layer_norm_4, val_10)
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_47 = MatMul (gelu_1, val_11)
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_293 = Add (add_272, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x896)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_48 = MatMul (layer_norm_6, val_13)
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_49 = MatMul (gelu_2, val_14)
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_429 = Add (add_408, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x896)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_50 = MatMul (layer_norm_8, val_16)
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_51 = MatMul (gelu_3, val_17)
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_565 = Add (add_544, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x896)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_52 = MatMul (layer_norm_10, val_19)
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_53 = MatMul (gelu_4, val_20)
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_701 = Add (add_680, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x896)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_54 = MatMul (layer_norm_12, val_22)
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_55 = MatMul (gelu_5, val_23)
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_837 = Add (add_816, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x896)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_56 = MatMul (layer_norm_14, val_25)
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_57 = MatMul (gelu_6, val_26)
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_973 = Add (add_952, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x896)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_58 = MatMul (layer_norm_16, val_28)
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_59 = MatMul (gelu_7, val_29)
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1109 = Add (add_1088, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x896)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_60 = MatMul (layer_norm_18, val_31)
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_61 = MatMul (gelu_8, val_32)
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1245 = Add (add_1224, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x896)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_62 = MatMul (layer_norm_20, val_34)
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_63 = MatMul (gelu_9, val_35)
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1381 = Add (add_1360, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x896)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_64 = MatMul (layer_norm_22, val_37)
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_65 = MatMul (gelu_10, val_38)
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1517 = Add (add_1496, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x896)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_66 = MatMul (layer_norm_24, val_40)
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_67 = MatMul (gelu_11, val_41)
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1653 = Add (add_1632, linear_47)
val_68 = Squeeze (add_1653, val_5)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x896 INT64[3] c54b68efb8ed
node_Conv_704_fused_bias FLOAT[896] 0b4a4a4d0457
node_scaled_dot_product_attention_10_wo_t FLOAT[896,896] 38471dc5da40
node_scaled_dot_product_attention_11_wo_t FLOAT[896,896] 95f23741366f
node_scaled_dot_product_attention_1_wo_t FLOAT[896,896] 0e56f22e61d2
node_scaled_dot_product_attention_2_wo_t FLOAT[896,896] 266c072bf8b0
node_scaled_dot_product_attention_3_wo_t FLOAT[896,896] bb441e213d38
node_scaled_dot_product_attention_4_wo_t FLOAT[896,896] f387c858fa7f
node_scaled_dot_product_attention_5_wo_t FLOAT[896,896] 2f203cf9b9c6
node_scaled_dot_product_attention_6_wo_t FLOAT[896,896] 053dad132062
node_scaled_dot_product_attention_7_wo_t FLOAT[896,896] b2db7c280247
node_scaled_dot_product_attention_8_wo_t FLOAT[896,896] af0f7d60959b
node_scaled_dot_product_attention_9_wo_t FLOAT[896,896] 9f93d3e5d0f7
node_scaled_dot_product_attention_wo_t FLOAT[896,896] b78d19f6f782
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[896,3584] 248581406c0b
val_11 FLOAT[3584,896] de81110b3607
val_12 FLOAT[896,2688] 9f9e80533111
val_13 FLOAT[896,3584] e3f3ce7b66e7
val_14 FLOAT[3584,896] e2168a4872dd
val_15 FLOAT[896,2688] 3a94326c23f7
val_16 FLOAT[896,3584] 23baff851f87
val_17 FLOAT[3584,896] 440141745fd8
val_18 FLOAT[896,2688] 47ea01041414
val_19 FLOAT[896,3584] 29781692c1a1
val_2 INT64[1] af5570f5a181
val_20 FLOAT[3584,896] 29f09890dd1b
val_21 FLOAT[896,2688] 97354b8cd1e9
val_22 FLOAT[896,3584] 87b1b3bb020e
val_23 FLOAT[3584,896] c82398e9247b
val_24 FLOAT[896,2688] db8d42db635c
val_25 FLOAT[896,3584] a7acb006d49c
val_26 FLOAT[3584,896] fc18c3adc99d
val_27 FLOAT[896,2688] f6429414d8f8
val_28 FLOAT[896,3584] 3fd055400b46
val_29 FLOAT[3584,896] 1bd390b362d1
val_3 INT64[6] 6b7d92eaae70
val_30 FLOAT[896,2688] 6c29107a2343
val_31 FLOAT[896,3584] c33545862576
val_32 FLOAT[3584,896] 6f4e4145f0ca
val_33 FLOAT[896,2688] ebf2f31b190a
val_34 FLOAT[896,3584] bb224a8f6e71
val_35 FLOAT[3584,896] e7367b84e057
val_36 FLOAT[896,2688] 89a1e73f996f
val_37 FLOAT[896,3584] 6f2e23582866
val_38 FLOAT[3584,896] aa2832b3604e
val_39 FLOAT[896,2688] f07b5164d1dc
val_4 FLOAT[] df3f619804a9
val_40 FLOAT[896,3584] 26c237dc61f9
val_41 FLOAT[3584,896] d30de49f94d1
val_42 FLOAT[1,226,896] a9523db2f874
val_5 INT64[1] 7c9fa136d441
val_6 FLOAT[896,2688] 0320f81b55b4
val_7 FLOAT[896,3584] 95d346181a2a
val_8 FLOAT[3584,896] 2f0fdb1103ba
val_9 FLOAT[896,2688] f9e97937d478
view_target INT64[3] 326c7d5ef380
visual.conv1.weight FLOAT[896,3,16,16] 2f3d41bdf229
visual.ln_post.bias FLOAT[896] f6890a9d91f0
visual.ln_post.weight FLOAT[896] 88ced05647d0
visual.ln_pre.bias FLOAT[896] 3a7650ae87e1
visual.ln_pre.weight FLOAT[896] 9456bea665eb
visual.proj FLOAT[896,640] b28a05301b9b
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2688] dd7a801f721d
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[896] b187a562ee42
visual.transformer.resblocks.0.ln_1.bias FLOAT[896] 8c3c7eeec1ef
visual.transformer.resblocks.0.ln_1.weight FLOAT[896] f42c8dfb9bf8
visual.transformer.resblocks.0.ln_2.bias FLOAT[896] bd36d9f77524
visual.transformer.resblocks.0.ln_2.weight FLOAT[896] b713eb5de5bc
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3584] 106736387707
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[896] 94957eda322e
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2688] 9de0dabf55f6
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[896] 039cf19ee550
visual.transformer.resblocks.1.ln_1.bias FLOAT[896] bb3796e51512
visual.transformer.resblocks.1.ln_1.weight FLOAT[896] c16746432e4b
visual.transformer.resblocks.1.ln_2.bias FLOAT[896] c654a8aa40c4
visual.transformer.resblocks.1.ln_2.weight FLOAT[896] 12caf18bfe64
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3584] 614fdaaf8224
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[896] c096aee10703
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2688] eff28e02be09
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[896] b37d3720d08c
visual.transformer.resblocks.10.ln_1.bias FLOAT[896] de4aed2da526
visual.transformer.resblocks.10.ln_1.weight FLOAT[896] f8f081e9308a
visual.transformer.resblocks.10.ln_2.bias FLOAT[896] f17542446866
visual.transformer.resblocks.10.ln_2.weight FLOAT[896] 46775f110a30
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3584] c8a41381c8c1
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[896] 01391d94da65
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2688] 3f4a1ef6200f
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[896] d714a4d961c3
visual.transformer.resblocks.11.ln_1.bias FLOAT[896] d6783982246c
visual.transformer.resblocks.11.ln_1.weight FLOAT[896] bb8b1fd35159
visual.transformer.resblocks.11.ln_2.bias FLOAT[896] 68478e511488
visual.transformer.resblocks.11.ln_2.weight FLOAT[896] 8352d13ceac2
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3584] 80a9d0c5c80d
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[896] 4f60498d865b
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2688] cdf1c558c000
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[896] 6e06f0c48f25
visual.transformer.resblocks.2.ln_1.bias FLOAT[896] ff16d0aa18fa
visual.transformer.resblocks.2.ln_1.weight FLOAT[896] a8e062d9ac89
visual.transformer.resblocks.2.ln_2.bias FLOAT[896] bcb6b7e68caf
visual.transformer.resblocks.2.ln_2.weight FLOAT[896] 0210af54f616
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3584] 46e13194b2c3
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[896] 51b8f0cb6395
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2688] 1ba1b7aa3540
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[896] 2a1c7216c213
visual.transformer.resblocks.3.ln_1.bias FLOAT[896] 86e6e973b68d
visual.transformer.resblocks.3.ln_1.weight FLOAT[896] 614f55f1d79c
visual.transformer.resblocks.3.ln_2.bias FLOAT[896] a20dc4eb9ab1
visual.transformer.resblocks.3.ln_2.weight FLOAT[896] 14ea85870246
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3584] d2a91f455b03
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[896] f401987bd6e1
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2688] f80a95ba72b1
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[896] 9d9b3f4f1dc5
visual.transformer.resblocks.4.ln_1.bias FLOAT[896] 96609220ee98
visual.transformer.resblocks.4.ln_1.weight FLOAT[896] 286341938dfe
visual.transformer.resblocks.4.ln_2.bias FLOAT[896] b43d94b33c30
visual.transformer.resblocks.4.ln_2.weight FLOAT[896] d0a4c45a6e70
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3584] af54bcea7cac
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[896] f7cbb710759b
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2688] 056cc5a4e3dc
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[896] 9f4c3004313c
visual.transformer.resblocks.5.ln_1.bias FLOAT[896] 47a286408c0b
visual.transformer.resblocks.5.ln_1.weight FLOAT[896] b4271ea429f8
visual.transformer.resblocks.5.ln_2.bias FLOAT[896] b023f730f600
visual.transformer.resblocks.5.ln_2.weight FLOAT[896] 94ab959facc5
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3584] 6f638dc3c112
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[896] bbcd46e608e5
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2688] 27c833e41361
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[896] 62e936846645
visual.transformer.resblocks.6.ln_1.bias FLOAT[896] ff265a852088
visual.transformer.resblocks.6.ln_1.weight FLOAT[896] 911f4174e323
visual.transformer.resblocks.6.ln_2.bias FLOAT[896] a3f7c02f1828
visual.transformer.resblocks.6.ln_2.weight FLOAT[896] 94736b996f35
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3584] 0e0348d20721
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[896] 23da5bae4df3
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2688] e9db349b9f7b
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[896] e7531a8ee494
visual.transformer.resblocks.7.ln_1.bias FLOAT[896] bd3f3ac49c00
visual.transformer.resblocks.7.ln_1.weight FLOAT[896] 84abf6ace2a4
visual.transformer.resblocks.7.ln_2.bias FLOAT[896] db47542e6487
visual.transformer.resblocks.7.ln_2.weight FLOAT[896] 2dd9b2e94521
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3584] 427a1aaf4027
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[896] 0be3d1ac12e9
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2688] 67e1dd93e387
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[896] 12c1d22243cb
visual.transformer.resblocks.8.ln_1.bias FLOAT[896] ebcb55b6a92a
visual.transformer.resblocks.8.ln_1.weight FLOAT[896] 6263e6f4544e
visual.transformer.resblocks.8.ln_2.bias FLOAT[896] a861d96dfe26
visual.transformer.resblocks.8.ln_2.weight FLOAT[896] 4ed324a851a1
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3584] fd410cc01ce9
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[896] c34e257e0cf3
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2688] 0edd3d33531a
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[896] 4f7c390e25e6
visual.transformer.resblocks.9.ln_1.bias FLOAT[896] b3b477c1d0a3
visual.transformer.resblocks.9.ln_1.weight FLOAT[896] 731f101cc965
visual.transformer.resblocks.9.ln_2.bias FLOAT[896] ee2633f25e13
visual.transformer.resblocks.9.ln_2.weight FLOAT[896] 85839cacbb00
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3584] 2ac7fea36440
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[896] 06a1e1b950d0
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,640] text_embedding)
<
float[batch,77,640] add_1071
float[batch,77,640] add_1092
float[batch,77,640] add_119
float[batch,77,640] add_1207
float[batch,77,640] add_1228
float[batch,77,640] add_1343
float[batch,77,640] add_1364
float[batch,77,640] add_140
float[batch,77,640] add_1479
float[batch,77,640] add_1500
float[batch,1,640] add_1500_pooled
float[batch,1,640] add_1615
float[batch,1,640] add_1636
float[batch,77,640] add_255
float[batch,77,640] add_276
float[batch,77,640] add_391
float[batch,77,640] add_4
float[batch,77,640] add_412
float[batch,77,640] add_527
float[batch,77,640] add_548
float[batch,77,640] add_663
float[batch,77,640] add_684
float[batch,77,640] add_799
float[batch,77,640] add_820
float[batch,77,640] add_935
float[batch,77,640] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,640] embedding
float[batch,77,2560] gelu
float[batch,77,2560] gelu_1
float[batch,77,2560] gelu_10
float[batch,1,2560] gelu_11
float[batch,77,2560] gelu_2
float[batch,77,2560] gelu_3
float[batch,77,2560] gelu_4
float[batch,77,2560] gelu_5
float[batch,77,2560] gelu_6
float[batch,77,2560] gelu_7
float[batch,77,2560] gelu_8
float[batch,77,2560] gelu_9
float[batch,77,640] layer_norm
float[batch,77,640] layer_norm_1
float[batch,77,640] layer_norm_10
float[batch,77,640] layer_norm_11
float[batch,77,640] layer_norm_12
float[batch,77,640] layer_norm_13
float[batch,77,640] layer_norm_14
float[batch,77,640] layer_norm_15
float[batch,77,640] layer_norm_16
float[batch,77,640] layer_norm_17
float[batch,77,640] layer_norm_18
float[batch,77,640] layer_norm_19
float[batch,77,640] layer_norm_2
float[batch,77,640] layer_norm_20
float[batch,77,640] layer_norm_21
float[batch,77,640] layer_norm_22
float[batch,1,640] layer_norm_23
float[batch,77,640] layer_norm_3
float[batch,77,640] layer_norm_4
float[batch,77,640] layer_norm_5
float[batch,77,640] layer_norm_6
float[batch,77,640] layer_norm_7
float[batch,77,640] layer_norm_8
float[batch,77,640] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2560] linear_10
float[batch,77,640] linear_11
float[batch,77,2560] linear_14
float[batch,77,640] linear_15
float[batch,77,2560] linear_18
float[batch,77,640] linear_19
float[batch,77,2560] linear_2
float[batch,77,2560] linear_22
float[batch,77,640] linear_23
float[batch,77,2560] linear_26
float[batch,77,640] linear_27
float[batch,77,640] linear_3
float[batch,77,2560] linear_30
float[batch,77,640] linear_31
float[batch,77,2560] linear_34
float[batch,77,640] linear_35
float[batch,77,2560] linear_38
float[batch,77,640] linear_39
float[batch,77,2560] linear_42
float[batch,77,640] linear_43
float[batch,1,2560] linear_46
float[batch,1,640] linear_47
float[batch,77,2560] linear_6
float[batch,77,640] linear_7
float[batch,640] matmul
float[batch,77,640] node_scaled_dot_product_attention_10_k
float[batch,77,640] node_scaled_dot_product_attention_10_out
float[batch,77,640] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_10_q
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv
float[batch,77,1920] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_10_v
float[batch,77,640] node_scaled_dot_product_attention_11_k
float[batch,1,640] node_scaled_dot_product_attention_11_out
float[batch,1,640] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_11_q
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv
float[batch,77,1920] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_11_v
float[batch,77,640] node_scaled_dot_product_attention_1_k
float[batch,77,640] node_scaled_dot_product_attention_1_out
float[batch,77,640] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_1_q
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv
float[batch,77,1920] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_1_v
float[batch,77,640] node_scaled_dot_product_attention_2_k
float[batch,77,640] node_scaled_dot_product_attention_2_out
float[batch,77,640] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_2_q
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv
float[batch,77,1920] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_2_v
float[batch,77,640] node_scaled_dot_product_attention_3_k
float[batch,77,640] node_scaled_dot_product_attention_3_out
float[batch,77,640] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_3_q
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv
float[batch,77,1920] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_3_v
float[batch,77,640] node_scaled_dot_product_attention_4_k
float[batch,77,640] node_scaled_dot_product_attention_4_out
float[batch,77,640] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_4_q
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv
float[batch,77,1920] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_4_v
float[batch,77,640] node_scaled_dot_product_attention_5_k
float[batch,77,640] node_scaled_dot_product_attention_5_out
float[batch,77,640] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_5_q
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv
float[batch,77,1920] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_5_v
float[batch,77,640] node_scaled_dot_product_attention_6_k
float[batch,77,640] node_scaled_dot_product_attention_6_out
float[batch,77,640] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_6_q
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv
float[batch,77,1920] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_6_v
float[batch,77,640] node_scaled_dot_product_attention_7_k
float[batch,77,640] node_scaled_dot_product_attention_7_out
float[batch,77,640] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_7_q
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv
float[batch,77,1920] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_7_v
float[batch,77,640] node_scaled_dot_product_attention_8_k
float[batch,77,640] node_scaled_dot_product_attention_8_out
float[batch,77,640] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_8_q
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv
float[batch,77,1920] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_8_v
float[batch,77,640] node_scaled_dot_product_attention_9_k
float[batch,77,640] node_scaled_dot_product_attention_9_out
float[batch,77,640] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_9_q
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv
float[batch,77,1920] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_9_v
float[batch,77,640] node_scaled_dot_product_attention_k
float[batch,77,640] node_scaled_dot_product_attention_out
float[batch,77,640] node_scaled_dot_product_attention_out_mm_out
float[batch,77,640] node_scaled_dot_product_attention_q
float[batch,77,1920] node_scaled_dot_product_attention_qkv
float[batch,77,1920] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,640] node_scaled_dot_product_attention_v
float[batch,77,640] scaled_dot_product_attention
float[batch,77,640] scaled_dot_product_attention_1
float[batch,77,640] scaled_dot_product_attention_10
float[batch,77,640] scaled_dot_product_attention_11
float[batch,1,640] scaled_dot_product_attention_11_pooled
float[batch,77,640] scaled_dot_product_attention_2
float[batch,77,640] scaled_dot_product_attention_3
float[batch,77,640] scaled_dot_product_attention_4
float[batch,77,640] scaled_dot_product_attention_5
float[batch,77,640] scaled_dot_product_attention_6
float[batch,77,640] scaled_dot_product_attention_7
float[batch,77,640] scaled_dot_product_attention_8
float[batch,77,640] scaled_dot_product_attention_9
float[batch,77,2560] val_39
float[batch,77,640] val_40
float[batch,77,2560] val_41
float[batch,77,640] val_42
float[batch,77,2560] val_43
float[batch,77,640] val_44
float[batch,77,2560] val_45
float[batch,77,640] val_46
float[batch,77,2560] val_47
float[batch,77,640] val_48
float[batch,77,2560] val_49
float[batch,77,640] val_50
float[batch,77,2560] val_51
float[batch,77,640] val_52
float[batch,77,2560] val_53
float[batch,77,640] val_54
float[batch,77,2560] val_55
float[batch,77,640] val_56
float[batch,77,2560] val_57
float[batch,77,640] val_58
float[batch,77,2560] val_59
float[batch,77,640] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2560] val_63
float[batch,1,640] val_64
float[batch,1,640] val_65
float[batch,640] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x640)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x640)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x640)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x640)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x640)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x640)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x640)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x640)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x640)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x640)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x640)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x640)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 10, q_num_heads: int = 10, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x640 INT64[3] 96f437355f6e
ln_final.bias FLOAT[640] 2610f3f13c04
ln_final.weight FLOAT[640] bbc6361978ef
node_scaled_dot_product_attention_10_wo_t FLOAT[640,640] 72957367bc0b
node_scaled_dot_product_attention_11_wo_t FLOAT[640,640] 0ae34099890c
node_scaled_dot_product_attention_1_wo_t FLOAT[640,640] d00ab3994066
node_scaled_dot_product_attention_2_wo_t FLOAT[640,640] 8b1ad4a13581
node_scaled_dot_product_attention_3_wo_t FLOAT[640,640] 4fea02ff4795
node_scaled_dot_product_attention_4_wo_t FLOAT[640,640] a7f301f1d2ea
node_scaled_dot_product_attention_5_wo_t FLOAT[640,640] 45fdb4d4866d
node_scaled_dot_product_attention_6_wo_t FLOAT[640,640] 06a132f50b64
node_scaled_dot_product_attention_7_wo_t FLOAT[640,640] 194a7d77a130
node_scaled_dot_product_attention_8_wo_t FLOAT[640,640] 7ca454100438
node_scaled_dot_product_attention_9_wo_t FLOAT[640,640] 7b400e6f4628
node_scaled_dot_product_attention_wo_t FLOAT[640,640] fdac9343e635
positional_embedding FLOAT[77,640] fa836ed05c50
text_projection FLOAT[640,640] b41e9a00db5e
token_embedding.weight_fp16 FLOAT16[49408,640] e8f205ab41a4
transformer.resblocks.0.attn.in_proj_bias FLOAT[1920] f9f14729a87d
transformer.resblocks.0.attn.out_proj.bias FLOAT[640] b589e7a6c36f
transformer.resblocks.0.ln_1.bias FLOAT[640] 36ad86e9af58
transformer.resblocks.0.ln_1.weight FLOAT[640] 35ee8a6e14f1
transformer.resblocks.0.ln_2.bias FLOAT[640] 6df8e9a66e1c
transformer.resblocks.0.ln_2.weight FLOAT[640] 74d9e8b9fa1f
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2560] 0a521d40b6c7
transformer.resblocks.0.mlp.c_proj.bias FLOAT[640] 18da244a1a9b
transformer.resblocks.1.attn.in_proj_bias FLOAT[1920] 13df81528c3f
transformer.resblocks.1.attn.out_proj.bias FLOAT[640] 002d47959b81
transformer.resblocks.1.ln_1.bias FLOAT[640] 96490d1095d1
transformer.resblocks.1.ln_1.weight FLOAT[640] 8e34c486a7a3
transformer.resblocks.1.ln_2.bias FLOAT[640] c97f36f843f6
transformer.resblocks.1.ln_2.weight FLOAT[640] a44e3fddf7ed
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2560] c77111e1abb7
transformer.resblocks.1.mlp.c_proj.bias FLOAT[640] 2933029d5795
transformer.resblocks.10.attn.in_proj_bias FLOAT[1920] 8babb520d39c
transformer.resblocks.10.attn.out_proj.bias FLOAT[640] aa4e0deff979
transformer.resblocks.10.ln_1.bias FLOAT[640] f27c80fb4fd5
transformer.resblocks.10.ln_1.weight FLOAT[640] 0eb0b4dfe903
transformer.resblocks.10.ln_2.bias FLOAT[640] a08c573253a1
transformer.resblocks.10.ln_2.weight FLOAT[640] 2f16f3af0174
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2560] a7c96eb07f88
transformer.resblocks.10.mlp.c_proj.bias FLOAT[640] 2e6f4f347815
transformer.resblocks.11.attn.in_proj_bias FLOAT[1920] d029d535140d
transformer.resblocks.11.attn.out_proj.bias FLOAT[640] a94f93f3cb88
transformer.resblocks.11.ln_1.bias FLOAT[640] ca93d61bbb69
transformer.resblocks.11.ln_1.weight FLOAT[640] 6ccf48d581af
transformer.resblocks.11.ln_2.bias FLOAT[640] c61c764395c7
transformer.resblocks.11.ln_2.weight FLOAT[640] 8b1d7cb95479
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2560] 4b0efdb97954
transformer.resblocks.11.mlp.c_proj.bias FLOAT[640] a3736b2abc6a
transformer.resblocks.2.attn.in_proj_bias FLOAT[1920] 57bb6c5b8323
transformer.resblocks.2.attn.out_proj.bias FLOAT[640] 92e2a6a3e853
transformer.resblocks.2.ln_1.bias FLOAT[640] 74bfac4ba4dc
transformer.resblocks.2.ln_1.weight FLOAT[640] e6551460898f
transformer.resblocks.2.ln_2.bias FLOAT[640] 08b09b246fb5
transformer.resblocks.2.ln_2.weight FLOAT[640] 3bbdc400a9a0
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2560] 72e6d5bf1495
transformer.resblocks.2.mlp.c_proj.bias FLOAT[640] b669b1b37e48
transformer.resblocks.3.attn.in_proj_bias FLOAT[1920] 533c1c7cab5a
transformer.resblocks.3.attn.out_proj.bias FLOAT[640] b93991f2507b
transformer.resblocks.3.ln_1.bias FLOAT[640] b488b856e7aa
transformer.resblocks.3.ln_1.weight FLOAT[640] acafde77e6e7
transformer.resblocks.3.ln_2.bias FLOAT[640] c91ddbdf332b
transformer.resblocks.3.ln_2.weight FLOAT[640] aa5955413c23
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2560] 1da2cf75902a
transformer.resblocks.3.mlp.c_proj.bias FLOAT[640] 8ea65818597a
transformer.resblocks.4.attn.in_proj_bias FLOAT[1920] 8a39ba9e7924
transformer.resblocks.4.attn.out_proj.bias FLOAT[640] 24d2ae37fb75
transformer.resblocks.4.ln_1.bias FLOAT[640] 87ef355af11d
transformer.resblocks.4.ln_1.weight FLOAT[640] b0322d6d9841
transformer.resblocks.4.ln_2.bias FLOAT[640] e5d5a298615f
transformer.resblocks.4.ln_2.weight FLOAT[640] d809bee4b498
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2560] a44bfae94d69
transformer.resblocks.4.mlp.c_proj.bias FLOAT[640] 7daa0eee2be0
transformer.resblocks.5.attn.in_proj_bias FLOAT[1920] 9a1ad7b29f49
transformer.resblocks.5.attn.out_proj.bias FLOAT[640] a2ee3348d44e
transformer.resblocks.5.ln_1.bias FLOAT[640] 542ab252169f
transformer.resblocks.5.ln_1.weight FLOAT[640] d694a4e8656c
transformer.resblocks.5.ln_2.bias FLOAT[640] b956b6a021d4
transformer.resblocks.5.ln_2.weight FLOAT[640] 80feccecb1aa
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2560] 5146d34ab3a7
transformer.resblocks.5.mlp.c_proj.bias FLOAT[640] 67a75387d2e2
transformer.resblocks.6.attn.in_proj_bias FLOAT[1920] 50d5c41deef0
transformer.resblocks.6.attn.out_proj.bias FLOAT[640] 6b02c111b294
transformer.resblocks.6.ln_1.bias FLOAT[640] ef6e5c152ebd
transformer.resblocks.6.ln_1.weight FLOAT[640] 0413e6a38248
transformer.resblocks.6.ln_2.bias FLOAT[640] 2f15931f4e3b
transformer.resblocks.6.ln_2.weight FLOAT[640] 46513a95b743
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2560] 91f022a478e1
transformer.resblocks.6.mlp.c_proj.bias FLOAT[640] c9f20ca02b8b
transformer.resblocks.7.attn.in_proj_bias FLOAT[1920] d712c8b18a2b
transformer.resblocks.7.attn.out_proj.bias FLOAT[640] f22d9c09352b
transformer.resblocks.7.ln_1.bias FLOAT[640] 04ff81d9b9de
transformer.resblocks.7.ln_1.weight FLOAT[640] 60888aeab76d
transformer.resblocks.7.ln_2.bias FLOAT[640] a13bf3d22da3
transformer.resblocks.7.ln_2.weight FLOAT[640] 65d48358d8f1
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2560] 8e2b6500003b
transformer.resblocks.7.mlp.c_proj.bias FLOAT[640] b1db5d09c688
transformer.resblocks.8.attn.in_proj_bias FLOAT[1920] fe933f7246cb
transformer.resblocks.8.attn.out_proj.bias FLOAT[640] 9f1f34e16825
transformer.resblocks.8.ln_1.bias FLOAT[640] 36a1b4cc4217
transformer.resblocks.8.ln_1.weight FLOAT[640] 3874c0dc0eca
transformer.resblocks.8.ln_2.bias FLOAT[640] ae8ce1c4e525
transformer.resblocks.8.ln_2.weight FLOAT[640] 05ab1c4e51ad
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2560] edd54e1f4a38
transformer.resblocks.8.mlp.c_proj.bias FLOAT[640] 90a2d973abdd
transformer.resblocks.9.attn.in_proj_bias FLOAT[1920] f03083d4d58d
transformer.resblocks.9.attn.out_proj.bias FLOAT[640] 456d6c10ef26
transformer.resblocks.9.ln_1.bias FLOAT[640] be87f78d2b16
transformer.resblocks.9.ln_1.weight FLOAT[640] e51b0cc96b41
transformer.resblocks.9.ln_2.bias FLOAT[640] 68f458c34455
transformer.resblocks.9.ln_2.weight FLOAT[640] 624dfb1b52a2
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2560] e4437cbb550b
transformer.resblocks.9.mlp.c_proj.bias FLOAT[640] 41f4caf6c80b
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2560,640] 36a5936ce6ba
val_11 FLOAT[640,1920] 455e4617f9e3
val_12 FLOAT[640,2560] cbb7c629d8b2
val_13 FLOAT[2560,640] c3e0708e2496
val_14 FLOAT[640,1920] 7639d3683880
val_15 FLOAT[640,2560] f73cab321ca9
val_16 FLOAT[2560,640] f45c14cd32aa
val_17 FLOAT[640,1920] 3ba754ebd2b4
val_18 FLOAT[640,2560] fcbdc30bf353
val_19 FLOAT[2560,640] 051265270a87
val_2 FLOAT[640,1920] 4d884409852d
val_20 FLOAT[640,1920] f0ea42264bd6
val_21 FLOAT[640,2560] 62e98fd54365
val_22 FLOAT[2560,640] 717a394ed3de
val_23 FLOAT[640,1920] 1b19293358be
val_24 FLOAT[640,2560] 9a50acc3a4d0
val_25 FLOAT[2560,640] 6a5b952bbe19
val_26 FLOAT[640,1920] 9aa5bdad9721
val_27 FLOAT[640,2560] bc3ebab62871
val_28 FLOAT[2560,640] 80270659c045
val_29 FLOAT[640,1920] 6c4d62dcd425
val_3 FLOAT[640,2560] 79ba0bf52047
val_30 FLOAT[640,2560] ba4b0a5fd527
val_31 FLOAT[2560,640] f755bbe841e3
val_32 FLOAT[640,1920] d97256bfa0c0
val_33 FLOAT[640,2560] 48b5674790ff
val_34 FLOAT[2560,640] c85544302be5
val_35 FLOAT[640,1920] 8cb80817037a
val_36 FLOAT[640,2560] 887a5e56f897
val_37 FLOAT[2560,640] d3ff8f09820a
val_4 FLOAT[2560,640] c60111dc058e
val_5 FLOAT[640,1920] bd42d4e0e63e
val_6 FLOAT[640,2560] ed19ce4d1bce
val_7 FLOAT[2560,640] d46a866ca596
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[640,1920] 51c38a1f2134
val_9 FLOAT[640,2560] 3b5a9c71979c
@@ -0,0 +1,587 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,240,240,3] image) => (float[batch,640] image_embedding)
<
float[batch,226,896] add_1088
float[batch,226,896] add_1109
float[batch,226,896] add_1224
float[batch,226,896] add_1245
float[batch,226,896] add_136
float[batch,226,896] add_1360
float[batch,226,896] add_1381
float[batch,226,896] add_1496
float[batch,226,896] add_1517
float[batch,1,896] add_1517_pooled
float[batch,226,896] add_157
float[batch,1,896] add_1632
float[batch,1,896] add_1653
float[batch,226,896] add_17
float[batch,226,896] add_272
float[batch,226,896] add_293
float[batch,226,896] add_408
float[batch,226,896] add_429
float[batch,226,896] add_544
float[batch,226,896] add_565
float[batch,226,896] add_680
float[batch,226,896] add_701
float[batch,226,896] add_816
float[batch,226,896] add_837
float[batch,226,896] add_952
float[batch,226,896] add_973
float[batch,1] clamp_min
float[batch,896,15,15] conv2d
float[batch,226,3584] gelu
float[batch,226,3584] gelu_1
float[batch,226,3584] gelu_10
float[batch,1,3584] gelu_11
float[batch,226,3584] gelu_2
float[batch,226,3584] gelu_3
float[batch,226,3584] gelu_4
float[batch,226,3584] gelu_5
float[batch,226,3584] gelu_6
float[batch,226,3584] gelu_7
float[batch,226,3584] gelu_8
float[batch,226,3584] gelu_9
float[batch,3,240,240] image_chw
float[batch,240,240,3] image_f32
float[batch,226,896] layer_norm
float[batch,226,896] layer_norm_1
float[batch,226,896] layer_norm_10
float[batch,226,896] layer_norm_11
float[batch,226,896] layer_norm_12
float[batch,226,896] layer_norm_13
float[batch,226,896] layer_norm_14
float[batch,226,896] layer_norm_15
float[batch,226,896] layer_norm_16
float[batch,226,896] layer_norm_17
float[batch,226,896] layer_norm_18
float[batch,226,896] layer_norm_19
float[batch,226,896] layer_norm_2
float[batch,226,896] layer_norm_20
float[batch,226,896] layer_norm_21
float[batch,226,896] layer_norm_22
float[batch,226,896] layer_norm_23
float[batch,1,896] layer_norm_24
float[batch,226,896] layer_norm_3
float[batch,226,896] layer_norm_4
float[batch,226,896] layer_norm_5
float[batch,226,896] layer_norm_6
float[batch,226,896] layer_norm_7
float[batch,226,896] layer_norm_8
float[batch,226,896] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,226,3584] linear_10
float[batch,226,896] linear_11
float[batch,226,3584] linear_14
float[batch,226,896] linear_15
float[batch,226,3584] linear_18
float[batch,226,896] linear_19
float[batch,226,3584] linear_2
float[batch,226,3584] linear_22
float[batch,226,896] linear_23
float[batch,226,3584] linear_26
float[batch,226,896] linear_27
float[batch,226,896] linear_3
float[batch,226,3584] linear_30
float[batch,226,896] linear_31
float[batch,226,3584] linear_34
float[batch,226,896] linear_35
float[batch,226,3584] linear_38
float[batch,226,896] linear_39
float[batch,226,3584] linear_42
float[batch,226,896] linear_43
float[batch,1,3584] linear_46
float[batch,1,896] linear_47
float[batch,226,3584] linear_6
float[batch,226,896] linear_7
float[batch,640] matmul
float[batch,226,896] node_scaled_dot_product_attention_10_k
float[batch,226,896] node_scaled_dot_product_attention_10_out
float[batch,226,896] node_scaled_dot_product_attention_10_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_10_q
float[batch,226,2688] node_scaled_dot_product_attention_10_qkv
float[batch,226,2688] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_10_v
float[batch,226,896] node_scaled_dot_product_attention_11_k
float[batch,1,896] node_scaled_dot_product_attention_11_out
float[batch,1,896] node_scaled_dot_product_attention_11_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_11_q
float[batch,1,896] node_scaled_dot_product_attention_11_q_pooled
float[batch,226,2688] node_scaled_dot_product_attention_11_qkv
float[batch,226,2688] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_11_v
float[batch,226,896] node_scaled_dot_product_attention_1_k
float[batch,226,896] node_scaled_dot_product_attention_1_out
float[batch,226,896] node_scaled_dot_product_attention_1_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_1_q
float[batch,226,2688] node_scaled_dot_product_attention_1_qkv
float[batch,226,2688] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_1_v
float[batch,226,896] node_scaled_dot_product_attention_2_k
float[batch,226,896] node_scaled_dot_product_attention_2_out
float[batch,226,896] node_scaled_dot_product_attention_2_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_2_q
float[batch,226,2688] node_scaled_dot_product_attention_2_qkv
float[batch,226,2688] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_2_v
float[batch,226,896] node_scaled_dot_product_attention_3_k
float[batch,226,896] node_scaled_dot_product_attention_3_out
float[batch,226,896] node_scaled_dot_product_attention_3_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_3_q
float[batch,226,2688] node_scaled_dot_product_attention_3_qkv
float[batch,226,2688] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_3_v
float[batch,226,896] node_scaled_dot_product_attention_4_k
float[batch,226,896] node_scaled_dot_product_attention_4_out
float[batch,226,896] node_scaled_dot_product_attention_4_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_4_q
float[batch,226,2688] node_scaled_dot_product_attention_4_qkv
float[batch,226,2688] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_4_v
float[batch,226,896] node_scaled_dot_product_attention_5_k
float[batch,226,896] node_scaled_dot_product_attention_5_out
float[batch,226,896] node_scaled_dot_product_attention_5_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_5_q
float[batch,226,2688] node_scaled_dot_product_attention_5_qkv
float[batch,226,2688] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_5_v
float[batch,226,896] node_scaled_dot_product_attention_6_k
float[batch,226,896] node_scaled_dot_product_attention_6_out
float[batch,226,896] node_scaled_dot_product_attention_6_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_6_q
float[batch,226,2688] node_scaled_dot_product_attention_6_qkv
float[batch,226,2688] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_6_v
float[batch,226,896] node_scaled_dot_product_attention_7_k
float[batch,226,896] node_scaled_dot_product_attention_7_out
float[batch,226,896] node_scaled_dot_product_attention_7_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_7_q
float[batch,226,2688] node_scaled_dot_product_attention_7_qkv
float[batch,226,2688] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_7_v
float[batch,226,896] node_scaled_dot_product_attention_8_k
float[batch,226,896] node_scaled_dot_product_attention_8_out
float[batch,226,896] node_scaled_dot_product_attention_8_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_8_q
float[batch,226,2688] node_scaled_dot_product_attention_8_qkv
float[batch,226,2688] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_8_v
float[batch,226,896] node_scaled_dot_product_attention_9_k
float[batch,226,896] node_scaled_dot_product_attention_9_out
float[batch,226,896] node_scaled_dot_product_attention_9_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_9_q
float[batch,226,2688] node_scaled_dot_product_attention_9_qkv
float[batch,226,2688] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_9_v
float[batch,226,896] node_scaled_dot_product_attention_k
float[batch,226,896] node_scaled_dot_product_attention_out
float[batch,226,896] node_scaled_dot_product_attention_out_mm_out
float[batch,226,896] node_scaled_dot_product_attention_q
float[batch,226,2688] node_scaled_dot_product_attention_qkv
float[batch,226,2688] node_scaled_dot_product_attention_qkv_mm_out
float[batch,226,896] node_scaled_dot_product_attention_v
float[batch,225,896] permute
float[batch,226,896] scaled_dot_product_attention
float[batch,226,896] scaled_dot_product_attention_1
float[batch,226,896] scaled_dot_product_attention_10
float[batch,1,896] scaled_dot_product_attention_11
float[batch,226,896] scaled_dot_product_attention_2
float[batch,226,896] scaled_dot_product_attention_3
float[batch,226,896] scaled_dot_product_attention_4
float[batch,226,896] scaled_dot_product_attention_5
float[batch,226,896] scaled_dot_product_attention_6
float[batch,226,896] scaled_dot_product_attention_7
float[batch,226,896] scaled_dot_product_attention_8
float[batch,226,896] scaled_dot_product_attention_9
float[batch,896] select_36
float[batch,226,896] val_43
float[batch,226,3584] val_44
float[batch,226,896] val_45
float[batch,226,3584] val_46
float[batch,226,896] val_47
float[batch,226,3584] val_48
float[batch,226,896] val_49
float[batch,226,3584] val_50
float[batch,226,896] val_51
float[batch,226,3584] val_52
float[batch,226,896] val_53
float[batch,226,3584] val_54
float[batch,226,896] val_55
float[batch,226,3584] val_56
float[batch,226,896] val_57
float[batch,226,3584] val_58
float[batch,226,896] val_59
float[batch,226,3584] val_60
float[batch,226,896] val_61
float[batch,226,3584] val_62
float[batch,226,896] val_63
float[batch,226,3584] val_64
float[batch,226,896] val_65
float[batch,1,3584] val_66
float[batch,1,896] val_67
float[batch,896] val_68
float[batch,896,225] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_43 = Pad (permute, val_3, val_4)
add_17 = Add (val_43, val_42)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x896)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_44 = MatMul (layer_norm_2, val_7)
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_45 = MatMul (gelu, val_8)
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_157 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x896)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_46 = MatMul (layer_norm_4, val_10)
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_47 = MatMul (gelu_1, val_11)
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_293 = Add (add_272, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x896)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_48 = MatMul (layer_norm_6, val_13)
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_49 = MatMul (gelu_2, val_14)
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_429 = Add (add_408, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x896)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_50 = MatMul (layer_norm_8, val_16)
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_51 = MatMul (gelu_3, val_17)
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_565 = Add (add_544, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x896)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_52 = MatMul (layer_norm_10, val_19)
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_53 = MatMul (gelu_4, val_20)
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_701 = Add (add_680, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x896)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_54 = MatMul (layer_norm_12, val_22)
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_55 = MatMul (gelu_5, val_23)
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_837 = Add (add_816, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x896)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_56 = MatMul (layer_norm_14, val_25)
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_57 = MatMul (gelu_6, val_26)
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_973 = Add (add_952, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x896)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_58 = MatMul (layer_norm_16, val_28)
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_59 = MatMul (gelu_7, val_29)
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1109 = Add (add_1088, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x896)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_60 = MatMul (layer_norm_18, val_31)
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_61 = MatMul (gelu_8, val_32)
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1245 = Add (add_1224, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x896)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_62 = MatMul (layer_norm_20, val_34)
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_63 = MatMul (gelu_9, val_35)
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1381 = Add (add_1360, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x896)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_64 = MatMul (layer_norm_22, val_37)
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_65 = MatMul (gelu_10, val_38)
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1517 = Add (add_1496, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x896)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 14, q_num_heads: int = 14, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_66 = MatMul (layer_norm_24, val_40)
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_67 = MatMul (gelu_11, val_41)
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1653 = Add (add_1632, linear_47)
val_68 = Squeeze (add_1653, val_5)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x896 INT64[3] c54b68efb8ed
node_Conv_704_fused_bias FLOAT[896] 0b4a4a4d0457
node_scaled_dot_product_attention_10_wo_t FLOAT[896,896] 38471dc5da40
node_scaled_dot_product_attention_11_wo_t FLOAT[896,896] 95f23741366f
node_scaled_dot_product_attention_1_wo_t FLOAT[896,896] 0e56f22e61d2
node_scaled_dot_product_attention_2_wo_t FLOAT[896,896] 266c072bf8b0
node_scaled_dot_product_attention_3_wo_t FLOAT[896,896] bb441e213d38
node_scaled_dot_product_attention_4_wo_t FLOAT[896,896] f387c858fa7f
node_scaled_dot_product_attention_5_wo_t FLOAT[896,896] 2f203cf9b9c6
node_scaled_dot_product_attention_6_wo_t FLOAT[896,896] 053dad132062
node_scaled_dot_product_attention_7_wo_t FLOAT[896,896] b2db7c280247
node_scaled_dot_product_attention_8_wo_t FLOAT[896,896] af0f7d60959b
node_scaled_dot_product_attention_9_wo_t FLOAT[896,896] 9f93d3e5d0f7
node_scaled_dot_product_attention_wo_t FLOAT[896,896] b78d19f6f782
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[896,3584] 248581406c0b
val_11 FLOAT[3584,896] de81110b3607
val_12 FLOAT[896,2688] 9f9e80533111
val_13 FLOAT[896,3584] e3f3ce7b66e7
val_14 FLOAT[3584,896] e2168a4872dd
val_15 FLOAT[896,2688] 3a94326c23f7
val_16 FLOAT[896,3584] 23baff851f87
val_17 FLOAT[3584,896] 440141745fd8
val_18 FLOAT[896,2688] 47ea01041414
val_19 FLOAT[896,3584] 29781692c1a1
val_2 INT64[1] af5570f5a181
val_20 FLOAT[3584,896] 29f09890dd1b
val_21 FLOAT[896,2688] 97354b8cd1e9
val_22 FLOAT[896,3584] 87b1b3bb020e
val_23 FLOAT[3584,896] c82398e9247b
val_24 FLOAT[896,2688] db8d42db635c
val_25 FLOAT[896,3584] a7acb006d49c
val_26 FLOAT[3584,896] fc18c3adc99d
val_27 FLOAT[896,2688] f6429414d8f8
val_28 FLOAT[896,3584] 3fd055400b46
val_29 FLOAT[3584,896] 1bd390b362d1
val_3 INT64[6] 6b7d92eaae70
val_30 FLOAT[896,2688] 6c29107a2343
val_31 FLOAT[896,3584] c33545862576
val_32 FLOAT[3584,896] 6f4e4145f0ca
val_33 FLOAT[896,2688] ebf2f31b190a
val_34 FLOAT[896,3584] bb224a8f6e71
val_35 FLOAT[3584,896] e7367b84e057
val_36 FLOAT[896,2688] 89a1e73f996f
val_37 FLOAT[896,3584] 6f2e23582866
val_38 FLOAT[3584,896] aa2832b3604e
val_39 FLOAT[896,2688] f07b5164d1dc
val_4 FLOAT[] df3f619804a9
val_40 FLOAT[896,3584] 26c237dc61f9
val_41 FLOAT[3584,896] d30de49f94d1
val_42 FLOAT[1,226,896] a9523db2f874
val_5 INT64[1] 7c9fa136d441
val_6 FLOAT[896,2688] 0320f81b55b4
val_7 FLOAT[896,3584] 95d346181a2a
val_8 FLOAT[3584,896] 2f0fdb1103ba
val_9 FLOAT[896,2688] f9e97937d478
view_target INT64[3] 326c7d5ef380
visual.conv1.weight FLOAT[896,3,16,16] 2f3d41bdf229
visual.ln_post.bias FLOAT[896] f6890a9d91f0
visual.ln_post.weight FLOAT[896] 88ced05647d0
visual.ln_pre.bias FLOAT[896] 3a7650ae87e1
visual.ln_pre.weight FLOAT[896] 9456bea665eb
visual.proj FLOAT[896,640] b28a05301b9b
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2688] dd7a801f721d
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[896] b187a562ee42
visual.transformer.resblocks.0.ln_1.bias FLOAT[896] 8c3c7eeec1ef
visual.transformer.resblocks.0.ln_1.weight FLOAT[896] f42c8dfb9bf8
visual.transformer.resblocks.0.ln_2.bias FLOAT[896] bd36d9f77524
visual.transformer.resblocks.0.ln_2.weight FLOAT[896] b713eb5de5bc
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3584] 106736387707
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[896] 94957eda322e
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2688] 9de0dabf55f6
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[896] 039cf19ee550
visual.transformer.resblocks.1.ln_1.bias FLOAT[896] bb3796e51512
visual.transformer.resblocks.1.ln_1.weight FLOAT[896] c16746432e4b
visual.transformer.resblocks.1.ln_2.bias FLOAT[896] c654a8aa40c4
visual.transformer.resblocks.1.ln_2.weight FLOAT[896] 12caf18bfe64
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3584] 614fdaaf8224
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[896] c096aee10703
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2688] eff28e02be09
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[896] b37d3720d08c
visual.transformer.resblocks.10.ln_1.bias FLOAT[896] de4aed2da526
visual.transformer.resblocks.10.ln_1.weight FLOAT[896] f8f081e9308a
visual.transformer.resblocks.10.ln_2.bias FLOAT[896] f17542446866
visual.transformer.resblocks.10.ln_2.weight FLOAT[896] 46775f110a30
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3584] c8a41381c8c1
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[896] 01391d94da65
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2688] 3f4a1ef6200f
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[896] d714a4d961c3
visual.transformer.resblocks.11.ln_1.bias FLOAT[896] d6783982246c
visual.transformer.resblocks.11.ln_1.weight FLOAT[896] bb8b1fd35159
visual.transformer.resblocks.11.ln_2.bias FLOAT[896] 68478e511488
visual.transformer.resblocks.11.ln_2.weight FLOAT[896] 8352d13ceac2
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3584] 80a9d0c5c80d
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[896] 4f60498d865b
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2688] cdf1c558c000
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[896] 6e06f0c48f25
visual.transformer.resblocks.2.ln_1.bias FLOAT[896] ff16d0aa18fa
visual.transformer.resblocks.2.ln_1.weight FLOAT[896] a8e062d9ac89
visual.transformer.resblocks.2.ln_2.bias FLOAT[896] bcb6b7e68caf
visual.transformer.resblocks.2.ln_2.weight FLOAT[896] 0210af54f616
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3584] 46e13194b2c3
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[896] 51b8f0cb6395
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2688] 1ba1b7aa3540
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[896] 2a1c7216c213
visual.transformer.resblocks.3.ln_1.bias FLOAT[896] 86e6e973b68d
visual.transformer.resblocks.3.ln_1.weight FLOAT[896] 614f55f1d79c
visual.transformer.resblocks.3.ln_2.bias FLOAT[896] a20dc4eb9ab1
visual.transformer.resblocks.3.ln_2.weight FLOAT[896] 14ea85870246
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3584] d2a91f455b03
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[896] f401987bd6e1
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2688] f80a95ba72b1
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[896] 9d9b3f4f1dc5
visual.transformer.resblocks.4.ln_1.bias FLOAT[896] 96609220ee98
visual.transformer.resblocks.4.ln_1.weight FLOAT[896] 286341938dfe
visual.transformer.resblocks.4.ln_2.bias FLOAT[896] b43d94b33c30
visual.transformer.resblocks.4.ln_2.weight FLOAT[896] d0a4c45a6e70
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3584] af54bcea7cac
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[896] f7cbb710759b
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2688] 056cc5a4e3dc
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[896] 9f4c3004313c
visual.transformer.resblocks.5.ln_1.bias FLOAT[896] 47a286408c0b
visual.transformer.resblocks.5.ln_1.weight FLOAT[896] b4271ea429f8
visual.transformer.resblocks.5.ln_2.bias FLOAT[896] b023f730f600
visual.transformer.resblocks.5.ln_2.weight FLOAT[896] 94ab959facc5
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3584] 6f638dc3c112
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[896] bbcd46e608e5
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2688] 27c833e41361
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[896] 62e936846645
visual.transformer.resblocks.6.ln_1.bias FLOAT[896] ff265a852088
visual.transformer.resblocks.6.ln_1.weight FLOAT[896] 911f4174e323
visual.transformer.resblocks.6.ln_2.bias FLOAT[896] a3f7c02f1828
visual.transformer.resblocks.6.ln_2.weight FLOAT[896] 94736b996f35
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3584] 0e0348d20721
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[896] 23da5bae4df3
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2688] e9db349b9f7b
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[896] e7531a8ee494
visual.transformer.resblocks.7.ln_1.bias FLOAT[896] bd3f3ac49c00
visual.transformer.resblocks.7.ln_1.weight FLOAT[896] 84abf6ace2a4
visual.transformer.resblocks.7.ln_2.bias FLOAT[896] db47542e6487
visual.transformer.resblocks.7.ln_2.weight FLOAT[896] 2dd9b2e94521
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3584] 427a1aaf4027
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[896] 0be3d1ac12e9
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2688] 67e1dd93e387
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[896] 12c1d22243cb
visual.transformer.resblocks.8.ln_1.bias FLOAT[896] ebcb55b6a92a
visual.transformer.resblocks.8.ln_1.weight FLOAT[896] 6263e6f4544e
visual.transformer.resblocks.8.ln_2.bias FLOAT[896] a861d96dfe26
visual.transformer.resblocks.8.ln_2.weight FLOAT[896] 4ed324a851a1
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3584] fd410cc01ce9
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[896] c34e257e0cf3
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2688] 0edd3d33531a
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[896] 4f7c390e25e6
visual.transformer.resblocks.9.ln_1.bias FLOAT[896] b3b477c1d0a3
visual.transformer.resblocks.9.ln_1.weight FLOAT[896] 731f101cc965
visual.transformer.resblocks.9.ln_2.bias FLOAT[896] ee2633f25e13
visual.transformer.resblocks.9.ln_2.weight FLOAT[896] 85839cacbb00
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3584] 2ac7fea36440
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[896] 06a1e1b950d0
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,512] add_1071
float[batch,77,512] add_1092
float[batch,77,512] add_119
float[batch,77,512] add_1207
float[batch,77,512] add_1228
float[batch,77,512] add_1343
float[batch,77,512] add_1364
float[batch,77,512] add_140
float[batch,77,512] add_1479
float[batch,77,512] add_1500
float[batch,1,512] add_1500_pooled
float[batch,1,512] add_1615
float[batch,1,512] add_1636
float[batch,77,512] add_255
float[batch,77,512] add_276
float[batch,77,512] add_391
float[batch,77,512] add_4
float[batch,77,512] add_412
float[batch,77,512] add_527
float[batch,77,512] add_548
float[batch,77,512] add_663
float[batch,77,512] add_684
float[batch,77,512] add_799
float[batch,77,512] add_820
float[batch,77,512] add_935
float[batch,77,512] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,2048] gelu
float[batch,77,2048] gelu_1
float[batch,77,2048] gelu_10
float[batch,1,2048] gelu_11
float[batch,77,2048] gelu_2
float[batch,77,2048] gelu_3
float[batch,77,2048] gelu_4
float[batch,77,2048] gelu_5
float[batch,77,2048] gelu_6
float[batch,77,2048] gelu_7
float[batch,77,2048] gelu_8
float[batch,77,2048] gelu_9
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,512] matmul
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] val_39
float[batch,77,512] val_40
float[batch,77,2048] val_41
float[batch,77,512] val_42
float[batch,77,2048] val_43
float[batch,77,512] val_44
float[batch,77,2048] val_45
float[batch,77,512] val_46
float[batch,77,2048] val_47
float[batch,77,512] val_48
float[batch,77,2048] val_49
float[batch,77,512] val_50
float[batch,77,2048] val_51
float[batch,77,512] val_52
float[batch,77,2048] val_53
float[batch,77,512] val_54
float[batch,77,2048] val_55
float[batch,77,512] val_56
float[batch,77,2048] val_57
float[batch,77,512] val_58
float[batch,77,2048] val_59
float[batch,77,512] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2048] val_63
float[batch,1,512] val_64
float[batch,1,512] val_65
float[batch,512] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] 57b7b7880e3e
ln_final.weight FLOAT[512] 6be5899856c8
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] bb295319b806
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 77cb69e9cca0
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 600ac2cdd837
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 0ebfafc50906
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 7a4f37791535
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 87034196b49a
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 1336235b89f2
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] ddc77000f87d
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 361be7e0bbd8
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 85a233ff6b1f
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 5fba72dbe8e9
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 9b0f92cb0847
positional_embedding FLOAT[77,512] 4fc6e1b8a86c
text_projection FLOAT[512,512] 0a0c1688d0a3
token_embedding.weight_fp16 FLOAT16[49408,512] 6f7a56cf4748
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 8a3fd1b6e4de
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] c4b2eab5e286
transformer.resblocks.0.ln_1.bias FLOAT[512] af30401c4f3a
transformer.resblocks.0.ln_1.weight FLOAT[512] d5450b8b2a96
transformer.resblocks.0.ln_2.bias FLOAT[512] ba730b2fdd81
transformer.resblocks.0.ln_2.weight FLOAT[512] 273da9666bbe
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 235e0da514e4
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 37c9ed0b3b7e
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 7d6dcfb9424f
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 63c19e5e3e28
transformer.resblocks.1.ln_1.bias FLOAT[512] 2ef6aa8a347e
transformer.resblocks.1.ln_1.weight FLOAT[512] b177edd06816
transformer.resblocks.1.ln_2.bias FLOAT[512] f7110a1db2a0
transformer.resblocks.1.ln_2.weight FLOAT[512] 4ad79c155cf2
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] cba9083463c9
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] 2966a89addd0
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 9d3d9094ef17
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 81b72f8cb3c1
transformer.resblocks.10.ln_1.bias FLOAT[512] 3b0a13c54fe9
transformer.resblocks.10.ln_1.weight FLOAT[512] 5b2e35097565
transformer.resblocks.10.ln_2.bias FLOAT[512] f924ea302a8a
transformer.resblocks.10.ln_2.weight FLOAT[512] 4bb3e4682db3
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 6188cc24160b
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] e0e7f4c4b121
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] be74157d03a0
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] f79768cbc5bb
transformer.resblocks.11.ln_1.bias FLOAT[512] ab77e11d9285
transformer.resblocks.11.ln_1.weight FLOAT[512] 4b8d7c7418e2
transformer.resblocks.11.ln_2.bias FLOAT[512] 9ababa02d7cb
transformer.resblocks.11.ln_2.weight FLOAT[512] 172bb6ca50e6
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] 5d3b122729b5
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 2cc6a713a015
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 2df3e307db1b
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 8db0079cde99
transformer.resblocks.2.ln_1.bias FLOAT[512] 7c1e6f063e4f
transformer.resblocks.2.ln_1.weight FLOAT[512] dfe82b4534a5
transformer.resblocks.2.ln_2.bias FLOAT[512] c406071eaf79
transformer.resblocks.2.ln_2.weight FLOAT[512] 33b4d070d91c
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] c03baf7f1e0f
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] de807400a9e8
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 5cec951191fd
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 2ca1e0f0aa39
transformer.resblocks.3.ln_1.bias FLOAT[512] 81e18bf2dbbf
transformer.resblocks.3.ln_1.weight FLOAT[512] e9ecec06a679
transformer.resblocks.3.ln_2.bias FLOAT[512] ae2e5e3c6d23
transformer.resblocks.3.ln_2.weight FLOAT[512] 679f1a56427f
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] cbc6fafe31cf
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 85880d49b9a4
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] 33b4ac929f71
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] dfd97c83afc4
transformer.resblocks.4.ln_1.bias FLOAT[512] 46854389c16f
transformer.resblocks.4.ln_1.weight FLOAT[512] effd64147033
transformer.resblocks.4.ln_2.bias FLOAT[512] d4c0e87afca3
transformer.resblocks.4.ln_2.weight FLOAT[512] 4456e45d3153
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 9b12224de8c0
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 6eed4a25897b
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 4aba65e6fdf7
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] aac5f453d1f2
transformer.resblocks.5.ln_1.bias FLOAT[512] 8af57a7449a7
transformer.resblocks.5.ln_1.weight FLOAT[512] 32e1ebe57b16
transformer.resblocks.5.ln_2.bias FLOAT[512] a3123da682aa
transformer.resblocks.5.ln_2.weight FLOAT[512] 4c119e49a46f
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 60e82febd943
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] c8f845cb2937
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 7958a8701a3a
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] beb2b8f8306d
transformer.resblocks.6.ln_1.bias FLOAT[512] 07166c751f07
transformer.resblocks.6.ln_1.weight FLOAT[512] 5bd22b5d7311
transformer.resblocks.6.ln_2.bias FLOAT[512] ad62c8c17352
transformer.resblocks.6.ln_2.weight FLOAT[512] 09e4616c9640
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 85988f6aa307
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 07d9753905c2
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] b76aa0619aac
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 385b6cf2192f
transformer.resblocks.7.ln_1.bias FLOAT[512] 0774c88f8c96
transformer.resblocks.7.ln_1.weight FLOAT[512] f513e5b2f0a4
transformer.resblocks.7.ln_2.bias FLOAT[512] 65efe8aa07f4
transformer.resblocks.7.ln_2.weight FLOAT[512] e14f04bab200
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 4f506fe6dda4
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 620e36ae93ab
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] f51723a7ca75
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] ca4eee76c343
transformer.resblocks.8.ln_1.bias FLOAT[512] c1d492dccfb8
transformer.resblocks.8.ln_1.weight FLOAT[512] fcd637a5063f
transformer.resblocks.8.ln_2.bias FLOAT[512] 8a097a0f8d96
transformer.resblocks.8.ln_2.weight FLOAT[512] cf06b593d1fd
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 952b6a7da1d6
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 47dbf88ef6b0
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 0f6b85e610ae
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 5c7ca5675481
transformer.resblocks.9.ln_1.bias FLOAT[512] 0fd4752bab77
transformer.resblocks.9.ln_1.weight FLOAT[512] 61333e15e088
transformer.resblocks.9.ln_2.bias FLOAT[512] 36d161d8954a
transformer.resblocks.9.ln_2.weight FLOAT[512] b4648bde250a
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] e971ff0cc7a5
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] c9481e919fe8
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2048,512] a020d9f80d42
val_11 FLOAT[512,1536] aff5491b6177
val_12 FLOAT[512,2048] f7f0ade087f9
val_13 FLOAT[2048,512] 60f127f8995e
val_14 FLOAT[512,1536] 0ab00941825d
val_15 FLOAT[512,2048] c07cefa32652
val_16 FLOAT[2048,512] 0c18d0a557d9
val_17 FLOAT[512,1536] 905996733d10
val_18 FLOAT[512,2048] 58f4bc2d059a
val_19 FLOAT[2048,512] 1c6b5349fe59
val_2 FLOAT[512,1536] 5057132df526
val_20 FLOAT[512,1536] c855c443eee3
val_21 FLOAT[512,2048] a013ba1deb3f
val_22 FLOAT[2048,512] d58f3218d49b
val_23 FLOAT[512,1536] 9151d966023a
val_24 FLOAT[512,2048] 874ab947acf8
val_25 FLOAT[2048,512] d1034e4bec66
val_26 FLOAT[512,1536] 526b8c88cab7
val_27 FLOAT[512,2048] cdc7d5195eca
val_28 FLOAT[2048,512] f53e5bb86f8e
val_29 FLOAT[512,1536] 9c8ca4998c04
val_3 FLOAT[512,2048] 677b664b6415
val_30 FLOAT[512,2048] 23e64009fdc8
val_31 FLOAT[2048,512] 13d832fa59e1
val_32 FLOAT[512,1536] 41500a170e15
val_33 FLOAT[512,2048] 541bd8307a6c
val_34 FLOAT[2048,512] 0e0788078ae6
val_35 FLOAT[512,1536] 1ef23f2cd973
val_36 FLOAT[512,2048] b00570195ab0
val_37 FLOAT[2048,512] 4ab3fa06af91
val_4 FLOAT[2048,512] 27e056cd45b7
val_5 FLOAT[512,1536] 660ed51cf707
val_6 FLOAT[512,2048] d9b851d1318b
val_7 FLOAT[2048,512] ffd994dfb3d9
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[512,1536] 6dee5e196a92
val_9 FLOAT[512,2048] 54a547210b53
@@ -0,0 +1,587 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,197,768] add_1088
float[batch,197,768] add_1109
float[batch,197,768] add_1224
float[batch,197,768] add_1245
float[batch,197,768] add_136
float[batch,197,768] add_1360
float[batch,197,768] add_1381
float[batch,197,768] add_1496
float[batch,197,768] add_1517
float[batch,1,768] add_1517_pooled
float[batch,197,768] add_157
float[batch,1,768] add_1632
float[batch,1,768] add_1653
float[batch,197,768] add_17
float[batch,197,768] add_272
float[batch,197,768] add_293
float[batch,197,768] add_408
float[batch,197,768] add_429
float[batch,197,768] add_544
float[batch,197,768] add_565
float[batch,197,768] add_680
float[batch,197,768] add_701
float[batch,197,768] add_816
float[batch,197,768] add_837
float[batch,197,768] add_952
float[batch,197,768] add_973
float[batch,1] clamp_min
float[batch,768,14,14] conv2d
float[batch,197,3072] gelu
float[batch,197,3072] gelu_1
float[batch,197,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,197,3072] gelu_2
float[batch,197,3072] gelu_3
float[batch,197,3072] gelu_4
float[batch,197,3072] gelu_5
float[batch,197,3072] gelu_6
float[batch,197,3072] gelu_7
float[batch,197,3072] gelu_8
float[batch,197,3072] gelu_9
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,197,768] layer_norm
float[batch,197,768] layer_norm_1
float[batch,197,768] layer_norm_10
float[batch,197,768] layer_norm_11
float[batch,197,768] layer_norm_12
float[batch,197,768] layer_norm_13
float[batch,197,768] layer_norm_14
float[batch,197,768] layer_norm_15
float[batch,197,768] layer_norm_16
float[batch,197,768] layer_norm_17
float[batch,197,768] layer_norm_18
float[batch,197,768] layer_norm_19
float[batch,197,768] layer_norm_2
float[batch,197,768] layer_norm_20
float[batch,197,768] layer_norm_21
float[batch,197,768] layer_norm_22
float[batch,197,768] layer_norm_23
float[batch,1,768] layer_norm_24
float[batch,197,768] layer_norm_3
float[batch,197,768] layer_norm_4
float[batch,197,768] layer_norm_5
float[batch,197,768] layer_norm_6
float[batch,197,768] layer_norm_7
float[batch,197,768] layer_norm_8
float[batch,197,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,197,3072] linear_10
float[batch,197,768] linear_11
float[batch,197,3072] linear_14
float[batch,197,768] linear_15
float[batch,197,3072] linear_18
float[batch,197,768] linear_19
float[batch,197,3072] linear_2
float[batch,197,3072] linear_22
float[batch,197,768] linear_23
float[batch,197,3072] linear_26
float[batch,197,768] linear_27
float[batch,197,768] linear_3
float[batch,197,3072] linear_30
float[batch,197,768] linear_31
float[batch,197,3072] linear_34
float[batch,197,768] linear_35
float[batch,197,3072] linear_38
float[batch,197,768] linear_39
float[batch,197,3072] linear_42
float[batch,197,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,197,3072] linear_6
float[batch,197,768] linear_7
float[batch,512] matmul
float[batch,197,768] node_scaled_dot_product_attention_10_k
float[batch,197,768] node_scaled_dot_product_attention_10_out
float[batch,197,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_10_q
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_10_v
float[batch,197,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_11_v
float[batch,197,768] node_scaled_dot_product_attention_1_k
float[batch,197,768] node_scaled_dot_product_attention_1_out
float[batch,197,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_1_q
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_1_v
float[batch,197,768] node_scaled_dot_product_attention_2_k
float[batch,197,768] node_scaled_dot_product_attention_2_out
float[batch,197,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_2_q
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_2_v
float[batch,197,768] node_scaled_dot_product_attention_3_k
float[batch,197,768] node_scaled_dot_product_attention_3_out
float[batch,197,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_3_q
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_3_v
float[batch,197,768] node_scaled_dot_product_attention_4_k
float[batch,197,768] node_scaled_dot_product_attention_4_out
float[batch,197,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_4_q
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_4_v
float[batch,197,768] node_scaled_dot_product_attention_5_k
float[batch,197,768] node_scaled_dot_product_attention_5_out
float[batch,197,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_5_q
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_5_v
float[batch,197,768] node_scaled_dot_product_attention_6_k
float[batch,197,768] node_scaled_dot_product_attention_6_out
float[batch,197,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_6_q
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_6_v
float[batch,197,768] node_scaled_dot_product_attention_7_k
float[batch,197,768] node_scaled_dot_product_attention_7_out
float[batch,197,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_7_q
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_7_v
float[batch,197,768] node_scaled_dot_product_attention_8_k
float[batch,197,768] node_scaled_dot_product_attention_8_out
float[batch,197,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_8_q
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_8_v
float[batch,197,768] node_scaled_dot_product_attention_9_k
float[batch,197,768] node_scaled_dot_product_attention_9_out
float[batch,197,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_9_q
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_9_v
float[batch,197,768] node_scaled_dot_product_attention_k
float[batch,197,768] node_scaled_dot_product_attention_out
float[batch,197,768] node_scaled_dot_product_attention_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_q
float[batch,197,2304] node_scaled_dot_product_attention_qkv
float[batch,197,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_v
float[batch,196,768] permute
float[batch,197,768] scaled_dot_product_attention
float[batch,197,768] scaled_dot_product_attention_1
float[batch,197,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,197,768] scaled_dot_product_attention_2
float[batch,197,768] scaled_dot_product_attention_3
float[batch,197,768] scaled_dot_product_attention_4
float[batch,197,768] scaled_dot_product_attention_5
float[batch,197,768] scaled_dot_product_attention_6
float[batch,197,768] scaled_dot_product_attention_7
float[batch,197,768] scaled_dot_product_attention_8
float[batch,197,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,197,768] val_43
float[batch,197,3072] val_44
float[batch,197,768] val_45
float[batch,197,3072] val_46
float[batch,197,768] val_47
float[batch,197,3072] val_48
float[batch,197,768] val_49
float[batch,197,3072] val_50
float[batch,197,768] val_51
float[batch,197,3072] val_52
float[batch,197,768] val_53
float[batch,197,3072] val_54
float[batch,197,768] val_55
float[batch,197,3072] val_56
float[batch,197,768] val_57
float[batch,197,3072] val_58
float[batch,197,768] val_59
float[batch,197,3072] val_60
float[batch,197,768] val_61
float[batch,197,3072] val_62
float[batch,197,768] val_63
float[batch,197,3072] val_64
float[batch,197,768] val_65
float[batch,1,3072] val_66
float[batch,1,768] val_67
float[batch,768] val_68
float[batch,768,196] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_43 = Pad (permute, val_3, val_4)
add_17 = Add (val_43, val_42)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_44 = MatMul (layer_norm_2, val_7)
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_45 = MatMul (gelu, val_8)
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_157 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_46 = MatMul (layer_norm_4, val_10)
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_47 = MatMul (gelu_1, val_11)
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_293 = Add (add_272, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_48 = MatMul (layer_norm_6, val_13)
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_49 = MatMul (gelu_2, val_14)
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_429 = Add (add_408, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_50 = MatMul (layer_norm_8, val_16)
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_51 = MatMul (gelu_3, val_17)
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_565 = Add (add_544, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_52 = MatMul (layer_norm_10, val_19)
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_53 = MatMul (gelu_4, val_20)
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_701 = Add (add_680, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_54 = MatMul (layer_norm_12, val_22)
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_55 = MatMul (gelu_5, val_23)
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_837 = Add (add_816, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_56 = MatMul (layer_norm_14, val_25)
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_57 = MatMul (gelu_6, val_26)
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_973 = Add (add_952, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_58 = MatMul (layer_norm_16, val_28)
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_59 = MatMul (gelu_7, val_29)
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1109 = Add (add_1088, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_60 = MatMul (layer_norm_18, val_31)
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_61 = MatMul (gelu_8, val_32)
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1245 = Add (add_1224, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_62 = MatMul (layer_norm_20, val_34)
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_63 = MatMul (gelu_9, val_35)
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1381 = Add (add_1360, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_64 = MatMul (layer_norm_22, val_37)
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_65 = MatMul (gelu_10, val_38)
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1517 = Add (add_1496, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_66 = MatMul (layer_norm_24, val_40)
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_67 = MatMul (gelu_11, val_41)
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1653 = Add (add_1632, linear_47)
val_68 = Squeeze (add_1653, val_5)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_Conv_704_fused_bias FLOAT[768] d5e47bc8585d
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 37f5fa16cff9
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 553ad2882313
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] f546bbbe1755
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] a14f58428544
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 6e1ed394aa6f
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] e724cda71c8e
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 7f5d6e1075a7
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 19b7f6f47106
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 7f249bf5a466
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 23fe8d62b903
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 58d2a401f137
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 7a12abb8155e
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] 711a5f1af300
val_11 FLOAT[3072,768] 54c2961b94e4
val_12 FLOAT[768,2304] 7ad8068eed09
val_13 FLOAT[768,3072] aa982c94d5da
val_14 FLOAT[3072,768] 004cfa35222b
val_15 FLOAT[768,2304] 546a020f5c51
val_16 FLOAT[768,3072] e9c047deb6e8
val_17 FLOAT[3072,768] 4f20eec09850
val_18 FLOAT[768,2304] deafdde70966
val_19 FLOAT[768,3072] a730b23465c1
val_2 INT64[1] af5570f5a181
val_20 FLOAT[3072,768] 3ad69a178995
val_21 FLOAT[768,2304] 96cbdcf97a0b
val_22 FLOAT[768,3072] b3ca4c6764ad
val_23 FLOAT[3072,768] bc1629219393
val_24 FLOAT[768,2304] 67ff3e97dfc8
val_25 FLOAT[768,3072] 4144b3b87a00
val_26 FLOAT[3072,768] 5c93eb6180f6
val_27 FLOAT[768,2304] bf26b8740809
val_28 FLOAT[768,3072] 80934feb1b7a
val_29 FLOAT[3072,768] 385bd10ce9e9
val_3 INT64[6] 6b7d92eaae70
val_30 FLOAT[768,2304] b4705639681a
val_31 FLOAT[768,3072] 9dcb6989040d
val_32 FLOAT[3072,768] 3958b6728e1d
val_33 FLOAT[768,2304] 37182dafb838
val_34 FLOAT[768,3072] 7afe5604c784
val_35 FLOAT[3072,768] d39975ae650a
val_36 FLOAT[768,2304] 2dadddf46de7
val_37 FLOAT[768,3072] 1313f62ec890
val_38 FLOAT[3072,768] 5d1c7a61256d
val_39 FLOAT[768,2304] b66132073d50
val_4 FLOAT[] df3f619804a9
val_40 FLOAT[768,3072] 5eb3355f84cb
val_41 FLOAT[3072,768] 23d67ab24bd9
val_42 FLOAT[1,197,768] 133281088442
val_5 INT64[1] 7c9fa136d441
val_6 FLOAT[768,2304] a0bf9c369409
val_7 FLOAT[768,3072] ca5558c7410e
val_8 FLOAT[3072,768] 6d41d8590aa1
val_9 FLOAT[768,2304] 351e27b7e501
view_target INT64[3] 8931c30473a4
visual.conv1.weight FLOAT[768,3,16,16] 531a145b521c
visual.ln_post.bias FLOAT[768] 25c9ddc4fb20
visual.ln_post.weight FLOAT[768] be1169ed3510
visual.ln_pre.bias FLOAT[768] e7552fb3050c
visual.ln_pre.weight FLOAT[768] 800d48d8ba89
visual.proj FLOAT[768,512] d2a488d704ad
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] d724a734be14
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] c8eaefbcf8a8
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] fde5aaca03ea
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] 368a99e5be67
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] ffd7a6d39fbb
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] 65e242185bfc
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 899d19ee0b01
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] c196c9446e9f
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] deb3b22659db
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 83abe9ee6f29
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 4f536bb91ff8
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 7418d8b23ff5
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] 5ebfeca9493a
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 239195b47cfe
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 98b0eb663bdc
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 285aba9c349d
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] e9be1a8a2af0
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 22862a7ff416
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] ff47b9b23e44
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] 4654d6fb86a5
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] 85da1a49c6e7
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] a62966bb9197
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] d113f0949d0b
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] a521030e832b
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 0a65044d42cf
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] f878820c9e3b
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] bb46ce7dfd4e
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] c5e63b2fabb6
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 72156dd5fe9f
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] cbc2705d07ab
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 140199054053
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 318016b0d098
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] aa0811844b6d
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 0f526a8909a2
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] c60812f55567
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] cdc9435acc01
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] b591427fbc95
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 78903a1baea0
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 6c304ba07fc9
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 0ad0e0fca04c
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] ae559edb234d
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 19456a0d0889
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 570493569727
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] 6aecffa0edae
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] 3d3f40bff4ba
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] d6e0dfbaca34
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 4995aa0fd8b3
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] e257e622f214
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] f696505f82c5
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 6b51e88c561c
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] efee5a085d8b
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 22af050521ea
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] b37fb87f1f0e
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] b258c1903ee1
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 56ae90a95826
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] fce1d9c8c19d
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] fa8bd5e8cb56
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 9eeebc8c4f5f
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 93f5cf4d824d
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] 8aa0899eff22
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] 98ad76b22765
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 993b8d006fd2
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 7e05f1ce7844
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 9785b0592842
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] d9593e8c36b8
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] bebd676e12a5
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 39b50582fec6
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] a5e3a71c487e
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 0c5cd9560e5e
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] 82a55856275a
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 79cabbddb962
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 87d60b254ca9
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 7b447e3e7f32
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 74b9d3493130
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 48fa942fbfc5
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 96e508297f45
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] f3f1279a989a
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 22a289b0d77e
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 1994863837a4
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 7e6bc975a260
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 62e58c989788
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 4c3ae231ffdb
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 731ee6ebdc33
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 25c07c1ff2d9
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] f1072c38020e
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] 98ece5af09b6
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 348956ca7435
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] d3a847dbf423
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] d1e3b6363b62
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 515a07d7de1e
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 080ea070ee93
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 8c5de31edc55
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 40e43ee3ed95
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] 3c1ce6e88260
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] e18678bf85f2
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 091e48ad9985
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,512] add_1071
float[batch,77,512] add_1092
float[batch,77,512] add_119
float[batch,77,512] add_1207
float[batch,77,512] add_1228
float[batch,77,512] add_1343
float[batch,77,512] add_1364
float[batch,77,512] add_140
float[batch,77,512] add_1479
float[batch,77,512] add_1500
float[batch,1,512] add_1500_pooled
float[batch,1,512] add_1615
float[batch,1,512] add_1636
float[batch,77,512] add_255
float[batch,77,512] add_276
float[batch,77,512] add_391
float[batch,77,512] add_4
float[batch,77,512] add_412
float[batch,77,512] add_527
float[batch,77,512] add_548
float[batch,77,512] add_663
float[batch,77,512] add_684
float[batch,77,512] add_799
float[batch,77,512] add_820
float[batch,77,512] add_935
float[batch,77,512] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,2048] gelu
float[batch,77,2048] gelu_1
float[batch,77,2048] gelu_10
float[batch,1,2048] gelu_11
float[batch,77,2048] gelu_2
float[batch,77,2048] gelu_3
float[batch,77,2048] gelu_4
float[batch,77,2048] gelu_5
float[batch,77,2048] gelu_6
float[batch,77,2048] gelu_7
float[batch,77,2048] gelu_8
float[batch,77,2048] gelu_9
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,512] matmul
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] val_39
float[batch,77,512] val_40
float[batch,77,2048] val_41
float[batch,77,512] val_42
float[batch,77,2048] val_43
float[batch,77,512] val_44
float[batch,77,2048] val_45
float[batch,77,512] val_46
float[batch,77,2048] val_47
float[batch,77,512] val_48
float[batch,77,2048] val_49
float[batch,77,512] val_50
float[batch,77,2048] val_51
float[batch,77,512] val_52
float[batch,77,2048] val_53
float[batch,77,512] val_54
float[batch,77,2048] val_55
float[batch,77,512] val_56
float[batch,77,2048] val_57
float[batch,77,512] val_58
float[batch,77,2048] val_59
float[batch,77,512] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2048] val_63
float[batch,1,512] val_64
float[batch,1,512] val_65
float[batch,512] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] 7b0b936a2d88
ln_final.weight FLOAT[512] 18580ecbe413
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] ee38ff363fd8
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 3af9eb7e33fe
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 61af36bd0dba
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] ad857a948a83
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 44bbf07257ea
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] c638b4c94788
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] f17bc2fffb9d
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 57a6a6b6b3fe
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 397cd585417c
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 0d23300bc51b
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 2867324d2a1b
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 17ac59d1c6f3
positional_embedding FLOAT[77,512] 9dba7f447bbd
text_projection FLOAT[512,512] 9ec76acb5f85
token_embedding.weight_fp16 FLOAT16[49408,512] df51d3f22dd5
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 311d323bb670
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] d87fc7391b0f
transformer.resblocks.0.ln_1.bias FLOAT[512] d1be61949795
transformer.resblocks.0.ln_1.weight FLOAT[512] aa954eee1b26
transformer.resblocks.0.ln_2.bias FLOAT[512] f2f2562f12fb
transformer.resblocks.0.ln_2.weight FLOAT[512] c77aaf066908
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 596d3dd89d2e
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 1db54ae8a68d
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] ccdedc6af84c
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 8f5b9f1017ad
transformer.resblocks.1.ln_1.bias FLOAT[512] 3e28777518cf
transformer.resblocks.1.ln_1.weight FLOAT[512] 0a01efb486fb
transformer.resblocks.1.ln_2.bias FLOAT[512] be0ecfa9cc89
transformer.resblocks.1.ln_2.weight FLOAT[512] a8348f850ae3
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 1f7af25a2cb3
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] 09784f5167de
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] df709013e97b
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] a4ef931ec246
transformer.resblocks.10.ln_1.bias FLOAT[512] 6adb9c2494e0
transformer.resblocks.10.ln_1.weight FLOAT[512] 9151a8cef877
transformer.resblocks.10.ln_2.bias FLOAT[512] 4d4ead9c0063
transformer.resblocks.10.ln_2.weight FLOAT[512] a17ef367ce42
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 65c8a3ef0dbc
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] a8ff4a1c9327
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] a95614208397
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 550b588aba7c
transformer.resblocks.11.ln_1.bias FLOAT[512] 2797726f82ee
transformer.resblocks.11.ln_1.weight FLOAT[512] 3e2dbfebaec9
transformer.resblocks.11.ln_2.bias FLOAT[512] 5d3b4f3b6eb5
transformer.resblocks.11.ln_2.weight FLOAT[512] 4ae1bf6ad797
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] b469daaeb87b
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 50cb9cc196ce
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 3242aca55ec3
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 99c8ef023657
transformer.resblocks.2.ln_1.bias FLOAT[512] 8ec755a2564a
transformer.resblocks.2.ln_1.weight FLOAT[512] f2dcdf163c7e
transformer.resblocks.2.ln_2.bias FLOAT[512] 0a3551cc9a16
transformer.resblocks.2.ln_2.weight FLOAT[512] cf831a7092b0
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 56fb134f05be
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] d8fc2972dd5a
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 356bcf1ce4f3
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] f86a1fb18c75
transformer.resblocks.3.ln_1.bias FLOAT[512] 46ab7b94c0b5
transformer.resblocks.3.ln_1.weight FLOAT[512] ce9efddee4a1
transformer.resblocks.3.ln_2.bias FLOAT[512] b80e72dcba87
transformer.resblocks.3.ln_2.weight FLOAT[512] e8aec3b6c1df
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] 61bb8a2c68ce
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 81e12fb9654b
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] dc5ce1ba505d
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] b6a17c3d0e66
transformer.resblocks.4.ln_1.bias FLOAT[512] 69aa04b6e5c2
transformer.resblocks.4.ln_1.weight FLOAT[512] 0909399afa5a
transformer.resblocks.4.ln_2.bias FLOAT[512] dd99305b6368
transformer.resblocks.4.ln_2.weight FLOAT[512] 6b9270d73940
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 4741a49d94bc
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 4694663fd902
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 03777db99a56
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 13f4ae1e2e51
transformer.resblocks.5.ln_1.bias FLOAT[512] 1eee0564cbd7
transformer.resblocks.5.ln_1.weight FLOAT[512] 14fd90d4668f
transformer.resblocks.5.ln_2.bias FLOAT[512] 6407b49334dc
transformer.resblocks.5.ln_2.weight FLOAT[512] ea1c94623339
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 164bd5e1ba66
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 137598bdc058
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] e716de11ab7c
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 80d04e436ee1
transformer.resblocks.6.ln_1.bias FLOAT[512] 7e10777b8bb4
transformer.resblocks.6.ln_1.weight FLOAT[512] 34d3b3cb9d39
transformer.resblocks.6.ln_2.bias FLOAT[512] 366d5e3c0bbf
transformer.resblocks.6.ln_2.weight FLOAT[512] 077f396d0d0d
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 3d2c66731d7a
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 0d37b31e37b0
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 86da1352fd35
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 669eee199e48
transformer.resblocks.7.ln_1.bias FLOAT[512] 333bd4e7c3ca
transformer.resblocks.7.ln_1.weight FLOAT[512] 99391c6acab1
transformer.resblocks.7.ln_2.bias FLOAT[512] a2c8c39654f2
transformer.resblocks.7.ln_2.weight FLOAT[512] 050e454ad316
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 8a43ee938418
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 21ddaa4cc034
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] ab445e196031
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 312836ff2bf2
transformer.resblocks.8.ln_1.bias FLOAT[512] 598a5a79137a
transformer.resblocks.8.ln_1.weight FLOAT[512] afeffb5f7f66
transformer.resblocks.8.ln_2.bias FLOAT[512] 61deae415b56
transformer.resblocks.8.ln_2.weight FLOAT[512] a18be0856c04
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 5b378858ca51
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 49a9fa21ced5
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 1e7874935761
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] a3d3bc125870
transformer.resblocks.9.ln_1.bias FLOAT[512] e015a38dc74c
transformer.resblocks.9.ln_1.weight FLOAT[512] 79d00659cd1b
transformer.resblocks.9.ln_2.bias FLOAT[512] 41759c2b97dc
transformer.resblocks.9.ln_2.weight FLOAT[512] d35184a4882d
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] af0ece10fc1b
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 1707c7d0cdb2
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2048,512] c3dedc29141a
val_11 FLOAT[512,1536] dfb14e3ee3ab
val_12 FLOAT[512,2048] 6fe3c36e3489
val_13 FLOAT[2048,512] a04950777ebc
val_14 FLOAT[512,1536] 91c73e158e57
val_15 FLOAT[512,2048] 2894eebe6b9e
val_16 FLOAT[2048,512] f3ea21057a92
val_17 FLOAT[512,1536] 55eec5f747d1
val_18 FLOAT[512,2048] 3735ca76b418
val_19 FLOAT[2048,512] 794b9d598a09
val_2 FLOAT[512,1536] beb5e13ad5c3
val_20 FLOAT[512,1536] c5c37f38ba86
val_21 FLOAT[512,2048] 1288bc29a3e9
val_22 FLOAT[2048,512] 87c9a122f444
val_23 FLOAT[512,1536] 0012dc2335a4
val_24 FLOAT[512,2048] 1f4515cdcb63
val_25 FLOAT[2048,512] 750eb33ee7cb
val_26 FLOAT[512,1536] 8e774b9157ce
val_27 FLOAT[512,2048] 3e644daede0d
val_28 FLOAT[2048,512] 5fa607614f40
val_29 FLOAT[512,1536] c797e1fa1508
val_3 FLOAT[512,2048] 220e3c94c4ae
val_30 FLOAT[512,2048] 77968640c69c
val_31 FLOAT[2048,512] dbd80e3fd139
val_32 FLOAT[512,1536] fec25a8ef1f3
val_33 FLOAT[512,2048] e4c5f05153de
val_34 FLOAT[2048,512] 82c142500304
val_35 FLOAT[512,1536] f427d1dd0b5a
val_36 FLOAT[512,2048] 1c0b75d60f01
val_37 FLOAT[2048,512] fd09f5017997
val_4 FLOAT[2048,512] 55fa24d1c845
val_5 FLOAT[512,1536] 6b21d4e9aa62
val_6 FLOAT[512,2048] 3d196224292a
val_7 FLOAT[2048,512] 263ff55bb2ed
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[512,1536] 737093369b94
val_9 FLOAT[512,2048] 7f44ca743497
@@ -0,0 +1,587 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,197,768] add_1088
float[batch,197,768] add_1109
float[batch,197,768] add_1224
float[batch,197,768] add_1245
float[batch,197,768] add_136
float[batch,197,768] add_1360
float[batch,197,768] add_1381
float[batch,197,768] add_1496
float[batch,197,768] add_1517
float[batch,1,768] add_1517_pooled
float[batch,197,768] add_157
float[batch,1,768] add_1632
float[batch,1,768] add_1653
float[batch,197,768] add_17
float[batch,197,768] add_272
float[batch,197,768] add_293
float[batch,197,768] add_408
float[batch,197,768] add_429
float[batch,197,768] add_544
float[batch,197,768] add_565
float[batch,197,768] add_680
float[batch,197,768] add_701
float[batch,197,768] add_816
float[batch,197,768] add_837
float[batch,197,768] add_952
float[batch,197,768] add_973
float[batch,1] clamp_min
float[batch,768,14,14] conv2d
float[batch,197,3072] gelu
float[batch,197,3072] gelu_1
float[batch,197,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,197,3072] gelu_2
float[batch,197,3072] gelu_3
float[batch,197,3072] gelu_4
float[batch,197,3072] gelu_5
float[batch,197,3072] gelu_6
float[batch,197,3072] gelu_7
float[batch,197,3072] gelu_8
float[batch,197,3072] gelu_9
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,197,768] layer_norm
float[batch,197,768] layer_norm_1
float[batch,197,768] layer_norm_10
float[batch,197,768] layer_norm_11
float[batch,197,768] layer_norm_12
float[batch,197,768] layer_norm_13
float[batch,197,768] layer_norm_14
float[batch,197,768] layer_norm_15
float[batch,197,768] layer_norm_16
float[batch,197,768] layer_norm_17
float[batch,197,768] layer_norm_18
float[batch,197,768] layer_norm_19
float[batch,197,768] layer_norm_2
float[batch,197,768] layer_norm_20
float[batch,197,768] layer_norm_21
float[batch,197,768] layer_norm_22
float[batch,197,768] layer_norm_23
float[batch,1,768] layer_norm_24
float[batch,197,768] layer_norm_3
float[batch,197,768] layer_norm_4
float[batch,197,768] layer_norm_5
float[batch,197,768] layer_norm_6
float[batch,197,768] layer_norm_7
float[batch,197,768] layer_norm_8
float[batch,197,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,197,3072] linear_10
float[batch,197,768] linear_11
float[batch,197,3072] linear_14
float[batch,197,768] linear_15
float[batch,197,3072] linear_18
float[batch,197,768] linear_19
float[batch,197,3072] linear_2
float[batch,197,3072] linear_22
float[batch,197,768] linear_23
float[batch,197,3072] linear_26
float[batch,197,768] linear_27
float[batch,197,768] linear_3
float[batch,197,3072] linear_30
float[batch,197,768] linear_31
float[batch,197,3072] linear_34
float[batch,197,768] linear_35
float[batch,197,3072] linear_38
float[batch,197,768] linear_39
float[batch,197,3072] linear_42
float[batch,197,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,197,3072] linear_6
float[batch,197,768] linear_7
float[batch,512] matmul
float[batch,197,768] node_scaled_dot_product_attention_10_k
float[batch,197,768] node_scaled_dot_product_attention_10_out
float[batch,197,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_10_q
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_10_v
float[batch,197,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_11_v
float[batch,197,768] node_scaled_dot_product_attention_1_k
float[batch,197,768] node_scaled_dot_product_attention_1_out
float[batch,197,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_1_q
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_1_v
float[batch,197,768] node_scaled_dot_product_attention_2_k
float[batch,197,768] node_scaled_dot_product_attention_2_out
float[batch,197,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_2_q
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_2_v
float[batch,197,768] node_scaled_dot_product_attention_3_k
float[batch,197,768] node_scaled_dot_product_attention_3_out
float[batch,197,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_3_q
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_3_v
float[batch,197,768] node_scaled_dot_product_attention_4_k
float[batch,197,768] node_scaled_dot_product_attention_4_out
float[batch,197,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_4_q
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_4_v
float[batch,197,768] node_scaled_dot_product_attention_5_k
float[batch,197,768] node_scaled_dot_product_attention_5_out
float[batch,197,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_5_q
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_5_v
float[batch,197,768] node_scaled_dot_product_attention_6_k
float[batch,197,768] node_scaled_dot_product_attention_6_out
float[batch,197,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_6_q
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_6_v
float[batch,197,768] node_scaled_dot_product_attention_7_k
float[batch,197,768] node_scaled_dot_product_attention_7_out
float[batch,197,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_7_q
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_7_v
float[batch,197,768] node_scaled_dot_product_attention_8_k
float[batch,197,768] node_scaled_dot_product_attention_8_out
float[batch,197,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_8_q
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_8_v
float[batch,197,768] node_scaled_dot_product_attention_9_k
float[batch,197,768] node_scaled_dot_product_attention_9_out
float[batch,197,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_9_q
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_9_v
float[batch,197,768] node_scaled_dot_product_attention_k
float[batch,197,768] node_scaled_dot_product_attention_out
float[batch,197,768] node_scaled_dot_product_attention_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_q
float[batch,197,2304] node_scaled_dot_product_attention_qkv
float[batch,197,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_v
float[batch,196,768] permute
float[batch,197,768] scaled_dot_product_attention
float[batch,197,768] scaled_dot_product_attention_1
float[batch,197,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,197,768] scaled_dot_product_attention_2
float[batch,197,768] scaled_dot_product_attention_3
float[batch,197,768] scaled_dot_product_attention_4
float[batch,197,768] scaled_dot_product_attention_5
float[batch,197,768] scaled_dot_product_attention_6
float[batch,197,768] scaled_dot_product_attention_7
float[batch,197,768] scaled_dot_product_attention_8
float[batch,197,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,197,768] val_43
float[batch,197,3072] val_44
float[batch,197,768] val_45
float[batch,197,3072] val_46
float[batch,197,768] val_47
float[batch,197,3072] val_48
float[batch,197,768] val_49
float[batch,197,3072] val_50
float[batch,197,768] val_51
float[batch,197,3072] val_52
float[batch,197,768] val_53
float[batch,197,3072] val_54
float[batch,197,768] val_55
float[batch,197,3072] val_56
float[batch,197,768] val_57
float[batch,197,3072] val_58
float[batch,197,768] val_59
float[batch,197,3072] val_60
float[batch,197,768] val_61
float[batch,197,3072] val_62
float[batch,197,768] val_63
float[batch,197,3072] val_64
float[batch,197,768] val_65
float[batch,1,3072] val_66
float[batch,1,768] val_67
float[batch,768] val_68
float[batch,768,196] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_43 = Pad (permute, val_3, val_4)
add_17 = Add (val_43, val_42)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_44 = MatMul (layer_norm_2, val_7)
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_45 = MatMul (gelu, val_8)
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_157 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_46 = MatMul (layer_norm_4, val_10)
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_47 = MatMul (gelu_1, val_11)
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_293 = Add (add_272, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_48 = MatMul (layer_norm_6, val_13)
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_49 = MatMul (gelu_2, val_14)
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_429 = Add (add_408, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_50 = MatMul (layer_norm_8, val_16)
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_51 = MatMul (gelu_3, val_17)
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_565 = Add (add_544, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_52 = MatMul (layer_norm_10, val_19)
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_53 = MatMul (gelu_4, val_20)
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_701 = Add (add_680, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_54 = MatMul (layer_norm_12, val_22)
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_55 = MatMul (gelu_5, val_23)
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_837 = Add (add_816, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_56 = MatMul (layer_norm_14, val_25)
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_57 = MatMul (gelu_6, val_26)
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_973 = Add (add_952, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_58 = MatMul (layer_norm_16, val_28)
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_59 = MatMul (gelu_7, val_29)
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1109 = Add (add_1088, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_60 = MatMul (layer_norm_18, val_31)
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_61 = MatMul (gelu_8, val_32)
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1245 = Add (add_1224, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_62 = MatMul (layer_norm_20, val_34)
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_63 = MatMul (gelu_9, val_35)
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1381 = Add (add_1360, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_64 = MatMul (layer_norm_22, val_37)
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_65 = MatMul (gelu_10, val_38)
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1517 = Add (add_1496, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_66 = MatMul (layer_norm_24, val_40)
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_67 = MatMul (gelu_11, val_41)
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1653 = Add (add_1632, linear_47)
val_68 = Squeeze (add_1653, val_5)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_Conv_704_fused_bias FLOAT[768] cec1400e09f9
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] e4090d3a2b50
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] ee5e54044120
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 85a0aaf77732
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 41cd1000c01b
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 50604d7e6bd3
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 25cb81a3cafa
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] aa1b5c8d3875
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] c2a3daaa6a4e
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 9485db8b4477
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] fd1e09bb0459
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 189a30478cb6
node_scaled_dot_product_attention_wo_t FLOAT[768,768] fd841bc7db44
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] e82fdf403499
val_11 FLOAT[3072,768] 0f8820cec287
val_12 FLOAT[768,2304] 420520852da1
val_13 FLOAT[768,3072] 492eaf1b9333
val_14 FLOAT[3072,768] 93059353a373
val_15 FLOAT[768,2304] ae0785ac8cd2
val_16 FLOAT[768,3072] aac40e3150d9
val_17 FLOAT[3072,768] 4979f5fc2abd
val_18 FLOAT[768,2304] 3f335510d410
val_19 FLOAT[768,3072] 4f5f6707990f
val_2 INT64[1] af5570f5a181
val_20 FLOAT[3072,768] 2cbd1ed0fc36
val_21 FLOAT[768,2304] e435fe3febdf
val_22 FLOAT[768,3072] 3b8bbc17ae7a
val_23 FLOAT[3072,768] 7a50a18642e2
val_24 FLOAT[768,2304] 706ade6d578d
val_25 FLOAT[768,3072] 5e479711b042
val_26 FLOAT[3072,768] af68103337b0
val_27 FLOAT[768,2304] e2169090543f
val_28 FLOAT[768,3072] eb1ea3fd824f
val_29 FLOAT[3072,768] e20c46ca2a09
val_3 INT64[6] 6b7d92eaae70
val_30 FLOAT[768,2304] b2c34a6407e9
val_31 FLOAT[768,3072] 5aeed81ddaed
val_32 FLOAT[3072,768] f0fab4456d51
val_33 FLOAT[768,2304] 26d0461b18eb
val_34 FLOAT[768,3072] fe0710f5c4fd
val_35 FLOAT[3072,768] a68d645e5e66
val_36 FLOAT[768,2304] e1fbf5a09c31
val_37 FLOAT[768,3072] 5c71779bd098
val_38 FLOAT[3072,768] 668a99f1cd31
val_39 FLOAT[768,2304] 7620acf5020e
val_4 FLOAT[] df3f619804a9
val_40 FLOAT[768,3072] c97f5e946a8b
val_41 FLOAT[3072,768] 3f816e67b6ac
val_42 FLOAT[1,197,768] 10c7d0597907
val_5 INT64[1] 7c9fa136d441
val_6 FLOAT[768,2304] e4fdcb3e4286
val_7 FLOAT[768,3072] 718e14da1c58
val_8 FLOAT[3072,768] c38884b606b4
val_9 FLOAT[768,2304] 2a7639bc86dd
view_target INT64[3] 8931c30473a4
visual.conv1.weight FLOAT[768,3,16,16] c8964a02344e
visual.ln_post.bias FLOAT[768] 05edeadcc14a
visual.ln_post.weight FLOAT[768] 76420a5fbd79
visual.ln_pre.bias FLOAT[768] dae5b0710c07
visual.ln_pre.weight FLOAT[768] 87606085d4a8
visual.proj FLOAT[768,512] 584e3a559624
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 4c3d3778eb2e
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] a3cfddb8581d
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] 18752a838d10
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] ff8e60ecba75
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] 65735ae2fe1a
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] af8b31e8f8f1
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 3133b886b3fd
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 75908f7c62e2
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 66e342885f6b
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 71f86b480699
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] a99e97c16888
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 93a67e3b510a
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] 7219a15df74b
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 5c9e0d47c798
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] bca526bc7b40
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 97b708d64690
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 8454b47dfae2
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] ed6f9b15eec4
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] fd9bfdfcb5f2
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] ad60e0cb0f84
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] c7ae17e6abba
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 842fd0c890c0
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] faf284b4ff17
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] d9978c397904
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 0373df24cf43
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] f918446b399d
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] c3cca2633992
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] 2e445eba75ce
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 6302e82949d8
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] 43b70520478c
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] b32be672af3b
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 96847fc4b7ec
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] f0334a28b38e
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 9e5c225df113
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] 4ea5b97d7980
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] f746e9bf1a5e
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] 44f84d070782
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] d575753cdae1
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] cd47f317c948
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] a88fdfe3904c
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 5446110907a4
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] baa7f35f3f2b
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 61fbf6f330e1
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] 47f2273e6bbd
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] dfa906e3d69a
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] a0c6d317cd6c
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] ec486a9f71a5
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] f68f6f354cae
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 582509ef592a
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] f5b34a75cda0
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] bb2de882e96c
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] aeacc2c8e6fe
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 7e500902b529
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] d29ae150a1ab
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 725413d01afd
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 9557a0fdff07
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 17fa6077e880
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] bb0dddae3a1c
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 909a83cb1dcb
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] c7552c986ca9
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] f912d8abb75e
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 245502dbf8e0
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 2de4938af0f5
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 3283fa0a1ec4
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] d83601050d60
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 9c2bed6f7adf
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 0f7a7b336d91
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] 7b97f13fc836
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 45bd3a7cf0d5
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] a968d76ecd3b
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 61db3959a658
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 630c63fa1c7e
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] a52443073867
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 1328ff4eb20d
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 1187c3c21e27
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 7e6d2d770c81
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] 1a8dd9823706
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 78a96b994f89
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 859a841bc82e
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 50e05c0e7c7f
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 8f99f42600b8
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 8ab7c65a1147
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 1e2c0f3b233f
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 8a54f22e152a
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] c608b043682f
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] c7a77b537bcf
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 7d1b4c941648
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] eefa0bf9b17b
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] fedca5daa5a7
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 13898cfaab2a
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] b15fe18cd1df
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 508c7bfd830d
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] c3b7d62b826c
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] 989a2b310a85
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 92dc9cdf1b7c
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] f0c4f18cbaec
+625
View File
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,512] add_1012
float[batch,77,512] add_1127
float[batch,77,512] add_1156
float[batch,77,512] add_119
float[batch,77,512] add_1271
float[batch,77,512] add_1300
float[batch,77,512] add_1415
float[batch,77,512] add_1444
float[batch,77,512] add_148
float[batch,77,512] add_1559
float[batch,77,512] add_1588
float[batch,1,512] add_1588_pooled
float[batch,1,512] add_1703
float[batch,1,512] add_1732
float[batch,77,512] add_263
float[batch,77,512] add_292
float[batch,77,512] add_4
float[batch,77,512] add_407
float[batch,77,512] add_436
float[batch,77,512] add_551
float[batch,77,512] add_580
float[batch,77,512] add_695
float[batch,77,512] add_724
float[batch,77,512] add_839
float[batch,77,512] add_868
float[batch,77,512] add_983
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,512] matmul
float[batch,77,2048] mul_101
float[batch,77,2048] mul_106
float[batch,77,2048] mul_1064
float[batch,77,2048] mul_1069
float[batch,77,2048] mul_1171
float[batch,77,2048] mul_1176
float[batch,1,2048] mul_1278
float[batch,1,2048] mul_1283
float[batch,77,2048] mul_208
float[batch,77,2048] mul_213
float[batch,77,2048] mul_315
float[batch,77,2048] mul_320
float[batch,77,2048] mul_422
float[batch,77,2048] mul_427
float[batch,77,2048] mul_529
float[batch,77,2048] mul_534
float[batch,77,2048] mul_636
float[batch,77,2048] mul_641
float[batch,77,2048] mul_743
float[batch,77,2048] mul_748
float[batch,77,2048] mul_850
float[batch,77,2048] mul_855
float[batch,77,2048] mul_957
float[batch,77,2048] mul_962
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] sigmoid
float[batch,77,2048] sigmoid_1
float[batch,77,2048] sigmoid_10
float[batch,1,2048] sigmoid_11
float[batch,77,2048] sigmoid_2
float[batch,77,2048] sigmoid_3
float[batch,77,2048] sigmoid_4
float[batch,77,2048] sigmoid_5
float[batch,77,2048] sigmoid_6
float[batch,77,2048] sigmoid_7
float[batch,77,2048] sigmoid_8
float[batch,77,2048] sigmoid_9
float[batch,77,2048] val_40
float[batch,77,512] val_41
float[batch,77,2048] val_42
float[batch,77,512] val_43
float[batch,77,2048] val_44
float[batch,77,512] val_45
float[batch,77,2048] val_46
float[batch,77,512] val_47
float[batch,77,2048] val_48
float[batch,77,512] val_49
float[batch,77,2048] val_50
float[batch,77,512] val_51
float[batch,77,2048] val_52
float[batch,77,512] val_53
float[batch,77,2048] val_54
float[batch,77,512] val_55
float[batch,77,2048] val_56
float[batch,77,512] val_57
float[batch,77,2048] val_58
float[batch,77,512] val_59
float[batch,77,2048] val_60
float[batch,77,512] val_61
float[batch,77] val_62
float[batch,1,77] val_63
float[batch,1,2048] val_64
float[batch,1,512] val_65
float[batch,1,512] val_66
float[batch,512] val_67
>
{
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_39)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_40 = MatMul (layer_norm_1, val_4)
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
mul_101 = Mul (linear_2, val_2)
[node_sigmoid] sigmoid = Sigmoid (mul_101)
mul_106 = Mul (linear_2, sigmoid)
val_41 = MatMul (mul_106, val_5)
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
add_148 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_42 = MatMul (layer_norm_3, val_7)
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
mul_208 = Mul (linear_6, val_2)
sigmoid_1 = Sigmoid (mul_208)
mul_213 = Mul (linear_6, sigmoid_1)
val_43 = MatMul (mul_213, val_8)
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
add_292 = Add (add_263, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_44 = MatMul (layer_norm_5, val_10)
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
mul_315 = Mul (linear_10, val_2)
sigmoid_2 = Sigmoid (mul_315)
mul_320 = Mul (linear_10, sigmoid_2)
val_45 = MatMul (mul_320, val_11)
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
add_436 = Add (add_407, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_46 = MatMul (layer_norm_7, val_13)
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
mul_422 = Mul (linear_14, val_2)
sigmoid_3 = Sigmoid (mul_422)
mul_427 = Mul (linear_14, sigmoid_3)
val_47 = MatMul (mul_427, val_14)
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
add_580 = Add (add_551, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_48 = MatMul (layer_norm_9, val_16)
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
mul_529 = Mul (linear_18, val_2)
sigmoid_4 = Sigmoid (mul_529)
mul_534 = Mul (linear_18, sigmoid_4)
val_49 = MatMul (mul_534, val_17)
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
add_724 = Add (add_695, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_50 = MatMul (layer_norm_11, val_19)
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
mul_636 = Mul (linear_22, val_2)
sigmoid_5 = Sigmoid (mul_636)
mul_641 = Mul (linear_22, sigmoid_5)
val_51 = MatMul (mul_641, val_20)
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
add_868 = Add (add_839, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_52 = MatMul (layer_norm_13, val_22)
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
mul_743 = Mul (linear_26, val_2)
sigmoid_6 = Sigmoid (mul_743)
mul_748 = Mul (linear_26, sigmoid_6)
val_53 = MatMul (mul_748, val_23)
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
add_1012 = Add (add_983, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_54 = MatMul (layer_norm_15, val_25)
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
mul_850 = Mul (linear_30, val_2)
sigmoid_7 = Sigmoid (mul_850)
mul_855 = Mul (linear_30, sigmoid_7)
val_55 = MatMul (mul_855, val_26)
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
add_1156 = Add (add_1127, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_56 = MatMul (layer_norm_17, val_28)
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
mul_957 = Mul (linear_34, val_2)
sigmoid_8 = Sigmoid (mul_957)
mul_962 = Mul (linear_34, sigmoid_8)
val_57 = MatMul (mul_962, val_29)
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
add_1300 = Add (add_1271, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_58 = MatMul (layer_norm_19, val_31)
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
mul_1064 = Mul (linear_38, val_2)
sigmoid_9 = Sigmoid (mul_1064)
mul_1069 = Mul (linear_38, sigmoid_9)
val_59 = MatMul (mul_1069, val_32)
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
add_1444 = Add (add_1415, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_60 = MatMul (layer_norm_21, val_34)
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
mul_1171 = Mul (linear_42, val_2)
sigmoid_10 = Sigmoid (mul_1171)
mul_1176 = Mul (linear_42, sigmoid_10)
val_61 = MatMul (mul_1176, val_35)
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
add_1588 = Add (add_1559, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
val_63 = Unsqueeze (val_62, val_756_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_64 = MatMul (layer_norm_23, val_37)
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
mul_1278 = Mul (linear_46, val_2)
sigmoid_11 = Sigmoid (mul_1278)
mul_1283 = Mul (linear_46, sigmoid_11)
val_65 = MatMul (mul_1283, val_38)
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
add_1732 = Add (add_1703, linear_47)
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
val_67 = Squeeze (val_66, val_756_axes1)
[node_matmul] matmul = MatMul (val_67, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] 9677af36ca74
ln_final.weight FLOAT[512] c804b5cbee76
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] e6f4e0cc84eb
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] d2dac491b78f
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 8e6077b0d963
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 1027732e4b38
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 61ff349e4936
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] dc800761752f
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 18c7ea7f9264
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 072131a5d1e7
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 5e8afd6b5213
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 1170705cc2e5
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] d17b9b435a4b
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 358f7e9bf52f
positional_embedding FLOAT[77,512] 746d9aa0531a
text_projection FLOAT[512,512] b52b945b89dd
token_embedding.weight_fp16 FLOAT16[49408,512] 9076d1022292
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 32e43297712f
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] a71f86135649
transformer.resblocks.0.ln_1.bias FLOAT[512] 4d1de288425d
transformer.resblocks.0.ln_1.weight FLOAT[512] 67181a91cd72
transformer.resblocks.0.ln_2.bias FLOAT[512] 8645a2626b7e
transformer.resblocks.0.ln_2.weight FLOAT[512] d65fd5280a59
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 823f8bd0c791
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] c5205b23084c
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 18c8d2941bb6
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 18d4232260e9
transformer.resblocks.1.ln_1.bias FLOAT[512] 5823162f11e2
transformer.resblocks.1.ln_1.weight FLOAT[512] 00a10c449fb1
transformer.resblocks.1.ln_2.bias FLOAT[512] cad68e7f9219
transformer.resblocks.1.ln_2.weight FLOAT[512] a2525986476c
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 2e6c1765d265
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] b15fca034e5c
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] df3d16e8c22e
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 6016bee22131
transformer.resblocks.10.ln_1.bias FLOAT[512] a19ff545590e
transformer.resblocks.10.ln_1.weight FLOAT[512] d1fd0ac27093
transformer.resblocks.10.ln_2.bias FLOAT[512] 8002655b5514
transformer.resblocks.10.ln_2.weight FLOAT[512] 77bcadf1e648
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 01325a501afc
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 6918a7db4aff
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 5b8264c1c637
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] bbb966c89737
transformer.resblocks.11.ln_1.bias FLOAT[512] 773b91c564f3
transformer.resblocks.11.ln_1.weight FLOAT[512] 20370d7960e7
transformer.resblocks.11.ln_2.bias FLOAT[512] 0e7aced291a7
transformer.resblocks.11.ln_2.weight FLOAT[512] 24b910b980fc
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] bedc4d226bc1
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] f2a47079e522
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] bd83f19905be
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] f2b6fa2a3e00
transformer.resblocks.2.ln_1.bias FLOAT[512] 750ba8ab7e5a
transformer.resblocks.2.ln_1.weight FLOAT[512] 46d5bfbd7648
transformer.resblocks.2.ln_2.bias FLOAT[512] 90d435120513
transformer.resblocks.2.ln_2.weight FLOAT[512] 08aeaa6444f5
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] e357d289058a
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 3cff92ff877b
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] b361c5c35d2f
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 7b7180e786a4
transformer.resblocks.3.ln_1.bias FLOAT[512] ab9d172cf880
transformer.resblocks.3.ln_1.weight FLOAT[512] d8f97dea962b
transformer.resblocks.3.ln_2.bias FLOAT[512] db99b9e17f5c
transformer.resblocks.3.ln_2.weight FLOAT[512] 34a8de79ed21
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] fe36f048c502
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] f877fa446d15
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] 8e9413ef6861
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] bd3027f86a02
transformer.resblocks.4.ln_1.bias FLOAT[512] 1990497939d3
transformer.resblocks.4.ln_1.weight FLOAT[512] a3f33407997c
transformer.resblocks.4.ln_2.bias FLOAT[512] 59ed36df52c4
transformer.resblocks.4.ln_2.weight FLOAT[512] 74aa314aef7e
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 16253d6ef4eb
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 85e6d52d85e8
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 95bab1a41256
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 3ac4284099c0
transformer.resblocks.5.ln_1.bias FLOAT[512] 0f255dd16112
transformer.resblocks.5.ln_1.weight FLOAT[512] 64dc044c024a
transformer.resblocks.5.ln_2.bias FLOAT[512] 8e07b963ead5
transformer.resblocks.5.ln_2.weight FLOAT[512] 3d7df8181724
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] eb8e6ea4a267
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 89857bf2b919
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 9e749faf5920
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 484d4ae8b3b5
transformer.resblocks.6.ln_1.bias FLOAT[512] 04828d655893
transformer.resblocks.6.ln_1.weight FLOAT[512] feb67ab588eb
transformer.resblocks.6.ln_2.bias FLOAT[512] 5eedd73d9d94
transformer.resblocks.6.ln_2.weight FLOAT[512] 8f105deef87d
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 1bc57a08406e
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 6be86c28c974
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] a68d4986b982
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 967209c3cf63
transformer.resblocks.7.ln_1.bias FLOAT[512] 6eafa31e6cd3
transformer.resblocks.7.ln_1.weight FLOAT[512] 42c093631449
transformer.resblocks.7.ln_2.bias FLOAT[512] b1cac43543ec
transformer.resblocks.7.ln_2.weight FLOAT[512] 45989bf3e932
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 2f040111ddd9
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] fcde6d6503d7
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 4f0138ded6c2
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] b5ae8a8d7699
transformer.resblocks.8.ln_1.bias FLOAT[512] 843367a77d6e
transformer.resblocks.8.ln_1.weight FLOAT[512] d0313e94a032
transformer.resblocks.8.ln_2.bias FLOAT[512] 3d3ecaf967f1
transformer.resblocks.8.ln_2.weight FLOAT[512] 44314f856d40
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 3f1f4d37b607
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 3068550f67c2
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 75e608cb40e6
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] d1fc5e87d78a
transformer.resblocks.9.ln_1.bias FLOAT[512] 40e67418010b
transformer.resblocks.9.ln_1.weight FLOAT[512] b8e41749eb71
transformer.resblocks.9.ln_2.bias FLOAT[512] 1c68e3290a76
transformer.resblocks.9.ln_2.weight FLOAT[512] 7772beca12dd
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 5a236b373f44
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] ed3b48323b40
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[512,2048] 59def2c7a56c
val_11 FLOAT[2048,512] af14623dc9e4
val_12 FLOAT[512,1536] f06ae76b18a6
val_13 FLOAT[512,2048] 244884f253b2
val_14 FLOAT[2048,512] e62e85f1e212
val_15 FLOAT[512,1536] 668088ad885a
val_16 FLOAT[512,2048] b1a5839428c1
val_17 FLOAT[2048,512] 8b3d904fcc83
val_18 FLOAT[512,1536] 00d1421019a0
val_19 FLOAT[512,2048] 62e5a7d33595
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[2048,512] 685cc50db46d
val_21 FLOAT[512,1536] 41e23e107cf9
val_22 FLOAT[512,2048] 837f37fe2b71
val_23 FLOAT[2048,512] 55c66c6e4296
val_24 FLOAT[512,1536] 6df593f84b1c
val_25 FLOAT[512,2048] 78ed49c9aeb5
val_26 FLOAT[2048,512] f7ccd6dce279
val_27 FLOAT[512,1536] 5ab25092c3b2
val_28 FLOAT[512,2048] 7d580913bfdf
val_29 FLOAT[2048,512] 7ec6dab7b80b
val_3 FLOAT[512,1536] e30842bddeb9
val_30 FLOAT[512,1536] 082f691d1414
val_31 FLOAT[512,2048] 41f2d91e6c06
val_32 FLOAT[2048,512] ab7ede40debe
val_33 FLOAT[512,1536] a6866bff0e8b
val_34 FLOAT[512,2048] 9a195ab34f55
val_35 FLOAT[2048,512] 714bbac934ff
val_36 FLOAT[512,1536] c4fdd3faf4c6
val_37 FLOAT[512,2048] 8eaab1d43e5e
val_38 FLOAT[2048,512] 84f9a65093ad
val_4 FLOAT[512,2048] 1697d8e9bd2f
val_5 FLOAT[2048,512] 964e7980fcec
val_6 FLOAT[512,1536] 85f0430f0ab0
val_7 FLOAT[512,2048] eb4a9cfd6600
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[2048,512] f905375e5fab
val_9 FLOAT[512,1536] 29ee73e86c54
+636
View File
@@ -0,0 +1,636 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,197,768] add_1000
float[batch,197,768] add_1029
float[batch,197,768] add_1144
float[batch,197,768] add_1173
float[batch,197,768] add_1288
float[batch,197,768] add_1317
float[batch,197,768] add_136
float[batch,197,768] add_1432
float[batch,197,768] add_1461
float[batch,197,768] add_1576
float[batch,197,768] add_1605
float[batch,1,768] add_1605_pooled
float[batch,197,768] add_165
float[batch,197,768] add_17
float[batch,1,768] add_1720
float[batch,1,768] add_1749
float[batch,197,768] add_280
float[batch,197,768] add_309
float[batch,197,768] add_424
float[batch,197,768] add_453
float[batch,197,768] add_568
float[batch,197,768] add_597
float[batch,197,768] add_712
float[batch,197,768] add_741
float[batch,197,768] add_856
float[batch,197,768] add_885
float[batch,1] clamp_min
float[batch,768,14,14] conv2d
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,197,768] layer_norm
float[batch,197,768] layer_norm_1
float[batch,197,768] layer_norm_10
float[batch,197,768] layer_norm_11
float[batch,197,768] layer_norm_12
float[batch,197,768] layer_norm_13
float[batch,197,768] layer_norm_14
float[batch,197,768] layer_norm_15
float[batch,197,768] layer_norm_16
float[batch,197,768] layer_norm_17
float[batch,197,768] layer_norm_18
float[batch,197,768] layer_norm_19
float[batch,197,768] layer_norm_2
float[batch,197,768] layer_norm_20
float[batch,197,768] layer_norm_21
float[batch,197,768] layer_norm_22
float[batch,197,768] layer_norm_23
float[batch,1,768] layer_norm_24
float[batch,197,768] layer_norm_3
float[batch,197,768] layer_norm_4
float[batch,197,768] layer_norm_5
float[batch,197,768] layer_norm_6
float[batch,197,768] layer_norm_7
float[batch,197,768] layer_norm_8
float[batch,197,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,197,3072] linear_10
float[batch,197,768] linear_11
float[batch,197,3072] linear_14
float[batch,197,768] linear_15
float[batch,197,3072] linear_18
float[batch,197,768] linear_19
float[batch,197,3072] linear_2
float[batch,197,3072] linear_22
float[batch,197,768] linear_23
float[batch,197,3072] linear_26
float[batch,197,768] linear_27
float[batch,197,768] linear_3
float[batch,197,3072] linear_30
float[batch,197,768] linear_31
float[batch,197,3072] linear_34
float[batch,197,768] linear_35
float[batch,197,3072] linear_38
float[batch,197,768] linear_39
float[batch,197,3072] linear_42
float[batch,197,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,197,3072] linear_6
float[batch,197,768] linear_7
float[batch,512] matmul
float[batch,197,3072] mul_1078
float[batch,197,3072] mul_1083
float[batch,197,3072] mul_115
float[batch,197,3072] mul_1185
float[batch,197,3072] mul_1190
float[batch,197,3072] mul_120
float[batch,1,3072] mul_1292
float[batch,1,3072] mul_1297
float[batch,197,3072] mul_222
float[batch,197,3072] mul_227
float[batch,197,3072] mul_329
float[batch,197,3072] mul_334
float[batch,197,3072] mul_436
float[batch,197,3072] mul_441
float[batch,197,3072] mul_543
float[batch,197,3072] mul_548
float[batch,197,3072] mul_650
float[batch,197,3072] mul_655
float[batch,197,3072] mul_757
float[batch,197,3072] mul_762
float[batch,197,3072] mul_864
float[batch,197,3072] mul_869
float[batch,197,3072] mul_971
float[batch,197,3072] mul_976
float[batch,197,768] node_scaled_dot_product_attention_10_k
float[batch,197,768] node_scaled_dot_product_attention_10_out
float[batch,197,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_10_q
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv
float[batch,197,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_10_v
float[batch,197,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv
float[batch,197,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_11_v
float[batch,197,768] node_scaled_dot_product_attention_1_k
float[batch,197,768] node_scaled_dot_product_attention_1_out
float[batch,197,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_1_q
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv
float[batch,197,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_1_v
float[batch,197,768] node_scaled_dot_product_attention_2_k
float[batch,197,768] node_scaled_dot_product_attention_2_out
float[batch,197,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_2_q
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv
float[batch,197,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_2_v
float[batch,197,768] node_scaled_dot_product_attention_3_k
float[batch,197,768] node_scaled_dot_product_attention_3_out
float[batch,197,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_3_q
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv
float[batch,197,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_3_v
float[batch,197,768] node_scaled_dot_product_attention_4_k
float[batch,197,768] node_scaled_dot_product_attention_4_out
float[batch,197,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_4_q
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv
float[batch,197,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_4_v
float[batch,197,768] node_scaled_dot_product_attention_5_k
float[batch,197,768] node_scaled_dot_product_attention_5_out
float[batch,197,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_5_q
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv
float[batch,197,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_5_v
float[batch,197,768] node_scaled_dot_product_attention_6_k
float[batch,197,768] node_scaled_dot_product_attention_6_out
float[batch,197,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_6_q
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv
float[batch,197,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_6_v
float[batch,197,768] node_scaled_dot_product_attention_7_k
float[batch,197,768] node_scaled_dot_product_attention_7_out
float[batch,197,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_7_q
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv
float[batch,197,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_7_v
float[batch,197,768] node_scaled_dot_product_attention_8_k
float[batch,197,768] node_scaled_dot_product_attention_8_out
float[batch,197,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_8_q
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv
float[batch,197,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_8_v
float[batch,197,768] node_scaled_dot_product_attention_9_k
float[batch,197,768] node_scaled_dot_product_attention_9_out
float[batch,197,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_9_q
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv
float[batch,197,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_9_v
float[batch,197,768] node_scaled_dot_product_attention_k
float[batch,197,768] node_scaled_dot_product_attention_out
float[batch,197,768] node_scaled_dot_product_attention_out_mm_out
float[batch,197,768] node_scaled_dot_product_attention_q
float[batch,197,2304] node_scaled_dot_product_attention_qkv
float[batch,197,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,197,768] node_scaled_dot_product_attention_v
float[batch,196,768] permute
float[batch,197,768] scaled_dot_product_attention
float[batch,197,768] scaled_dot_product_attention_1
float[batch,197,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,197,768] scaled_dot_product_attention_2
float[batch,197,768] scaled_dot_product_attention_3
float[batch,197,768] scaled_dot_product_attention_4
float[batch,197,768] scaled_dot_product_attention_5
float[batch,197,768] scaled_dot_product_attention_6
float[batch,197,768] scaled_dot_product_attention_7
float[batch,197,768] scaled_dot_product_attention_8
float[batch,197,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,197,3072] sigmoid
float[batch,197,3072] sigmoid_1
float[batch,197,3072] sigmoid_10
float[batch,1,3072] sigmoid_11
float[batch,197,3072] sigmoid_2
float[batch,197,3072] sigmoid_3
float[batch,197,3072] sigmoid_4
float[batch,197,3072] sigmoid_5
float[batch,197,3072] sigmoid_6
float[batch,197,3072] sigmoid_7
float[batch,197,3072] sigmoid_8
float[batch,197,3072] sigmoid_9
float[batch,197,768] val_44
float[batch,197,3072] val_45
float[batch,197,768] val_46
float[batch,197,3072] val_47
float[batch,197,768] val_48
float[batch,197,3072] val_49
float[batch,197,768] val_50
float[batch,197,3072] val_51
float[batch,197,768] val_52
float[batch,197,3072] val_53
float[batch,197,768] val_54
float[batch,197,3072] val_55
float[batch,197,768] val_56
float[batch,197,3072] val_57
float[batch,197,768] val_58
float[batch,197,3072] val_59
float[batch,197,768] val_60
float[batch,197,3072] val_61
float[batch,197,768] val_62
float[batch,197,3072] val_63
float[batch,197,768] val_64
float[batch,197,3072] val_65
float[batch,197,768] val_66
float[batch,1,3072] val_67
float[batch,1,768] val_68
float[batch,768] val_69
float[batch,768,196] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [16, 16]> (image_chw, "visual.conv1.weight", node_Conv_705_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_44 = Pad (permute, val_4, val_5)
add_17 = Add (val_44, val_43)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_7)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_45 = MatMul (layer_norm_2, val_8)
linear_2 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_fc.bias")
mul_115 = Mul (linear_2, val_3)
[node_sigmoid] sigmoid = Sigmoid (mul_115)
mul_120 = Mul (linear_2, sigmoid)
val_46 = MatMul (mul_120, val_9)
linear_3 = Add (val_46, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_165 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_165, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_10)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_280 = Add (add_165, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_280, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_47 = MatMul (layer_norm_4, val_11)
linear_6 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_fc.bias")
mul_222 = Mul (linear_6, val_3)
sigmoid_1 = Sigmoid (mul_222)
mul_227 = Mul (linear_6, sigmoid_1)
val_48 = MatMul (mul_227, val_12)
linear_7 = Add (val_48, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_309 = Add (add_280, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_309, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_13)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_424 = Add (add_309, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_424, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_49 = MatMul (layer_norm_6, val_14)
linear_10 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_fc.bias")
mul_329 = Mul (linear_10, val_3)
sigmoid_2 = Sigmoid (mul_329)
mul_334 = Mul (linear_10, sigmoid_2)
val_50 = MatMul (mul_334, val_15)
linear_11 = Add (val_50, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_453 = Add (add_424, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_453, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_16)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_568 = Add (add_453, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_568, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_51 = MatMul (layer_norm_8, val_17)
linear_14 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_fc.bias")
mul_436 = Mul (linear_14, val_3)
sigmoid_3 = Sigmoid (mul_436)
mul_441 = Mul (linear_14, sigmoid_3)
val_52 = MatMul (mul_441, val_18)
linear_15 = Add (val_52, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_597 = Add (add_568, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_597, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_19)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_712 = Add (add_597, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_712, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_53 = MatMul (layer_norm_10, val_20)
linear_18 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_fc.bias")
mul_543 = Mul (linear_18, val_3)
sigmoid_4 = Sigmoid (mul_543)
mul_548 = Mul (linear_18, sigmoid_4)
val_54 = MatMul (mul_548, val_21)
linear_19 = Add (val_54, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_741 = Add (add_712, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_741, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_22)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_856 = Add (add_741, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_856, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_55 = MatMul (layer_norm_12, val_23)
linear_22 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_fc.bias")
mul_650 = Mul (linear_22, val_3)
sigmoid_5 = Sigmoid (mul_650)
mul_655 = Mul (linear_22, sigmoid_5)
val_56 = MatMul (mul_655, val_24)
linear_23 = Add (val_56, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_885 = Add (add_856, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_885, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_25)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_1000 = Add (add_885, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1000, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_57 = MatMul (layer_norm_14, val_26)
linear_26 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_fc.bias")
mul_757 = Mul (linear_26, val_3)
sigmoid_6 = Sigmoid (mul_757)
mul_762 = Mul (linear_26, sigmoid_6)
val_58 = MatMul (mul_762, val_27)
linear_27 = Add (val_58, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_1029 = Add (add_1000, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1029, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_28)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1144 = Add (add_1029, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1144, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_59 = MatMul (layer_norm_16, val_29)
linear_30 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_fc.bias")
mul_864 = Mul (linear_30, val_3)
sigmoid_7 = Sigmoid (mul_864)
mul_869 = Mul (linear_30, sigmoid_7)
val_60 = MatMul (mul_869, val_30)
linear_31 = Add (val_60, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1173 = Add (add_1144, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1173, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_31)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1288 = Add (add_1173, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1288, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_61 = MatMul (layer_norm_18, val_32)
linear_34 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_fc.bias")
mul_971 = Mul (linear_34, val_3)
sigmoid_8 = Sigmoid (mul_971)
mul_976 = Mul (linear_34, sigmoid_8)
val_62 = MatMul (mul_976, val_33)
linear_35 = Add (val_62, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1317 = Add (add_1288, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1317, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_34)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1432 = Add (add_1317, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1432, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_63 = MatMul (layer_norm_20, val_35)
linear_38 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_fc.bias")
mul_1078 = Mul (linear_38, val_3)
sigmoid_9 = Sigmoid (mul_1078)
mul_1083 = Mul (linear_38, sigmoid_9)
val_64 = MatMul (mul_1083, val_36)
linear_39 = Add (val_64, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1461 = Add (add_1432, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1461, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_37)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1576 = Add (add_1461, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1576, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_65 = MatMul (layer_norm_22, val_38)
linear_42 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_fc.bias")
mul_1185 = Mul (linear_42, val_3)
sigmoid_10 = Sigmoid (mul_1185)
mul_1190 = Mul (linear_42, sigmoid_10)
val_66 = MatMul (mul_1190, val_39)
linear_43 = Add (val_66, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1605 = Add (add_1576, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1605, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_40)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_6, val_6)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1605] add_1605_pooled = Slice (add_1605, val_2, val_6, val_6)
add_1720 = Add (add_1605_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1720, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_67 = MatMul (layer_norm_24, val_41)
linear_46 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_fc.bias")
mul_1292 = Mul (linear_46, val_3)
sigmoid_11 = Sigmoid (mul_1292)
mul_1297 = Mul (linear_46, sigmoid_11)
val_68 = MatMul (mul_1297, val_42)
linear_47 = Add (val_68, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1749 = Add (add_1720, linear_47)
val_69 = Squeeze (add_1749, val_6)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_69, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_Conv_705_fused_bias FLOAT[768] c40ffda48f8a
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 1ad1f076ccb7
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] c13013ddbda2
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 91e7be60f19f
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 93cfa5420401
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] de0b3e2fc11a
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] a68a625fc370
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] b4bdc9f4bc2e
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] ff3036251b9c
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] af49535ad1f2
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] af5a60d3389a
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ae03736fb9eb
node_scaled_dot_product_attention_wo_t FLOAT[768,768] f905b88acc02
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,2304] 71401fc0b991
val_11 FLOAT[768,3072] 96a31ac30b7a
val_12 FLOAT[3072,768] 9b7c96164d75
val_13 FLOAT[768,2304] 71483aa8fe87
val_14 FLOAT[768,3072] 5b7deac7103a
val_15 FLOAT[3072,768] 3be550aa13c0
val_16 FLOAT[768,2304] c46183cf685b
val_17 FLOAT[768,3072] 263e9b643b68
val_18 FLOAT[3072,768] 050336b95216
val_19 FLOAT[768,2304] 069b71baea59
val_2 INT64[1] af5570f5a181
val_20 FLOAT[768,3072] 348aaa71fc47
val_21 FLOAT[3072,768] 54f1fcb49aa0
val_22 FLOAT[768,2304] a4763f728f94
val_23 FLOAT[768,3072] 15dd79e20ac6
val_24 FLOAT[3072,768] 4ec29bafb718
val_25 FLOAT[768,2304] b0451061edb8
val_26 FLOAT[768,3072] 012d75faf343
val_27 FLOAT[3072,768] c0f52e473ca5
val_28 FLOAT[768,2304] 0bcd6d42867b
val_29 FLOAT[768,3072] a4c4c0ecb4e5
val_3 FLOAT[] c2e7ddfe3114
val_30 FLOAT[3072,768] fcf3d5215902
val_31 FLOAT[768,2304] 49be030d69fb
val_32 FLOAT[768,3072] 26e20ccfbd11
val_33 FLOAT[3072,768] df2ea88f89d1
val_34 FLOAT[768,2304] b9f7a9ad02fc
val_35 FLOAT[768,3072] 0542c1b0caaa
val_36 FLOAT[3072,768] 7f735d2590a5
val_37 FLOAT[768,2304] 963d91b70c10
val_38 FLOAT[768,3072] deb0df6308f2
val_39 FLOAT[3072,768] b5a2b4aa8427
val_4 INT64[6] 6b7d92eaae70
val_40 FLOAT[768,2304] c45112474480
val_41 FLOAT[768,3072] ff90d7d2c1df
val_42 FLOAT[3072,768] aef7330292af
val_43 FLOAT[1,197,768] 769c0693b525
val_5 FLOAT[] df3f619804a9
val_6 INT64[1] 7c9fa136d441
val_7 FLOAT[768,2304] 27bc559a4aea
val_8 FLOAT[768,3072] 82a7398df74a
val_9 FLOAT[3072,768] 04f3371cb9ef
view_target INT64[3] 8931c30473a4
visual.conv1.weight FLOAT[768,3,16,16] ad4969e71e25
visual.ln_post.bias FLOAT[768] c402867ef64d
visual.ln_post.weight FLOAT[768] 54f88ce89c9d
visual.ln_pre.bias FLOAT[768] 29a9676eb8d0
visual.ln_pre.weight FLOAT[768] f7173fe4a5d3
visual.proj FLOAT[768,512] f5ef5771689d
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] ce0540c1f77d
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] ca8aa74f2eba
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] a4d1ce907f65
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] f067dd32bd40
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] ccd947aabcec
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] 3d2df02a846b
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] aa7e21afdd19
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 340c7d883a0a
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 8022651751e5
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] d4bb78c8771a
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 40f96f670cb7
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] ca51989797ba
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] c801e5f224a0
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 122a2680d2e5
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 5d5ffbf085e4
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 424316d4e205
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 3307230fc400
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 814de27cf9db
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] b90515e51052
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] a23b987b8280
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] 882a59a62740
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 578c419efc13
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] f6377f051d20
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 9eb555d14abe
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] cdb80a414563
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 066351376348
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] c95492f08ca8
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] 38cbe27a0988
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 9b9cd503462d
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] c61b76dbe9af
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 09d109383380
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] db36bfcced1d
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 23ee979812e0
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] dbe4f61cfeac
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] fc82d14454e2
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] 86b8753e1ab0
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] 7780180e4390
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 48cec34c850a
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] a95e03c36bb4
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] b550ce90e66f
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 9f578bbef460
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 9b408113f8a3
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 298d4a878465
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] d978a816b920
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] 56a053405a9c
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] dc3048a24828
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] daf2679d74ea
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] ae1d6c329641
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] d7bbafb85436
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 458a5210f61e
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] ce30a3ca73f9
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 5f4501f6798b
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 2d393243d459
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] 330c26db47ef
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 6f2a0a3f1b58
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 92c607f5cc12
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] ff81daf918d8
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] d94c7a68fff0
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 35972db6fc95
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] b9b750772d5e
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] 9a4eed89b987
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 09ff63a74381
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] e2b4e8cd9f0a
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 81981887ef1d
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 796fa548546d
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 3ecd4b73ea4a
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 302872a0c819
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] 500deaa33aaf
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 1737efe27bf0
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] c4bf292bf280
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 98f0d9af8af9
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] b3f41fc00d68
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 26ce164cf6be
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] d9fbe2be13b6
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] bd2d7e09e504
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] d4704d7e5f5f
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] 53ee897e6707
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] a6e8d3427838
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] d6db17a6730a
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] c067268f1808
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 9df67ee4c10d
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 1905e73629a0
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] bf3d1d2dee94
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 91afe398b104
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] da95178f194b
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] df725b3a58a4
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] b1727f16a22e
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 3b76a5688e84
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] b3fe58ac77c0
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 3ff5b8e6816b
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] f1882981be7d
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 42991ee850cf
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 47dc5a06d806
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] 01ba8750d39c
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] d4ddb225632a
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] a64492bef856
@@ -0,0 +1,571 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,64] text) => (float[batch,768] text_embedding)
<
float[batch,64,768] add_1071
float[batch,64,768] add_1092
float[batch,64,768] add_119
float[batch,64,768] add_1207
float[batch,64,768] add_1228
float[batch,64,768] add_1343
float[batch,64,768] add_1364
float[batch,64,768] add_140
float[batch,64,768] add_1479
float[batch,64,768] add_1500
float[batch,1,768] add_1500_pooled
float[batch,1,768] add_1615
float[batch,1,768] add_1636
float[batch,64,768] add_255
float[batch,64,768] add_276
float[batch,64,768] add_391
float[batch,64,768] add_4
float[batch,64,768] add_412
float[batch,64,768] add_527
float[batch,64,768] add_548
float[batch,64,768] add_663
float[batch,64,768] add_684
float[batch,64,768] add_799
float[batch,64,768] add_820
float[batch,64,768] add_935
float[batch,64,768] add_956
float[batch,1] clamp_min
float[batch,64,768] embedding
float[batch,64,3072] gelu
float[batch,64,3072] gelu_1
float[batch,64,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,64,3072] gelu_2
float[batch,64,3072] gelu_3
float[batch,64,3072] gelu_4
float[batch,64,3072] gelu_5
float[batch,64,3072] gelu_6
float[batch,64,3072] gelu_7
float[batch,64,3072] gelu_8
float[batch,64,3072] gelu_9
float[batch,64,768] layer_norm
float[batch,64,768] layer_norm_1
float[batch,64,768] layer_norm_10
float[batch,64,768] layer_norm_11
float[batch,64,768] layer_norm_12
float[batch,64,768] layer_norm_13
float[batch,64,768] layer_norm_14
float[batch,64,768] layer_norm_15
float[batch,64,768] layer_norm_16
float[batch,64,768] layer_norm_17
float[batch,64,768] layer_norm_18
float[batch,64,768] layer_norm_19
float[batch,64,768] layer_norm_2
float[batch,64,768] layer_norm_20
float[batch,64,768] layer_norm_21
float[batch,64,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,64,768] layer_norm_3
float[batch,64,768] layer_norm_4
float[batch,64,768] layer_norm_5
float[batch,64,768] layer_norm_6
float[batch,64,768] layer_norm_7
float[batch,64,768] layer_norm_8
float[batch,64,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,64,3072] linear_10
float[batch,64,768] linear_11
float[batch,64,3072] linear_14
float[batch,64,768] linear_15
float[batch,64,3072] linear_18
float[batch,64,768] linear_19
float[batch,64,3072] linear_2
float[batch,64,3072] linear_22
float[batch,64,768] linear_23
float[batch,64,3072] linear_26
float[batch,64,768] linear_27
float[batch,64,768] linear_3
float[batch,64,3072] linear_30
float[batch,64,768] linear_31
float[batch,64,3072] linear_34
float[batch,64,768] linear_35
float[batch,64,3072] linear_38
float[batch,64,768] linear_39
float[batch,64,3072] linear_42
float[batch,64,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,768] linear_48
float[batch,64,3072] linear_6
float[batch,64,768] linear_7
float[batch,64,768] node_scaled_dot_product_attention_10_k
float[batch,64,768] node_scaled_dot_product_attention_10_out
float[batch,64,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_q
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv
float[batch,64,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_10_v
float[batch,64,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv
float[batch,64,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_11_v
float[batch,64,768] node_scaled_dot_product_attention_1_k
float[batch,64,768] node_scaled_dot_product_attention_1_out
float[batch,64,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_q
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv
float[batch,64,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_1_v
float[batch,64,768] node_scaled_dot_product_attention_2_k
float[batch,64,768] node_scaled_dot_product_attention_2_out
float[batch,64,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_q
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv
float[batch,64,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_2_v
float[batch,64,768] node_scaled_dot_product_attention_3_k
float[batch,64,768] node_scaled_dot_product_attention_3_out
float[batch,64,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_q
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv
float[batch,64,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_3_v
float[batch,64,768] node_scaled_dot_product_attention_4_k
float[batch,64,768] node_scaled_dot_product_attention_4_out
float[batch,64,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_q
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv
float[batch,64,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_4_v
float[batch,64,768] node_scaled_dot_product_attention_5_k
float[batch,64,768] node_scaled_dot_product_attention_5_out
float[batch,64,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_q
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv
float[batch,64,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_5_v
float[batch,64,768] node_scaled_dot_product_attention_6_k
float[batch,64,768] node_scaled_dot_product_attention_6_out
float[batch,64,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_q
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv
float[batch,64,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_6_v
float[batch,64,768] node_scaled_dot_product_attention_7_k
float[batch,64,768] node_scaled_dot_product_attention_7_out
float[batch,64,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_q
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv
float[batch,64,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_7_v
float[batch,64,768] node_scaled_dot_product_attention_8_k
float[batch,64,768] node_scaled_dot_product_attention_8_out
float[batch,64,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_q
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv
float[batch,64,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_8_v
float[batch,64,768] node_scaled_dot_product_attention_9_k
float[batch,64,768] node_scaled_dot_product_attention_9_out
float[batch,64,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_q
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv
float[batch,64,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_9_v
float[batch,64,768] node_scaled_dot_product_attention_k
float[batch,64,768] node_scaled_dot_product_attention_out
float[batch,64,768] node_scaled_dot_product_attention_out_mm_out
float[batch,64,768] node_scaled_dot_product_attention_q
float[batch,64,2304] node_scaled_dot_product_attention_qkv
float[batch,64,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,64,768] node_scaled_dot_product_attention_v
float[batch,64,768] scaled_dot_product_attention
float[batch,64,768] scaled_dot_product_attention_1
float[batch,64,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,64,768] scaled_dot_product_attention_2
float[batch,64,768] scaled_dot_product_attention_3
float[batch,64,768] scaled_dot_product_attention_4
float[batch,64,768] scaled_dot_product_attention_5
float[batch,64,768] scaled_dot_product_attention_6
float[batch,64,768] scaled_dot_product_attention_7
float[batch,64,768] scaled_dot_product_attention_8
float[batch,64,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,64,3072] val_41
float[batch,64,768] val_42
float[batch,64,3072] val_43
float[batch,64,768] val_44
float[batch,64,3072] val_45
float[batch,64,768] val_46
float[batch,64,3072] val_47
float[batch,64,768] val_48
float[batch,64,3072] val_49
float[batch,64,768] val_50
float[batch,64,3072] val_51
float[batch,64,768] val_52
float[batch,64,3072] val_53
float[batch,64,768] val_54
float[batch,64,3072] val_55
float[batch,64,768] val_56
float[batch,64,3072] val_57
float[batch,64,768] val_58
float[batch,64,3072] val_59
float[batch,64,768] val_60
float[batch,64,3072] val_61
float[batch,64,768] val_62
float[batch,1,3072] val_63
float[batch,1,768] val_64
float[batch,768] val_65
>
{
val_40 = Gather <axis: int = 0> ("text.token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_40)
add_4 = Add (embedding, "text.positional_embedding")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_4, "text.transformer.resblocks.0.ln_1.weight", "text.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_4)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "text.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "text.transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_119, "text.transformer.resblocks.0.ln_2.weight", "text.transformer.resblocks.0.ln_2.bias")
val_41 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_41, "text.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "tanh"> (linear_2)
val_42 = MatMul (gelu, val_6)
linear_3 = Add (val_42, "text.transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_140, "text.transformer.resblocks.1.ln_1.weight", "text.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_7)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "text.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "text.transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_255, "text.transformer.resblocks.1.ln_2.weight", "text.transformer.resblocks.1.ln_2.bias")
val_43 = MatMul (layer_norm_3, val_8)
linear_6 = Add (val_43, "text.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "tanh"> (linear_6)
val_44 = MatMul (gelu_1, val_9)
linear_7 = Add (val_44, "text.transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_276, "text.transformer.resblocks.2.ln_1.weight", "text.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_10)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "text.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "text.transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_391, "text.transformer.resblocks.2.ln_2.weight", "text.transformer.resblocks.2.ln_2.bias")
val_45 = MatMul (layer_norm_5, val_11)
linear_10 = Add (val_45, "text.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "tanh"> (linear_10)
val_46 = MatMul (gelu_2, val_12)
linear_11 = Add (val_46, "text.transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_412, "text.transformer.resblocks.3.ln_1.weight", "text.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_13)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "text.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "text.transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_527, "text.transformer.resblocks.3.ln_2.weight", "text.transformer.resblocks.3.ln_2.bias")
val_47 = MatMul (layer_norm_7, val_14)
linear_14 = Add (val_47, "text.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "tanh"> (linear_14)
val_48 = MatMul (gelu_3, val_15)
linear_15 = Add (val_48, "text.transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_548, "text.transformer.resblocks.4.ln_1.weight", "text.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_16)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "text.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "text.transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_663, "text.transformer.resblocks.4.ln_2.weight", "text.transformer.resblocks.4.ln_2.bias")
val_49 = MatMul (layer_norm_9, val_17)
linear_18 = Add (val_49, "text.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "tanh"> (linear_18)
val_50 = MatMul (gelu_4, val_18)
linear_19 = Add (val_50, "text.transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_684, "text.transformer.resblocks.5.ln_1.weight", "text.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_19)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "text.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "text.transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_799, "text.transformer.resblocks.5.ln_2.weight", "text.transformer.resblocks.5.ln_2.bias")
val_51 = MatMul (layer_norm_11, val_20)
linear_22 = Add (val_51, "text.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "tanh"> (linear_22)
val_52 = MatMul (gelu_5, val_21)
linear_23 = Add (val_52, "text.transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_820, "text.transformer.resblocks.6.ln_1.weight", "text.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_22)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "text.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "text.transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_935, "text.transformer.resblocks.6.ln_2.weight", "text.transformer.resblocks.6.ln_2.bias")
val_53 = MatMul (layer_norm_13, val_23)
linear_26 = Add (val_53, "text.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "tanh"> (linear_26)
val_54 = MatMul (gelu_6, val_24)
linear_27 = Add (val_54, "text.transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_956, "text.transformer.resblocks.7.ln_1.weight", "text.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_25)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "text.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "text.transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1071, "text.transformer.resblocks.7.ln_2.weight", "text.transformer.resblocks.7.ln_2.bias")
val_55 = MatMul (layer_norm_15, val_26)
linear_30 = Add (val_55, "text.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "tanh"> (linear_30)
val_56 = MatMul (gelu_7, val_27)
linear_31 = Add (val_56, "text.transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1092, "text.transformer.resblocks.8.ln_1.weight", "text.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_28)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "text.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "text.transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1207, "text.transformer.resblocks.8.ln_2.weight", "text.transformer.resblocks.8.ln_2.bias")
val_57 = MatMul (layer_norm_17, val_29)
linear_34 = Add (val_57, "text.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "tanh"> (linear_34)
val_58 = MatMul (gelu_8, val_30)
linear_35 = Add (val_58, "text.transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1228, "text.transformer.resblocks.9.ln_1.weight", "text.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_31)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "text.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "text.transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1343, "text.transformer.resblocks.9.ln_2.weight", "text.transformer.resblocks.9.ln_2.bias")
val_59 = MatMul (layer_norm_19, val_32)
linear_38 = Add (val_59, "text.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "tanh"> (linear_38)
val_60 = MatMul (gelu_9, val_33)
linear_39 = Add (val_60, "text.transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1364, "text.transformer.resblocks.10.ln_1.weight", "text.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_34)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "text.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "text.transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1479, "text.transformer.resblocks.10.ln_2.weight", "text.transformer.resblocks.10.ln_2.bias")
val_61 = MatMul (layer_norm_21, val_35)
linear_42 = Add (val_61, "text.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "tanh"> (linear_42)
val_62 = MatMul (gelu_10, val_36)
linear_43 = Add (val_62, "text.transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1500, "text.transformer.resblocks.11.ln_1.weight", "text.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_37)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "text.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_0, val_3, val_2)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "text.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = Slice (add_1500, val_0, val_3, val_2)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1615, "text.transformer.resblocks.11.ln_2.weight", "text.transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_38)
linear_46 = Add (val_63, "text.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "tanh"> (linear_46)
val_64 = MatMul (gelu_11, val_39)
linear_47 = Add (val_64, "text.transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = Squeeze (add_1636, val_2)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (val_65, "text.ln_final.weight", "text.ln_final.bias")
linear_48 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (select_36, "text.text_projection.weight", "text.text_projection.bias")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_48, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (linear_48, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] aa400adccad5
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 2a9e81198efa
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 0f805c31fb1b
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] a8d124f22d7a
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 185c693e0c2c
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] abf692d9b87f
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] ca7ef5df9d7a
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 3368ba1ecd02
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] b91f6a449ce9
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 8cca57ee8401
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 7b15fadd11ed
node_scaled_dot_product_attention_wo_t FLOAT[768,768] f84ac618da62
text.ln_final.bias FLOAT[768] 6da1352266e1
text.ln_final.weight FLOAT[768] 37d73a85d5f8
text.positional_embedding FLOAT[64,768] 23dc9ceff936
text.text_projection.bias FLOAT[768] 47005c8ec702
text.text_projection.weight FLOAT[768,768] db32899af4ca
text.token_embedding.weight_fp16 FLOAT16[256000,768] bf14662eb88a
text.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 35d2591be9f6
text.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 68388a643650
text.transformer.resblocks.0.ln_1.bias FLOAT[768] 42f2a3c688e0
text.transformer.resblocks.0.ln_1.weight FLOAT[768] 23b58c8e2128
text.transformer.resblocks.0.ln_2.bias FLOAT[768] 84458c1960b6
text.transformer.resblocks.0.ln_2.weight FLOAT[768] 8a670c1eebf9
text.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] b28fc4bdb293
text.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 656e3ab4f322
text.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] c35e2cd56272
text.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 9234854938f9
text.transformer.resblocks.1.ln_1.bias FLOAT[768] b75586bac9d6
text.transformer.resblocks.1.ln_1.weight FLOAT[768] 087c09f55be2
text.transformer.resblocks.1.ln_2.bias FLOAT[768] ce757c4cc4c0
text.transformer.resblocks.1.ln_2.weight FLOAT[768] 452a30f922fc
text.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 64c7502d4a8d
text.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 2eb5161b0d93
text.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 3dd858730c22
text.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] bc18c6f8cdf5
text.transformer.resblocks.10.ln_1.bias FLOAT[768] f07fb9401ca9
text.transformer.resblocks.10.ln_1.weight FLOAT[768] 5a0926b12dd8
text.transformer.resblocks.10.ln_2.bias FLOAT[768] 7e3d89f65dd4
text.transformer.resblocks.10.ln_2.weight FLOAT[768] 2edba5efdc04
text.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 9e04455709fd
text.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] eec7c8c99700
text.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] bf6875550027
text.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] af46b7444c44
text.transformer.resblocks.11.ln_1.bias FLOAT[768] 8a6bcd0e70ea
text.transformer.resblocks.11.ln_1.weight FLOAT[768] 837aa3b3d186
text.transformer.resblocks.11.ln_2.bias FLOAT[768] 92f2f67bdfbd
text.transformer.resblocks.11.ln_2.weight FLOAT[768] 17d047c4d64c
text.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] d314ee9febc0
text.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 7c19dc977118
text.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 7697f1f49fab
text.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] ce043dfbfbe6
text.transformer.resblocks.2.ln_1.bias FLOAT[768] d5c3984c9d8d
text.transformer.resblocks.2.ln_1.weight FLOAT[768] 744f33bf4967
text.transformer.resblocks.2.ln_2.bias FLOAT[768] a50719e3f10d
text.transformer.resblocks.2.ln_2.weight FLOAT[768] 33cf6f84325b
text.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 0abf247807ad
text.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] e1d003b3f975
text.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 585568d956bc
text.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 68cd5d356e22
text.transformer.resblocks.3.ln_1.bias FLOAT[768] c60950eb8280
text.transformer.resblocks.3.ln_1.weight FLOAT[768] ecf30d7ada9a
text.transformer.resblocks.3.ln_2.bias FLOAT[768] 6b73e4012a61
text.transformer.resblocks.3.ln_2.weight FLOAT[768] 3c14791f03ac
text.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 09f3c496ccb0
text.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 3dc9c3ad2366
text.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 64c0a9acf180
text.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] fbf6f2709915
text.transformer.resblocks.4.ln_1.bias FLOAT[768] c1cca40c46ff
text.transformer.resblocks.4.ln_1.weight FLOAT[768] 5e2128867f30
text.transformer.resblocks.4.ln_2.bias FLOAT[768] 4cfcec4c7f8c
text.transformer.resblocks.4.ln_2.weight FLOAT[768] a4e1941f2bb9
text.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 4121fbfc5a05
text.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] a1c375b573f3
text.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] b8aea6435a1a
text.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] ff3a089d6a24
text.transformer.resblocks.5.ln_1.bias FLOAT[768] b70baa383b75
text.transformer.resblocks.5.ln_1.weight FLOAT[768] 9118bd7b1baf
text.transformer.resblocks.5.ln_2.bias FLOAT[768] fa31b95fb0ba
text.transformer.resblocks.5.ln_2.weight FLOAT[768] cacb4c5040ab
text.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 7552b5ca82d2
text.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] b4ecd293489e
text.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 53f0546e763c
text.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] e882bda70649
text.transformer.resblocks.6.ln_1.bias FLOAT[768] b79cea976417
text.transformer.resblocks.6.ln_1.weight FLOAT[768] cba4ad83925a
text.transformer.resblocks.6.ln_2.bias FLOAT[768] 2167341e4407
text.transformer.resblocks.6.ln_2.weight FLOAT[768] c67dbc54aae7
text.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 9f658049e426
text.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 81f0481c5d34
text.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 657102827727
text.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 26efa7bdee2f
text.transformer.resblocks.7.ln_1.bias FLOAT[768] bf12a1867041
text.transformer.resblocks.7.ln_1.weight FLOAT[768] 013494f36e83
text.transformer.resblocks.7.ln_2.bias FLOAT[768] 12d570f5a55d
text.transformer.resblocks.7.ln_2.weight FLOAT[768] e3e6244ce34f
text.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 32bf5676c5f6
text.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 0df00a1b6da2
text.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] b0164e594540
text.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 3bb5ac2cdd4b
text.transformer.resblocks.8.ln_1.bias FLOAT[768] 5e8a4638e6b8
text.transformer.resblocks.8.ln_1.weight FLOAT[768] d54a4480ff52
text.transformer.resblocks.8.ln_2.bias FLOAT[768] f5960b2d72fe
text.transformer.resblocks.8.ln_2.weight FLOAT[768] 71fc10e131e4
text.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] e6d279da057b
text.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] e2dbc2785483
text.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] b297bce6854f
text.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 2311d8fb8da7
text.transformer.resblocks.9.ln_1.bias FLOAT[768] eb4b600dc29a
text.transformer.resblocks.9.ln_1.weight FLOAT[768] 9db3c9acfb1a
text.transformer.resblocks.9.ln_2.bias FLOAT[768] c05caa3fbe24
text.transformer.resblocks.9.ln_2.weight FLOAT[768] 0d9cc80b5984
text.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 492cbfd9b6cf
text.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 4b3ed92dd6d2
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,2304] 8f09b72c8080
val_11 FLOAT[768,3072] 8804c67cc81b
val_12 FLOAT[3072,768] 22bb8ebe5df1
val_13 FLOAT[768,2304] 9a1f28f679a6
val_14 FLOAT[768,3072] 2597d0840a87
val_15 FLOAT[3072,768] 05590428c5a9
val_16 FLOAT[768,2304] b74643d2b342
val_17 FLOAT[768,3072] 1f5392ac1f43
val_18 FLOAT[3072,768] 3b97da7f2fcf
val_19 FLOAT[768,2304] f87ce1bcceb7
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,3072] c72e542335af
val_21 FLOAT[3072,768] 4440b4f6792d
val_22 FLOAT[768,2304] bfbb7dd7971b
val_23 FLOAT[768,3072] 9bdb23333b17
val_24 FLOAT[3072,768] 43544df4b860
val_25 FLOAT[768,2304] 8c317a5d02a5
val_26 FLOAT[768,3072] abc56dd7cf91
val_27 FLOAT[3072,768] aaf870905458
val_28 FLOAT[768,2304] 9c53edca1bd5
val_29 FLOAT[768,3072] 87f390ab6038
val_3 INT64[1] 6a69a6cc7473
val_30 FLOAT[3072,768] 56ae2d299e94
val_31 FLOAT[768,2304] 2d9f754fc602
val_32 FLOAT[768,3072] d16016f3a074
val_33 FLOAT[3072,768] 5db81d2845fc
val_34 FLOAT[768,2304] 8baef6324324
val_35 FLOAT[768,3072] 4ebb456cf1e9
val_36 FLOAT[3072,768] 91e35931efd9
val_37 FLOAT[768,2304] be0bfe45068f
val_38 FLOAT[768,3072] 6f963454c43b
val_39 FLOAT[3072,768] 0a11117b6bfe
val_4 FLOAT[768,2304] 43080deceeb1
val_5 FLOAT[768,3072] 0cddaf8824c6
val_6 FLOAT[3072,768] e46a0dffe010
val_7 FLOAT[768,2304] 8fb85a0785e7
val_8 FLOAT[768,3072] 899c9dc9284f
val_9 FLOAT[3072,768] 89c28a2fb1f4
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,256,256,3] image) => (float[batch,768] image_embedding)
<
float[batch,64,768] add_1007
float[batch,64,768] add_1068
float[batch,64,768] add_107
float[batch,64,768] add_1097
float[batch,1,768] add_1195
float[batch,64,768] add_13
float[batch,64,768] add_168
float[batch,64,768] add_197
float[batch,64,768] add_258
float[batch,64,768] add_287
float[batch,64,768] add_348
float[batch,64,768] add_377
float[batch,64,768] add_438
float[batch,64,768] add_467
float[batch,64,768] add_528
float[batch,64,768] add_557
float[batch,64,768] add_618
float[batch,64,768] add_647
float[batch,64,768] add_708
float[batch,64,768] add_737
float[batch,64,768] add_78
float[batch,64,768] add_798
float[batch,64,768] add_827
float[batch,64,768] add_888
float[batch,64,768] add_917
float[batch,64,768] add_978
float[batch,1] clamp_min
float[batch,768,8,8] conv2d
float[batch,64,3072] gelu
float[batch,64,3072] gelu_1
float[batch,64,3072] gelu_10
float[batch,64,3072] gelu_11
float[batch,1,3072] gelu_12
float[batch,64,3072] gelu_2
float[batch,64,3072] gelu_3
float[batch,64,3072] gelu_4
float[batch,64,3072] gelu_5
float[batch,64,3072] gelu_6
float[batch,64,3072] gelu_7
float[batch,64,3072] gelu_8
float[batch,64,3072] gelu_9
float[batch,3,256,256] image_chw
float[batch] image_ez
float[batch] image_ez_r
float[batch,1,1,1] image_ez_s
float[batch,256,256,3] image_f32
float[batch,64,768] layer_norm
float[batch,64,768] layer_norm_1
float[batch,64,768] layer_norm_10
float[batch,64,768] layer_norm_11
float[batch,64,768] layer_norm_12
float[batch,64,768] layer_norm_13
float[batch,64,768] layer_norm_14
float[batch,64,768] layer_norm_15
float[batch,64,768] layer_norm_16
float[batch,64,768] layer_norm_17
float[batch,64,768] layer_norm_18
float[batch,64,768] layer_norm_19
float[batch,64,768] layer_norm_2
float[batch,64,768] layer_norm_20
float[batch,64,768] layer_norm_21
float[batch,64,768] layer_norm_22
float[batch,64,768] layer_norm_23
float[batch,64,768] layer_norm_24
float[batch,1,768] layer_norm_25
float[batch,64,768] layer_norm_3
float[batch,64,768] layer_norm_4
float[batch,64,768] layer_norm_5
float[batch,64,768] layer_norm_6
float[batch,64,768] layer_norm_7
float[batch,64,768] layer_norm_8
float[batch,64,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,64,2304] linear
float[batch,64,768] linear_1
float[batch,64,3072] linear_10
float[batch,64,768] linear_11
float[batch,64,2304] linear_12
float[batch,64,768] linear_13
float[batch,64,3072] linear_14
float[batch,64,768] linear_15
float[batch,64,2304] linear_16
float[batch,64,768] linear_17
float[batch,64,3072] linear_18
float[batch,64,768] linear_19
float[batch,64,3072] linear_2
float[batch,64,2304] linear_20
float[batch,64,768] linear_21
float[batch,64,3072] linear_22
float[batch,64,768] linear_23
float[batch,64,2304] linear_24
float[batch,64,768] linear_25
float[batch,64,3072] linear_26
float[batch,64,768] linear_27
float[batch,64,2304] linear_28
float[batch,64,768] linear_29
float[batch,64,768] linear_3
float[batch,64,3072] linear_30
float[batch,64,768] linear_31
float[batch,64,2304] linear_32
float[batch,64,768] linear_33
float[batch,64,3072] linear_34
float[batch,64,768] linear_35
float[batch,64,2304] linear_36
float[batch,64,768] linear_37
float[batch,64,3072] linear_38
float[batch,64,768] linear_39
float[batch,64,2304] linear_4
float[batch,64,2304] linear_40
float[batch,64,768] linear_41
float[batch,64,3072] linear_42
float[batch,64,768] linear_43
float[batch,64,2304] linear_44
float[batch,64,768] linear_45
float[batch,64,3072] linear_46
float[batch,64,768] linear_47
float[batch,64,1536] linear_49
float[batch,64,768] linear_5
float[batch,1,768] linear_50
float[batch,1,3072] linear_51
float[batch,1,768] linear_52
float[batch,64,3072] linear_6
float[batch,64,768] linear_7
float[batch,64,2304] linear_8
float[batch,64,768] linear_9
float[batch,64,768] node_scaled_dot_product_attention_10_k
float[batch,64,768] node_scaled_dot_product_attention_10_q
float[batch,64,768] node_scaled_dot_product_attention_10_v
float[batch,64,768] node_scaled_dot_product_attention_11_k
float[batch,64,768] node_scaled_dot_product_attention_11_q
float[batch,64,768] node_scaled_dot_product_attention_11_v
float[batch,64,768] node_scaled_dot_product_attention_12_k
float[batch,1,768] node_scaled_dot_product_attention_12_q
float[batch,1,1] node_scaled_dot_product_attention_12_q_col_out
float[batch,64,768] node_scaled_dot_product_attention_12_v
float[batch,64,768] node_scaled_dot_product_attention_1_k
float[batch,64,768] node_scaled_dot_product_attention_1_q
float[batch,64,768] node_scaled_dot_product_attention_1_v
float[batch,64,768] node_scaled_dot_product_attention_2_k
float[batch,64,768] node_scaled_dot_product_attention_2_q
float[batch,64,768] node_scaled_dot_product_attention_2_v
float[batch,64,768] node_scaled_dot_product_attention_3_k
float[batch,64,768] node_scaled_dot_product_attention_3_q
float[batch,64,768] node_scaled_dot_product_attention_3_v
float[batch,64,768] node_scaled_dot_product_attention_4_k
float[batch,64,768] node_scaled_dot_product_attention_4_q
float[batch,64,768] node_scaled_dot_product_attention_4_v
float[batch,64,768] node_scaled_dot_product_attention_5_k
float[batch,64,768] node_scaled_dot_product_attention_5_q
float[batch,64,768] node_scaled_dot_product_attention_5_v
float[batch,64,768] node_scaled_dot_product_attention_6_k
float[batch,64,768] node_scaled_dot_product_attention_6_q
float[batch,64,768] node_scaled_dot_product_attention_6_v
float[batch,64,768] node_scaled_dot_product_attention_7_k
float[batch,64,768] node_scaled_dot_product_attention_7_q
float[batch,64,768] node_scaled_dot_product_attention_7_v
float[batch,64,768] node_scaled_dot_product_attention_8_k
float[batch,64,768] node_scaled_dot_product_attention_8_q
float[batch,64,768] node_scaled_dot_product_attention_8_v
float[batch,64,768] node_scaled_dot_product_attention_9_k
float[batch,64,768] node_scaled_dot_product_attention_9_q
float[batch,64,768] node_scaled_dot_product_attention_9_v
float[batch,64,768] node_scaled_dot_product_attention_k
float[batch,64,768] node_scaled_dot_product_attention_q
float[batch,64,768] node_scaled_dot_product_attention_v
float[batch,64,768] scaled_dot_product_attention
float[batch,64,768] scaled_dot_product_attention_1
float[batch,64,768] scaled_dot_product_attention_10
float[batch,64,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_12
float[batch,64,768] scaled_dot_product_attention_2
float[batch,64,768] scaled_dot_product_attention_3
float[batch,64,768] scaled_dot_product_attention_4
float[batch,64,768] scaled_dot_product_attention_5
float[batch,64,768] scaled_dot_product_attention_6
float[batch,64,768] scaled_dot_product_attention_7
float[batch,64,768] scaled_dot_product_attention_8
float[batch,64,768] scaled_dot_product_attention_9
float[batch,768] select
float[batch,64,768] transpose
float[batch,64,768] val_100
float[batch,64,3072] val_101
float[batch,64,768] val_102
float[batch,64,1536] val_103
float[batch,1,768] val_104
float[batch,1,3072] val_105
float[batch,1,768] val_106
float[batch,64,2304] val_55
float[batch,64,768] val_56
float[batch,64,3072] val_57
float[batch,64,768] val_58
float[batch,64,2304] val_59
float[batch,64,768] val_60
float[batch,64,3072] val_61
float[batch,64,768] val_62
float[batch,64,2304] val_63
float[batch,64,768] val_64
float[batch,64,3072] val_65
float[batch,64,768] val_66
float[batch,64,2304] val_67
float[batch,64,768] val_68
float[batch,64,3072] val_69
float[batch,64,768] val_70
float[batch,64,2304] val_71
float[batch,64,768] val_72
float[batch,64,3072] val_73
float[batch,64,768] val_74
float[batch,64,2304] val_75
float[batch,64,768] val_76
float[batch,64,3072] val_77
float[batch,64,768] val_78
float[batch,64,2304] val_79
float[batch,64,768] val_80
float[batch,64,3072] val_81
float[batch,64,768] val_82
float[batch,64,2304] val_83
float[batch,64,768] val_84
float[batch,64,3072] val_85
float[batch,64,768] val_86
float[batch,64,2304] val_87
float[batch,64,768] val_88
float[batch,64,3072] val_89
float[batch,64,768] val_90
float[batch,64,2304] val_91
float[batch,64,768] val_92
float[batch,64,3072] val_93
float[batch,64,768] val_94
float[batch,64,2304] val_95
float[batch,64,768] val_96
float[batch,64,3072] val_97
float[batch,64,768] val_98
float[batch,64,2304] val_99
float[batch,768,64] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
[node_conv2d] conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.trunk.patch_embed.proj.weight", "visual.trunk.patch_embed.proj.bias")
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_transpose] transpose = Transpose <perm: ints = [0, 2, 1]> (view)
add_13 = Add (transpose, "visual.trunk.pos_embed")
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_13, "visual.trunk.blocks.0.norm1.weight", "visual.trunk.blocks.0.norm1.bias")
val_55 = MatMul (layer_norm, val_3)
[node_linear] linear = Add (val_55, "visual.trunk.blocks.0.attn.qkv.bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (linear, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
val_56 = MatMul (scaled_dot_product_attention, val_4)
linear_1 = Add (val_56, "visual.trunk.blocks.0.attn.proj.bias")
add_78 = Add (add_13, linear_1)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_78, "visual.trunk.blocks.0.norm2.weight", "visual.trunk.blocks.0.norm2.bias")
val_57 = MatMul (layer_norm_1, val_5)
linear_2 = Add (val_57, "visual.trunk.blocks.0.mlp.fc1.bias")
[node_gelu] gelu = Gelu <approximate: string = "tanh"> (linear_2)
val_58 = MatMul (gelu, val_6)
linear_3 = Add (val_58, "visual.trunk.blocks.0.mlp.fc2.bias")
add_107 = Add (add_78, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_107, "visual.trunk.blocks.1.norm1.weight", "visual.trunk.blocks.1.norm1.bias")
val_59 = MatMul (layer_norm_2, val_7)
linear_4 = Add (val_59, "visual.trunk.blocks.1.attn.qkv.bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (linear_4, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
val_60 = MatMul (scaled_dot_product_attention_1, val_8)
linear_5 = Add (val_60, "visual.trunk.blocks.1.attn.proj.bias")
add_168 = Add (add_107, linear_5)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_168, "visual.trunk.blocks.1.norm2.weight", "visual.trunk.blocks.1.norm2.bias")
val_61 = MatMul (layer_norm_3, val_9)
linear_6 = Add (val_61, "visual.trunk.blocks.1.mlp.fc1.bias")
gelu_1 = Gelu <approximate: string = "tanh"> (linear_6)
val_62 = MatMul (gelu_1, val_10)
linear_7 = Add (val_62, "visual.trunk.blocks.1.mlp.fc2.bias")
add_197 = Add (add_168, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_197, "visual.trunk.blocks.2.norm1.weight", "visual.trunk.blocks.2.norm1.bias")
val_63 = MatMul (layer_norm_4, val_11)
linear_8 = Add (val_63, "visual.trunk.blocks.2.attn.qkv.bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (linear_8, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
val_64 = MatMul (scaled_dot_product_attention_2, val_12)
linear_9 = Add (val_64, "visual.trunk.blocks.2.attn.proj.bias")
add_258 = Add (add_197, linear_9)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_258, "visual.trunk.blocks.2.norm2.weight", "visual.trunk.blocks.2.norm2.bias")
val_65 = MatMul (layer_norm_5, val_13)
linear_10 = Add (val_65, "visual.trunk.blocks.2.mlp.fc1.bias")
gelu_2 = Gelu <approximate: string = "tanh"> (linear_10)
val_66 = MatMul (gelu_2, val_14)
linear_11 = Add (val_66, "visual.trunk.blocks.2.mlp.fc2.bias")
add_287 = Add (add_258, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_287, "visual.trunk.blocks.3.norm1.weight", "visual.trunk.blocks.3.norm1.bias")
val_67 = MatMul (layer_norm_6, val_15)
linear_12 = Add (val_67, "visual.trunk.blocks.3.attn.qkv.bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (linear_12, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
val_68 = MatMul (scaled_dot_product_attention_3, val_16)
linear_13 = Add (val_68, "visual.trunk.blocks.3.attn.proj.bias")
add_348 = Add (add_287, linear_13)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_348, "visual.trunk.blocks.3.norm2.weight", "visual.trunk.blocks.3.norm2.bias")
val_69 = MatMul (layer_norm_7, val_17)
linear_14 = Add (val_69, "visual.trunk.blocks.3.mlp.fc1.bias")
gelu_3 = Gelu <approximate: string = "tanh"> (linear_14)
val_70 = MatMul (gelu_3, val_18)
linear_15 = Add (val_70, "visual.trunk.blocks.3.mlp.fc2.bias")
add_377 = Add (add_348, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_377, "visual.trunk.blocks.4.norm1.weight", "visual.trunk.blocks.4.norm1.bias")
val_71 = MatMul (layer_norm_8, val_19)
linear_16 = Add (val_71, "visual.trunk.blocks.4.attn.qkv.bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (linear_16, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
val_72 = MatMul (scaled_dot_product_attention_4, val_20)
linear_17 = Add (val_72, "visual.trunk.blocks.4.attn.proj.bias")
add_438 = Add (add_377, linear_17)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_438, "visual.trunk.blocks.4.norm2.weight", "visual.trunk.blocks.4.norm2.bias")
val_73 = MatMul (layer_norm_9, val_21)
linear_18 = Add (val_73, "visual.trunk.blocks.4.mlp.fc1.bias")
gelu_4 = Gelu <approximate: string = "tanh"> (linear_18)
val_74 = MatMul (gelu_4, val_22)
linear_19 = Add (val_74, "visual.trunk.blocks.4.mlp.fc2.bias")
add_467 = Add (add_438, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_467, "visual.trunk.blocks.5.norm1.weight", "visual.trunk.blocks.5.norm1.bias")
val_75 = MatMul (layer_norm_10, val_23)
linear_20 = Add (val_75, "visual.trunk.blocks.5.attn.qkv.bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (linear_20, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
val_76 = MatMul (scaled_dot_product_attention_5, val_24)
linear_21 = Add (val_76, "visual.trunk.blocks.5.attn.proj.bias")
add_528 = Add (add_467, linear_21)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_528, "visual.trunk.blocks.5.norm2.weight", "visual.trunk.blocks.5.norm2.bias")
val_77 = MatMul (layer_norm_11, val_25)
linear_22 = Add (val_77, "visual.trunk.blocks.5.mlp.fc1.bias")
gelu_5 = Gelu <approximate: string = "tanh"> (linear_22)
val_78 = MatMul (gelu_5, val_26)
linear_23 = Add (val_78, "visual.trunk.blocks.5.mlp.fc2.bias")
add_557 = Add (add_528, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_557, "visual.trunk.blocks.6.norm1.weight", "visual.trunk.blocks.6.norm1.bias")
val_79 = MatMul (layer_norm_12, val_27)
linear_24 = Add (val_79, "visual.trunk.blocks.6.attn.qkv.bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (linear_24, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
val_80 = MatMul (scaled_dot_product_attention_6, val_28)
linear_25 = Add (val_80, "visual.trunk.blocks.6.attn.proj.bias")
add_618 = Add (add_557, linear_25)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_618, "visual.trunk.blocks.6.norm2.weight", "visual.trunk.blocks.6.norm2.bias")
val_81 = MatMul (layer_norm_13, val_29)
linear_26 = Add (val_81, "visual.trunk.blocks.6.mlp.fc1.bias")
gelu_6 = Gelu <approximate: string = "tanh"> (linear_26)
val_82 = MatMul (gelu_6, val_30)
linear_27 = Add (val_82, "visual.trunk.blocks.6.mlp.fc2.bias")
add_647 = Add (add_618, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_647, "visual.trunk.blocks.7.norm1.weight", "visual.trunk.blocks.7.norm1.bias")
val_83 = MatMul (layer_norm_14, val_31)
linear_28 = Add (val_83, "visual.trunk.blocks.7.attn.qkv.bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (linear_28, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
val_84 = MatMul (scaled_dot_product_attention_7, val_32)
linear_29 = Add (val_84, "visual.trunk.blocks.7.attn.proj.bias")
add_708 = Add (add_647, linear_29)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_708, "visual.trunk.blocks.7.norm2.weight", "visual.trunk.blocks.7.norm2.bias")
val_85 = MatMul (layer_norm_15, val_33)
linear_30 = Add (val_85, "visual.trunk.blocks.7.mlp.fc1.bias")
gelu_7 = Gelu <approximate: string = "tanh"> (linear_30)
val_86 = MatMul (gelu_7, val_34)
linear_31 = Add (val_86, "visual.trunk.blocks.7.mlp.fc2.bias")
add_737 = Add (add_708, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_737, "visual.trunk.blocks.8.norm1.weight", "visual.trunk.blocks.8.norm1.bias")
val_87 = MatMul (layer_norm_16, val_35)
linear_32 = Add (val_87, "visual.trunk.blocks.8.attn.qkv.bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (linear_32, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
val_88 = MatMul (scaled_dot_product_attention_8, val_36)
linear_33 = Add (val_88, "visual.trunk.blocks.8.attn.proj.bias")
add_798 = Add (add_737, linear_33)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_798, "visual.trunk.blocks.8.norm2.weight", "visual.trunk.blocks.8.norm2.bias")
val_89 = MatMul (layer_norm_17, val_37)
linear_34 = Add (val_89, "visual.trunk.blocks.8.mlp.fc1.bias")
gelu_8 = Gelu <approximate: string = "tanh"> (linear_34)
val_90 = MatMul (gelu_8, val_38)
linear_35 = Add (val_90, "visual.trunk.blocks.8.mlp.fc2.bias")
add_827 = Add (add_798, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_827, "visual.trunk.blocks.9.norm1.weight", "visual.trunk.blocks.9.norm1.bias")
val_91 = MatMul (layer_norm_18, val_39)
linear_36 = Add (val_91, "visual.trunk.blocks.9.attn.qkv.bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (linear_36, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
val_92 = MatMul (scaled_dot_product_attention_9, val_40)
linear_37 = Add (val_92, "visual.trunk.blocks.9.attn.proj.bias")
add_888 = Add (add_827, linear_37)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_888, "visual.trunk.blocks.9.norm2.weight", "visual.trunk.blocks.9.norm2.bias")
val_93 = MatMul (layer_norm_19, val_41)
linear_38 = Add (val_93, "visual.trunk.blocks.9.mlp.fc1.bias")
gelu_9 = Gelu <approximate: string = "tanh"> (linear_38)
val_94 = MatMul (gelu_9, val_42)
linear_39 = Add (val_94, "visual.trunk.blocks.9.mlp.fc2.bias")
add_917 = Add (add_888, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_917, "visual.trunk.blocks.10.norm1.weight", "visual.trunk.blocks.10.norm1.bias")
val_95 = MatMul (layer_norm_20, val_43)
linear_40 = Add (val_95, "visual.trunk.blocks.10.attn.qkv.bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (linear_40, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
val_96 = MatMul (scaled_dot_product_attention_10, val_44)
linear_41 = Add (val_96, "visual.trunk.blocks.10.attn.proj.bias")
add_978 = Add (add_917, linear_41)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_978, "visual.trunk.blocks.10.norm2.weight", "visual.trunk.blocks.10.norm2.bias")
val_97 = MatMul (layer_norm_21, val_45)
linear_42 = Add (val_97, "visual.trunk.blocks.10.mlp.fc1.bias")
gelu_10 = Gelu <approximate: string = "tanh"> (linear_42)
val_98 = MatMul (gelu_10, val_46)
linear_43 = Add (val_98, "visual.trunk.blocks.10.mlp.fc2.bias")
add_1007 = Add (add_978, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1007, "visual.trunk.blocks.11.norm1.weight", "visual.trunk.blocks.11.norm1.bias")
val_99 = MatMul (layer_norm_22, val_47)
linear_44 = Add (val_99, "visual.trunk.blocks.11.attn.qkv.bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (linear_44, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
val_100 = MatMul (scaled_dot_product_attention_11, val_48)
linear_45 = Add (val_100, "visual.trunk.blocks.11.attn.proj.bias")
add_1068 = Add (add_1007, linear_45)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1068, "visual.trunk.blocks.11.norm2.weight", "visual.trunk.blocks.11.norm2.bias")
val_101 = MatMul (layer_norm_23, val_49)
linear_46 = Add (val_101, "visual.trunk.blocks.11.mlp.fc1.bias")
gelu_11 = Gelu <approximate: string = "tanh"> (linear_46)
val_102 = MatMul (gelu_11, val_50)
linear_47 = Add (val_102, "visual.trunk.blocks.11.mlp.fc2.bias")
add_1097 = Add (add_1068, linear_47)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (add_1097, "visual.trunk.norm.weight", "visual.trunk.norm.bias")
[ez_slice] image_ez_s = Slice (image_f32, image_ez_starts, image_ez_ends, image_ez_axes)
[ez_flatten] image_ez_r = Reshape (image_ez_s, val_0)
[ez_mul] image_ez = Mul (image_ez_r, image_ez_zero)
val_103 = MatMul (layer_norm_24, val_51)
linear_49 = Add (val_103, "visual.trunk.attn_pool.kv.bias")
[node_scaled_dot_product_attention_12_qkv_split] node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v = Split <axis: int = -1> (linear_49, attn3d_split_2x768)
[node_scaled_dot_product_attention_12_q_col] node_scaled_dot_product_attention_12_q_col_out = Unsqueeze (image_ez, node_scaled_dot_product_attention_12_q_col_axes)
[node_scaled_dot_product_attention_12_q_bcast] node_scaled_dot_product_attention_12_q = Add (node_scaled_dot_product_attention_12_q3, node_scaled_dot_product_attention_12_q_col_out)
scaled_dot_product_attention_12 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_12_q, node_scaled_dot_product_attention_12_k, node_scaled_dot_product_attention_12_v)
val_104 = MatMul (scaled_dot_product_attention_12, val_52)
linear_50 = Add (val_104, "visual.trunk.attn_pool.proj.bias")
layer_norm_25 = LayerNormalization <axis: int = -1, epsilon: float = 1e-06, stash_type: int = 1> (linear_50, "visual.trunk.attn_pool.norm.weight", "visual.trunk.attn_pool.norm.bias")
val_105 = MatMul (layer_norm_25, val_53)
linear_51 = Add (val_105, "visual.trunk.attn_pool.mlp.fc1.bias")
gelu_12 = Gelu <approximate: string = "tanh"> (linear_51)
val_106 = MatMul (gelu_12, val_54)
linear_52 = Add (val_106, "visual.trunk.attn_pool.mlp.fc2.bias")
add_1195 = Add (linear_50, linear_52)
select = Squeeze (add_1195, val_2)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (select, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (select, clamp_min)
}
weights:
attn3d_split_2x768 INT64[2] 6b8b40015c71
attn3d_split_3x768 INT64[3] eca50b2daf34
image_ez_axes INT64[3] e2e2033ae7e1
image_ez_ends INT64[3] 605390e5a369
image_ez_starts INT64[3] 9d908ecfb6b2
image_ez_zero FLOAT[] df3f619804a9
node_scaled_dot_product_attention_12_q3 FLOAT[1,1,768] bda9722f9bdc
node_scaled_dot_product_attention_12_q_col_axes INT64[2] 0c730b69905c
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[3072,768] 9f43c5634115
val_11 FLOAT[768,2304] 1309461ea3fa
val_12 FLOAT[768,768] 9a4214e4b976
val_13 FLOAT[768,3072] c29a91aa31d4
val_14 FLOAT[3072,768] 4f1dfe6f6ecd
val_15 FLOAT[768,2304] a1864854abe2
val_16 FLOAT[768,768] de9e59734aaa
val_17 FLOAT[768,3072] df4168dbd39c
val_18 FLOAT[3072,768] af914e29c6ab
val_19 FLOAT[768,2304] 183bcc459292
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[768,768] 850680662625
val_21 FLOAT[768,3072] e3de08c7b68a
val_22 FLOAT[3072,768] 15124e004991
val_23 FLOAT[768,2304] 613aeb54e7fd
val_24 FLOAT[768,768] 167368f7bbd4
val_25 FLOAT[768,3072] 711029aca159
val_26 FLOAT[3072,768] 6da7afdcef02
val_27 FLOAT[768,2304] 0081a5d58081
val_28 FLOAT[768,768] f3e1c474c77d
val_29 FLOAT[768,3072] a56a572c5368
val_3 FLOAT[768,2304] ff1ebc3c3210
val_30 FLOAT[3072,768] 03cb1082093b
val_31 FLOAT[768,2304] fb5546de4177
val_32 FLOAT[768,768] 4764fa740b50
val_33 FLOAT[768,3072] 0df94103a5d1
val_34 FLOAT[3072,768] d806e881bf1d
val_35 FLOAT[768,2304] 40e88ce8f358
val_36 FLOAT[768,768] 39433c860a49
val_37 FLOAT[768,3072] 5c0b354f2115
val_38 FLOAT[3072,768] 989a98f84bad
val_39 FLOAT[768,2304] 4ad0ef356440
val_4 FLOAT[768,768] c4d4fd036cc6
val_40 FLOAT[768,768] 76e62145f632
val_41 FLOAT[768,3072] ee850dc2e5fb
val_42 FLOAT[3072,768] 23ae694cff16
val_43 FLOAT[768,2304] f0ebb7462d70
val_44 FLOAT[768,768] 33607b34623b
val_45 FLOAT[768,3072] 9959b0ddca62
val_46 FLOAT[3072,768] 0290ca0d170f
val_47 FLOAT[768,2304] 0b6d36e38492
val_48 FLOAT[768,768] bb8fc25506cb
val_49 FLOAT[768,3072] c05b657ac915
val_5 FLOAT[768,3072] 80904515daca
val_50 FLOAT[3072,768] 747139cde8f5
val_51 FLOAT[768,1536] 6c93209fdad4
val_52 FLOAT[768,768] b0315f67b3ef
val_53 FLOAT[768,3072] 82fc951ff927
val_54 FLOAT[3072,768] 12a9d0eb3fa1
val_6 FLOAT[3072,768] 881713839b7d
val_7 FLOAT[768,2304] c9a0c42122f8
val_8 FLOAT[768,768] 6c1bbe3df017
val_9 FLOAT[768,3072] 42b63bec76cd
view_target INT64[3] 288b66080dd3
visual.trunk.attn_pool.kv.bias FLOAT[1536] 604b069237eb
visual.trunk.attn_pool.mlp.fc1.bias FLOAT[3072] 15a5e1e335bc
visual.trunk.attn_pool.mlp.fc2.bias FLOAT[768] 1a095ef28681
visual.trunk.attn_pool.norm.bias FLOAT[768] 5b17db6ba977
visual.trunk.attn_pool.norm.weight FLOAT[768] c16efe78ed6d
visual.trunk.attn_pool.proj.bias FLOAT[768] 9df13752d2c2
visual.trunk.blocks.0.attn.proj.bias FLOAT[768] cd2a1583a685
visual.trunk.blocks.0.attn.qkv.bias FLOAT[2304] ff0e027664ec
visual.trunk.blocks.0.mlp.fc1.bias FLOAT[3072] cd31fad95e94
visual.trunk.blocks.0.mlp.fc2.bias FLOAT[768] 4d4ad7810a30
visual.trunk.blocks.0.norm1.bias FLOAT[768] 9b9ce079e3b3
visual.trunk.blocks.0.norm1.weight FLOAT[768] fcc299cf1c4f
visual.trunk.blocks.0.norm2.bias FLOAT[768] e7e1259c33a9
visual.trunk.blocks.0.norm2.weight FLOAT[768] a493c089b41a
visual.trunk.blocks.1.attn.proj.bias FLOAT[768] be38352fbad5
visual.trunk.blocks.1.attn.qkv.bias FLOAT[2304] de4eb7c9b904
visual.trunk.blocks.1.mlp.fc1.bias FLOAT[3072] e62416bc3c35
visual.trunk.blocks.1.mlp.fc2.bias FLOAT[768] 5b8b0471c423
visual.trunk.blocks.1.norm1.bias FLOAT[768] 92a4080789b6
visual.trunk.blocks.1.norm1.weight FLOAT[768] 26ab161d0298
visual.trunk.blocks.1.norm2.bias FLOAT[768] 16cd88abaf63
visual.trunk.blocks.1.norm2.weight FLOAT[768] 8328bde54d8f
visual.trunk.blocks.10.attn.proj.bias FLOAT[768] 888c54e883b5
visual.trunk.blocks.10.attn.qkv.bias FLOAT[2304] 07dc85863e55
visual.trunk.blocks.10.mlp.fc1.bias FLOAT[3072] 07b0d9ba8e71
visual.trunk.blocks.10.mlp.fc2.bias FLOAT[768] 0c50e59d7b00
visual.trunk.blocks.10.norm1.bias FLOAT[768] 3bf738cc5b1f
visual.trunk.blocks.10.norm1.weight FLOAT[768] 67bb651ec993
visual.trunk.blocks.10.norm2.bias FLOAT[768] 71755d6dce19
visual.trunk.blocks.10.norm2.weight FLOAT[768] e26ee969c3e2
visual.trunk.blocks.11.attn.proj.bias FLOAT[768] 56c8ff181379
visual.trunk.blocks.11.attn.qkv.bias FLOAT[2304] 16c93c391e59
visual.trunk.blocks.11.mlp.fc1.bias FLOAT[3072] 1c5470dd827d
visual.trunk.blocks.11.mlp.fc2.bias FLOAT[768] f8c0d57ce41a
visual.trunk.blocks.11.norm1.bias FLOAT[768] 5350b58341d4
visual.trunk.blocks.11.norm1.weight FLOAT[768] ab6db058ba9e
visual.trunk.blocks.11.norm2.bias FLOAT[768] 7f386788fddd
visual.trunk.blocks.11.norm2.weight FLOAT[768] 2212fc48f125
visual.trunk.blocks.2.attn.proj.bias FLOAT[768] b1c7ae99f4bc
visual.trunk.blocks.2.attn.qkv.bias FLOAT[2304] cceaef89d085
visual.trunk.blocks.2.mlp.fc1.bias FLOAT[3072] 7a70e7b070fd
visual.trunk.blocks.2.mlp.fc2.bias FLOAT[768] 34b1b3effaa3
visual.trunk.blocks.2.norm1.bias FLOAT[768] f3afbd8354da
visual.trunk.blocks.2.norm1.weight FLOAT[768] 57fa66ea869b
visual.trunk.blocks.2.norm2.bias FLOAT[768] 777196519d97
visual.trunk.blocks.2.norm2.weight FLOAT[768] 54e9fa3b2de7
visual.trunk.blocks.3.attn.proj.bias FLOAT[768] db91b01dd600
visual.trunk.blocks.3.attn.qkv.bias FLOAT[2304] e90f80823831
visual.trunk.blocks.3.mlp.fc1.bias FLOAT[3072] 174a9344bf03
visual.trunk.blocks.3.mlp.fc2.bias FLOAT[768] f62cb3886876
visual.trunk.blocks.3.norm1.bias FLOAT[768] 93f2af2c34e6
visual.trunk.blocks.3.norm1.weight FLOAT[768] 9e8219dc765a
visual.trunk.blocks.3.norm2.bias FLOAT[768] d6d195533bc2
visual.trunk.blocks.3.norm2.weight FLOAT[768] 4e0cf077c7c4
visual.trunk.blocks.4.attn.proj.bias FLOAT[768] 3d379cc247d2
visual.trunk.blocks.4.attn.qkv.bias FLOAT[2304] 55e5ed8f78d6
visual.trunk.blocks.4.mlp.fc1.bias FLOAT[3072] 53131341eb49
visual.trunk.blocks.4.mlp.fc2.bias FLOAT[768] b874144be54d
visual.trunk.blocks.4.norm1.bias FLOAT[768] 4d38255cf4ed
visual.trunk.blocks.4.norm1.weight FLOAT[768] bda526e57396
visual.trunk.blocks.4.norm2.bias FLOAT[768] 1c6f59d31409
visual.trunk.blocks.4.norm2.weight FLOAT[768] 891a8de87d99
visual.trunk.blocks.5.attn.proj.bias FLOAT[768] 8f7b6bff1596
visual.trunk.blocks.5.attn.qkv.bias FLOAT[2304] 2a2085c18e34
visual.trunk.blocks.5.mlp.fc1.bias FLOAT[3072] cd9a7ea86ae4
visual.trunk.blocks.5.mlp.fc2.bias FLOAT[768] 2c68c18b2133
visual.trunk.blocks.5.norm1.bias FLOAT[768] ecf0a54c5daa
visual.trunk.blocks.5.norm1.weight FLOAT[768] 7ca80cd5f95b
visual.trunk.blocks.5.norm2.bias FLOAT[768] 1dcc9998c2b9
visual.trunk.blocks.5.norm2.weight FLOAT[768] 0484ac51dce3
visual.trunk.blocks.6.attn.proj.bias FLOAT[768] 8e3d1dff2a7e
visual.trunk.blocks.6.attn.qkv.bias FLOAT[2304] f4854b33404c
visual.trunk.blocks.6.mlp.fc1.bias FLOAT[3072] 46818ad84fee
visual.trunk.blocks.6.mlp.fc2.bias FLOAT[768] d3a2aa90f847
visual.trunk.blocks.6.norm1.bias FLOAT[768] a5fde0ad9aad
visual.trunk.blocks.6.norm1.weight FLOAT[768] e9b18adf9773
visual.trunk.blocks.6.norm2.bias FLOAT[768] eeabaaddf2c5
visual.trunk.blocks.6.norm2.weight FLOAT[768] 72d0251c8cd0
visual.trunk.blocks.7.attn.proj.bias FLOAT[768] 02e5cc6bb067
visual.trunk.blocks.7.attn.qkv.bias FLOAT[2304] 24a919e3e6a4
visual.trunk.blocks.7.mlp.fc1.bias FLOAT[3072] f23959a62e3f
visual.trunk.blocks.7.mlp.fc2.bias FLOAT[768] 5643382f9884
visual.trunk.blocks.7.norm1.bias FLOAT[768] b88f037d8078
visual.trunk.blocks.7.norm1.weight FLOAT[768] 890957f7df62
visual.trunk.blocks.7.norm2.bias FLOAT[768] 4709a1f7da2a
visual.trunk.blocks.7.norm2.weight FLOAT[768] 88eb2ec8a685
visual.trunk.blocks.8.attn.proj.bias FLOAT[768] cea96f218983
visual.trunk.blocks.8.attn.qkv.bias FLOAT[2304] 37e6c316074e
visual.trunk.blocks.8.mlp.fc1.bias FLOAT[3072] 1c6b7387313c
visual.trunk.blocks.8.mlp.fc2.bias FLOAT[768] 62843d8a98f9
visual.trunk.blocks.8.norm1.bias FLOAT[768] 8462e7e2ca46
visual.trunk.blocks.8.norm1.weight FLOAT[768] 006487eb6aa5
visual.trunk.blocks.8.norm2.bias FLOAT[768] 029317ab425c
visual.trunk.blocks.8.norm2.weight FLOAT[768] 7000ee5359ea
visual.trunk.blocks.9.attn.proj.bias FLOAT[768] e6e7146049f4
visual.trunk.blocks.9.attn.qkv.bias FLOAT[2304] 2508b7f383b2
visual.trunk.blocks.9.mlp.fc1.bias FLOAT[3072] 027be79425a7
visual.trunk.blocks.9.mlp.fc2.bias FLOAT[768] 6836e4e65c11
visual.trunk.blocks.9.norm1.bias FLOAT[768] a0f8e250bf76
visual.trunk.blocks.9.norm1.weight FLOAT[768] 37c319581594
visual.trunk.blocks.9.norm2.bias FLOAT[768] 32a5fd7bc525
visual.trunk.blocks.9.norm2.weight FLOAT[768] 6a8efb9c3ca5
visual.trunk.norm.bias FLOAT[768] 54646633bb6c
visual.trunk.norm.weight FLOAT[768] e5dd3f8e7a6c
visual.trunk.patch_embed.proj.bias FLOAT[768] b3ee2b7e9b3e
visual.trunk.patch_embed.proj.weight FLOAT[768,3,32,32] 9cbfa1130a26
visual.trunk.pos_embed FLOAT[1,64,768] fd472ae943e4
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,512] add_1071
float[batch,77,512] add_1092
float[batch,77,512] add_119
float[batch,77,512] add_1207
float[batch,77,512] add_1228
float[batch,77,512] add_1343
float[batch,77,512] add_1364
float[batch,77,512] add_140
float[batch,77,512] add_1479
float[batch,77,512] add_1500
float[batch,1,512] add_1500_pooled
float[batch,1,512] add_1615
float[batch,1,512] add_1636
float[batch,77,512] add_255
float[batch,77,512] add_276
float[batch,77,512] add_391
float[batch,77,512] add_4
float[batch,77,512] add_412
float[batch,77,512] add_527
float[batch,77,512] add_548
float[batch,77,512] add_663
float[batch,77,512] add_684
float[batch,77,512] add_799
float[batch,77,512] add_820
float[batch,77,512] add_935
float[batch,77,512] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,2048] gelu
float[batch,77,2048] gelu_1
float[batch,77,2048] gelu_10
float[batch,1,2048] gelu_11
float[batch,77,2048] gelu_2
float[batch,77,2048] gelu_3
float[batch,77,2048] gelu_4
float[batch,77,2048] gelu_5
float[batch,77,2048] gelu_6
float[batch,77,2048] gelu_7
float[batch,77,2048] gelu_8
float[batch,77,2048] gelu_9
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,512] matmul
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] val_39
float[batch,77,512] val_40
float[batch,77,2048] val_41
float[batch,77,512] val_42
float[batch,77,2048] val_43
float[batch,77,512] val_44
float[batch,77,2048] val_45
float[batch,77,512] val_46
float[batch,77,2048] val_47
float[batch,77,512] val_48
float[batch,77,2048] val_49
float[batch,77,512] val_50
float[batch,77,2048] val_51
float[batch,77,512] val_52
float[batch,77,2048] val_53
float[batch,77,512] val_54
float[batch,77,2048] val_55
float[batch,77,512] val_56
float[batch,77,2048] val_57
float[batch,77,512] val_58
float[batch,77,2048] val_59
float[batch,77,512] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2048] val_63
float[batch,1,512] val_64
float[batch,1,512] val_65
float[batch,512] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] 2f5a552f81ad
ln_final.weight FLOAT[512] 125bb0fe50e7
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] ed833ca49a34
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] c3890c68d8b5
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] a69ad2324e33
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] b002b7188604
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 293c597b5046
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] cac6ce2c0a7c
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 0afa2c4ed7b8
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 2d1b8d3c0062
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] ab65ac5a4277
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] e1bee661f565
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 79674b53efba
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 96a0079f8417
positional_embedding FLOAT[77,512] b04e3944da7c
text_projection FLOAT[512,512] e56a82736598
token_embedding.weight_fp16 FLOAT16[49408,512] 5dbbaa38ac19
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 0ab737d162dc
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] e67a52fcff0d
transformer.resblocks.0.ln_1.bias FLOAT[512] 7ba43b0c28a2
transformer.resblocks.0.ln_1.weight FLOAT[512] 100e281e8d77
transformer.resblocks.0.ln_2.bias FLOAT[512] dfa66e11802c
transformer.resblocks.0.ln_2.weight FLOAT[512] ac8a973b8cd3
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 15455ac76291
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 5326e17e2508
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] b270ca08fa4b
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 5d7449a997b1
transformer.resblocks.1.ln_1.bias FLOAT[512] 868b71d78ec4
transformer.resblocks.1.ln_1.weight FLOAT[512] c7d50e64fc9a
transformer.resblocks.1.ln_2.bias FLOAT[512] c2ae81b9af99
transformer.resblocks.1.ln_2.weight FLOAT[512] 68efd43a6e5f
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 706e2875892b
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] d5133f28e8c5
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 059832f9fc56
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 442e65eed51e
transformer.resblocks.10.ln_1.bias FLOAT[512] d95e9c51f468
transformer.resblocks.10.ln_1.weight FLOAT[512] cf792ca466dd
transformer.resblocks.10.ln_2.bias FLOAT[512] e6932797f9af
transformer.resblocks.10.ln_2.weight FLOAT[512] c0d2a8a610d2
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] c50072781cbc
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 1d9013933d49
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] d49e70e210ba
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] d55442c3472d
transformer.resblocks.11.ln_1.bias FLOAT[512] 738763d955a9
transformer.resblocks.11.ln_1.weight FLOAT[512] ea7906ed5f8c
transformer.resblocks.11.ln_2.bias FLOAT[512] 7e9ed4e9ca20
transformer.resblocks.11.ln_2.weight FLOAT[512] 5392f264e41a
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] a1d05ef6cb9f
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] 7b749cb0da37
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] d8e2721e0860
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 35cf440e476f
transformer.resblocks.2.ln_1.bias FLOAT[512] 627a66e09c63
transformer.resblocks.2.ln_1.weight FLOAT[512] 9a92781acbd3
transformer.resblocks.2.ln_2.bias FLOAT[512] 00c750b2a9a4
transformer.resblocks.2.ln_2.weight FLOAT[512] d4803346b8c8
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 91ac1250d509
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 1ddcf5684107
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 33454e55b7f9
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] b86d07da989a
transformer.resblocks.3.ln_1.bias FLOAT[512] ede201345b90
transformer.resblocks.3.ln_1.weight FLOAT[512] afef853a0453
transformer.resblocks.3.ln_2.bias FLOAT[512] f658f68b0b0e
transformer.resblocks.3.ln_2.weight FLOAT[512] 8a8d86da9e8c
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] 14f6e452b661
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 9eec47f9867d
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] 6f5220a69d13
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 89eed7f0f4e5
transformer.resblocks.4.ln_1.bias FLOAT[512] a022def33810
transformer.resblocks.4.ln_1.weight FLOAT[512] 8d28db988aef
transformer.resblocks.4.ln_2.bias FLOAT[512] f10cae282e7e
transformer.resblocks.4.ln_2.weight FLOAT[512] f27b5a0e59f9
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 19d2f8ae93d3
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] b01893015315
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 7479fb655fcc
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 63945321b27a
transformer.resblocks.5.ln_1.bias FLOAT[512] 4d7ca3a8cec4
transformer.resblocks.5.ln_1.weight FLOAT[512] cc76ad70bbab
transformer.resblocks.5.ln_2.bias FLOAT[512] 97d056df6f77
transformer.resblocks.5.ln_2.weight FLOAT[512] 91da88606333
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 2d4697e4ce92
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 6f57631f3935
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] ba1d4737e5ea
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] e41a99f522b1
transformer.resblocks.6.ln_1.bias FLOAT[512] b1460c439c75
transformer.resblocks.6.ln_1.weight FLOAT[512] 3f2d90f74f9a
transformer.resblocks.6.ln_2.bias FLOAT[512] 3035f113b5b1
transformer.resblocks.6.ln_2.weight FLOAT[512] 465a58452ff7
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 718ecfebdcd1
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 5302c8c64ce6
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 06be06144230
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] da85d801ed3c
transformer.resblocks.7.ln_1.bias FLOAT[512] 5523fd4b03ef
transformer.resblocks.7.ln_1.weight FLOAT[512] 1a1809cd9b8a
transformer.resblocks.7.ln_2.bias FLOAT[512] c2bc795fe2c3
transformer.resblocks.7.ln_2.weight FLOAT[512] 7f5bc568a13d
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] bfa4725b29ed
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 719eeb0548b0
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 2e78bba4f0c4
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] fe99983d0bd3
transformer.resblocks.8.ln_1.bias FLOAT[512] e14d6ea6a1e0
transformer.resblocks.8.ln_1.weight FLOAT[512] d359c3ba7435
transformer.resblocks.8.ln_2.bias FLOAT[512] 11a726ae92ee
transformer.resblocks.8.ln_2.weight FLOAT[512] d0a305bd847c
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] bc286155b494
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 96b416c302a2
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 2f618dfff7e2
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 3060783fe428
transformer.resblocks.9.ln_1.bias FLOAT[512] 8c90ffe016ba
transformer.resblocks.9.ln_1.weight FLOAT[512] 069b32292dd9
transformer.resblocks.9.ln_2.bias FLOAT[512] fec83579af49
transformer.resblocks.9.ln_2.weight FLOAT[512] d8fd6863792b
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 6ce5f0e062ea
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 48f01914e00b
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2048,512] 2795e3d236ba
val_11 FLOAT[512,1536] 7eb7d95d72e6
val_12 FLOAT[512,2048] 1f7f70c578a0
val_13 FLOAT[2048,512] 3840b5477647
val_14 FLOAT[512,1536] 1acd704f62e4
val_15 FLOAT[512,2048] 6c79985ca66c
val_16 FLOAT[2048,512] 19d42d4fed8e
val_17 FLOAT[512,1536] a5f464c5d415
val_18 FLOAT[512,2048] 0046165e9593
val_19 FLOAT[2048,512] 0c24d4ae55e6
val_2 FLOAT[512,1536] 43d5d033fd53
val_20 FLOAT[512,1536] 6e7a4d5421a2
val_21 FLOAT[512,2048] 15779de1b252
val_22 FLOAT[2048,512] 99b6a4aba2b0
val_23 FLOAT[512,1536] 5170bc63157f
val_24 FLOAT[512,2048] 0925625d9ff9
val_25 FLOAT[2048,512] 152e8969d9dd
val_26 FLOAT[512,1536] 3493ddb2abd9
val_27 FLOAT[512,2048] 12378547597b
val_28 FLOAT[2048,512] c75176b3b33f
val_29 FLOAT[512,1536] 104643fc9293
val_3 FLOAT[512,2048] 205a3110bdb6
val_30 FLOAT[512,2048] b4f6acd3b0ba
val_31 FLOAT[2048,512] 30836641d17d
val_32 FLOAT[512,1536] e45c89d63bde
val_33 FLOAT[512,2048] df121f2efca5
val_34 FLOAT[2048,512] 5962f9ff7dca
val_35 FLOAT[512,1536] b462205cd6cd
val_36 FLOAT[512,2048] 6b5159a9269a
val_37 FLOAT[2048,512] f18c998c03f0
val_4 FLOAT[2048,512] a64eb0e06834
val_5 FLOAT[512,1536] 6ca6838cf446
val_6 FLOAT[512,2048] 64e0a2484b37
val_7 FLOAT[2048,512] d45d3eff8554
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[512,1536] fafc72391593
val_9 FLOAT[512,2048] 391815a5d2c6
@@ -0,0 +1,587 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,50,768] add_1088
float[batch,50,768] add_1109
float[batch,50,768] add_1224
float[batch,50,768] add_1245
float[batch,50,768] add_136
float[batch,50,768] add_1360
float[batch,50,768] add_1381
float[batch,50,768] add_1496
float[batch,50,768] add_1517
float[batch,1,768] add_1517_pooled
float[batch,50,768] add_157
float[batch,1,768] add_1632
float[batch,1,768] add_1653
float[batch,50,768] add_17
float[batch,50,768] add_272
float[batch,50,768] add_293
float[batch,50,768] add_408
float[batch,50,768] add_429
float[batch,50,768] add_544
float[batch,50,768] add_565
float[batch,50,768] add_680
float[batch,50,768] add_701
float[batch,50,768] add_816
float[batch,50,768] add_837
float[batch,50,768] add_952
float[batch,50,768] add_973
float[batch,1] clamp_min
float[batch,768,7,7] conv2d
float[batch,50,3072] gelu
float[batch,50,3072] gelu_1
float[batch,50,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,50,3072] gelu_2
float[batch,50,3072] gelu_3
float[batch,50,3072] gelu_4
float[batch,50,3072] gelu_5
float[batch,50,3072] gelu_6
float[batch,50,3072] gelu_7
float[batch,50,3072] gelu_8
float[batch,50,3072] gelu_9
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,50,768] layer_norm
float[batch,50,768] layer_norm_1
float[batch,50,768] layer_norm_10
float[batch,50,768] layer_norm_11
float[batch,50,768] layer_norm_12
float[batch,50,768] layer_norm_13
float[batch,50,768] layer_norm_14
float[batch,50,768] layer_norm_15
float[batch,50,768] layer_norm_16
float[batch,50,768] layer_norm_17
float[batch,50,768] layer_norm_18
float[batch,50,768] layer_norm_19
float[batch,50,768] layer_norm_2
float[batch,50,768] layer_norm_20
float[batch,50,768] layer_norm_21
float[batch,50,768] layer_norm_22
float[batch,50,768] layer_norm_23
float[batch,1,768] layer_norm_24
float[batch,50,768] layer_norm_3
float[batch,50,768] layer_norm_4
float[batch,50,768] layer_norm_5
float[batch,50,768] layer_norm_6
float[batch,50,768] layer_norm_7
float[batch,50,768] layer_norm_8
float[batch,50,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,50,3072] linear_10
float[batch,50,768] linear_11
float[batch,50,3072] linear_14
float[batch,50,768] linear_15
float[batch,50,3072] linear_18
float[batch,50,768] linear_19
float[batch,50,3072] linear_2
float[batch,50,3072] linear_22
float[batch,50,768] linear_23
float[batch,50,3072] linear_26
float[batch,50,768] linear_27
float[batch,50,768] linear_3
float[batch,50,3072] linear_30
float[batch,50,768] linear_31
float[batch,50,3072] linear_34
float[batch,50,768] linear_35
float[batch,50,3072] linear_38
float[batch,50,768] linear_39
float[batch,50,3072] linear_42
float[batch,50,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,50,3072] linear_6
float[batch,50,768] linear_7
float[batch,512] matmul
float[batch,50,768] node_scaled_dot_product_attention_10_k
float[batch,50,768] node_scaled_dot_product_attention_10_out
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_q
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_v
float[batch,50,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_v
float[batch,50,768] node_scaled_dot_product_attention_1_k
float[batch,50,768] node_scaled_dot_product_attention_1_out
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_q
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_v
float[batch,50,768] node_scaled_dot_product_attention_2_k
float[batch,50,768] node_scaled_dot_product_attention_2_out
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_q
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_v
float[batch,50,768] node_scaled_dot_product_attention_3_k
float[batch,50,768] node_scaled_dot_product_attention_3_out
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_q
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_v
float[batch,50,768] node_scaled_dot_product_attention_4_k
float[batch,50,768] node_scaled_dot_product_attention_4_out
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_q
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_v
float[batch,50,768] node_scaled_dot_product_attention_5_k
float[batch,50,768] node_scaled_dot_product_attention_5_out
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_q
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_v
float[batch,50,768] node_scaled_dot_product_attention_6_k
float[batch,50,768] node_scaled_dot_product_attention_6_out
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_q
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_v
float[batch,50,768] node_scaled_dot_product_attention_7_k
float[batch,50,768] node_scaled_dot_product_attention_7_out
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_q
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_v
float[batch,50,768] node_scaled_dot_product_attention_8_k
float[batch,50,768] node_scaled_dot_product_attention_8_out
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_q
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_v
float[batch,50,768] node_scaled_dot_product_attention_9_k
float[batch,50,768] node_scaled_dot_product_attention_9_out
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_q
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_v
float[batch,50,768] node_scaled_dot_product_attention_k
float[batch,50,768] node_scaled_dot_product_attention_out
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_q
float[batch,50,2304] node_scaled_dot_product_attention_qkv
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_v
float[batch,49,768] permute
float[batch,50,768] scaled_dot_product_attention
float[batch,50,768] scaled_dot_product_attention_1
float[batch,50,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,50,768] scaled_dot_product_attention_2
float[batch,50,768] scaled_dot_product_attention_3
float[batch,50,768] scaled_dot_product_attention_4
float[batch,50,768] scaled_dot_product_attention_5
float[batch,50,768] scaled_dot_product_attention_6
float[batch,50,768] scaled_dot_product_attention_7
float[batch,50,768] scaled_dot_product_attention_8
float[batch,50,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,50,768] val_43
float[batch,50,3072] val_44
float[batch,50,768] val_45
float[batch,50,3072] val_46
float[batch,50,768] val_47
float[batch,50,3072] val_48
float[batch,50,768] val_49
float[batch,50,3072] val_50
float[batch,50,768] val_51
float[batch,50,3072] val_52
float[batch,50,768] val_53
float[batch,50,3072] val_54
float[batch,50,768] val_55
float[batch,50,3072] val_56
float[batch,50,768] val_57
float[batch,50,3072] val_58
float[batch,50,768] val_59
float[batch,50,3072] val_60
float[batch,50,768] val_61
float[batch,50,3072] val_62
float[batch,50,768] val_63
float[batch,50,3072] val_64
float[batch,50,768] val_65
float[batch,1,3072] val_66
float[batch,1,768] val_67
float[batch,768] val_68
float[batch,768,49] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_43 = Pad (permute, val_3, val_4)
add_17 = Add (val_43, val_42)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_44 = MatMul (layer_norm_2, val_7)
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_45 = MatMul (gelu, val_8)
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_157 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_46 = MatMul (layer_norm_4, val_10)
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_47 = MatMul (gelu_1, val_11)
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_293 = Add (add_272, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_48 = MatMul (layer_norm_6, val_13)
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_49 = MatMul (gelu_2, val_14)
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_429 = Add (add_408, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_50 = MatMul (layer_norm_8, val_16)
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_51 = MatMul (gelu_3, val_17)
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_565 = Add (add_544, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_52 = MatMul (layer_norm_10, val_19)
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_53 = MatMul (gelu_4, val_20)
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_701 = Add (add_680, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_54 = MatMul (layer_norm_12, val_22)
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_55 = MatMul (gelu_5, val_23)
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_837 = Add (add_816, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_56 = MatMul (layer_norm_14, val_25)
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_57 = MatMul (gelu_6, val_26)
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_973 = Add (add_952, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_58 = MatMul (layer_norm_16, val_28)
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_59 = MatMul (gelu_7, val_29)
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1109 = Add (add_1088, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_60 = MatMul (layer_norm_18, val_31)
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_61 = MatMul (gelu_8, val_32)
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1245 = Add (add_1224, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_62 = MatMul (layer_norm_20, val_34)
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_63 = MatMul (gelu_9, val_35)
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1381 = Add (add_1360, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_64 = MatMul (layer_norm_22, val_37)
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_65 = MatMul (gelu_10, val_38)
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1517 = Add (add_1496, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_66 = MatMul (layer_norm_24, val_40)
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_67 = MatMul (gelu_11, val_41)
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1653 = Add (add_1632, linear_47)
val_68 = Squeeze (add_1653, val_5)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_Conv_704_fused_bias FLOAT[768] 850599ec849b
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 8744008e1028
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 1caccfa899b2
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] fcf47919f2c6
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] ad30b8fb67f8
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 19cfa9f5b54d
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 3469068c20bf
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 22ef1362445f
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] b434536f82b7
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] c65410d0b92a
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 278ec24e7cc1
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ca892016c06f
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 4fa1c6bf2aff
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] 65a27c8ebd26
val_11 FLOAT[3072,768] 15de661b1053
val_12 FLOAT[768,2304] 6bdbfcdf37e0
val_13 FLOAT[768,3072] 18ceebb3373b
val_14 FLOAT[3072,768] 5121ae68dcdf
val_15 FLOAT[768,2304] 61b95f0fb65f
val_16 FLOAT[768,3072] ee3603f5a6d9
val_17 FLOAT[3072,768] 98edadb6cee9
val_18 FLOAT[768,2304] 079426088784
val_19 FLOAT[768,3072] d9b68f4293c0
val_2 INT64[1] af5570f5a181
val_20 FLOAT[3072,768] bd75b5a107e1
val_21 FLOAT[768,2304] b842c973665a
val_22 FLOAT[768,3072] a312dc089d9b
val_23 FLOAT[3072,768] 7661133a49bd
val_24 FLOAT[768,2304] ad0258df6063
val_25 FLOAT[768,3072] 3fc4249641d1
val_26 FLOAT[3072,768] bc9b541f13b4
val_27 FLOAT[768,2304] e147160d2441
val_28 FLOAT[768,3072] 05045ac0c3fc
val_29 FLOAT[3072,768] 7217857cc578
val_3 INT64[6] 6b7d92eaae70
val_30 FLOAT[768,2304] 39de8c0ced9e
val_31 FLOAT[768,3072] 2924be0fee8b
val_32 FLOAT[3072,768] 98bcbbb2773d
val_33 FLOAT[768,2304] 4e8d68ad07c1
val_34 FLOAT[768,3072] 5556533ad536
val_35 FLOAT[3072,768] 198c0e6614c6
val_36 FLOAT[768,2304] 33e200af7b22
val_37 FLOAT[768,3072] 8aa02842eb26
val_38 FLOAT[3072,768] 203924d3daa0
val_39 FLOAT[768,2304] db066ec66e03
val_4 FLOAT[] df3f619804a9
val_40 FLOAT[768,3072] ec1337ad53fc
val_41 FLOAT[3072,768] 48676ab05f08
val_42 FLOAT[1,50,768] 33201f84eb91
val_5 INT64[1] 7c9fa136d441
val_6 FLOAT[768,2304] 6d3de266b41c
val_7 FLOAT[768,3072] 2283731f87a9
val_8 FLOAT[3072,768] e84389d63a6c
val_9 FLOAT[768,2304] dbc6e8c5d3f1
view_target INT64[3] 69b00f163d22
visual.conv1.weight FLOAT[768,3,32,32] 2dac78399e65
visual.ln_post.bias FLOAT[768] d8e5646ee9b2
visual.ln_post.weight FLOAT[768] fffef44da001
visual.ln_pre.bias FLOAT[768] 3d295592fab2
visual.ln_pre.weight FLOAT[768] 69cc1716c367
visual.proj FLOAT[768,512] b0ba855b31dc
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 1f809f51b29c
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 77be2b81dc10
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] d10be3dc9d26
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] bcaa73849604
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] 30b654a13792
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] 835455a5282b
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 6a91fdb2f405
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] f5040e8f5032
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 1a8171286005
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] ef926395b70c
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] ba5f61807b2a
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] fc1d8d265f11
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] 3e64bcc025e3
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 333d2e72d68e
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] b2bf14d4b9ff
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 33e3a7b73d17
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] e60ed1b67e44
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] ffa5555abd30
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 37f85eb74e4b
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] 875a8db509ae
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] ee12673d4cf2
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 353d9cbd46ab
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] c94227d4415c
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 639d4bd43be7
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] d278d238df1c
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 8567ff7e58ab
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 7b692ba32528
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] 033c2080f1fc
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 56213caaa366
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] 6d99ef4a519f
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 811fd18cbbe2
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] e387a6622acc
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] a20fdba68680
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] d1ae3107e25c
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] 98fcb25b3e31
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] 5425b6a0feb6
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] b69a3284619c
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 7bb84c211183
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] b584c399d63d
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 8f52af1ebd98
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] d7df7f9e4df1
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 40b6f11716ac
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 9f746b68c094
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] 97dfa5c22296
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] 5822cb5cff13
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] 3af080baf91a
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] d7b72b5a1f6b
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] ccf3ca500e78
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 20b5c1c14d6c
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 7db3f96d9745
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] 6ac7e08b99a1
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 1152dfe324ad
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 13675c767b99
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] cd61453ff720
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 1e991a3f095b
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 842a8514cd6a
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] e447c46142e5
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 84ffab356148
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 309626060359
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] c8a76bcfc2ee
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] d8d89f8d60ad
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 1227a7085921
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 06089c907514
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] af41db8479c2
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 112f22361e54
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 6d4520e15940
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 0e862a423207
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] f9e4abee2565
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 87cecb623a6a
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] d6b827f85dae
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 7cd1b9444f1c
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 5020a970737d
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 06806835b6f6
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] e85cd745e466
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] b87e9c48e495
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] a6b16536305c
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] 7a6cd8328368
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 3809dda0a6f0
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 3344f11f4df7
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 1ee914370b71
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 94fad423ef1a
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] f340174c41df
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 52d47d359913
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 5cc20bd07b1c
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] 45899580acd0
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] 7a3221c6c7c1
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 0d058890a3a8
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] bff5be78c7d3
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 3f018dbfdd0f
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 8e1b5faff857
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 30fb5713a834
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 83751af289e5
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 05a85084cb95
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] 69b5cd8a7e04
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 716fdb8df0dc
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 41db1c1decc1
+576
View File
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,512] add_1071
float[batch,77,512] add_1092
float[batch,77,512] add_119
float[batch,77,512] add_1207
float[batch,77,512] add_1228
float[batch,77,512] add_1343
float[batch,77,512] add_1364
float[batch,77,512] add_140
float[batch,77,512] add_1479
float[batch,77,512] add_1500
float[batch,1,512] add_1500_pooled
float[batch,1,512] add_1615
float[batch,1,512] add_1636
float[batch,77,512] add_255
float[batch,77,512] add_276
float[batch,77,512] add_391
float[batch,77,512] add_4
float[batch,77,512] add_412
float[batch,77,512] add_527
float[batch,77,512] add_548
float[batch,77,512] add_663
float[batch,77,512] add_684
float[batch,77,512] add_799
float[batch,77,512] add_820
float[batch,77,512] add_935
float[batch,77,512] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,2048] gelu
float[batch,77,2048] gelu_1
float[batch,77,2048] gelu_10
float[batch,1,2048] gelu_11
float[batch,77,2048] gelu_2
float[batch,77,2048] gelu_3
float[batch,77,2048] gelu_4
float[batch,77,2048] gelu_5
float[batch,77,2048] gelu_6
float[batch,77,2048] gelu_7
float[batch,77,2048] gelu_8
float[batch,77,2048] gelu_9
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,512] matmul
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] val_39
float[batch,77,512] val_40
float[batch,77,2048] val_41
float[batch,77,512] val_42
float[batch,77,2048] val_43
float[batch,77,512] val_44
float[batch,77,2048] val_45
float[batch,77,512] val_46
float[batch,77,2048] val_47
float[batch,77,512] val_48
float[batch,77,2048] val_49
float[batch,77,512] val_50
float[batch,77,2048] val_51
float[batch,77,512] val_52
float[batch,77,2048] val_53
float[batch,77,512] val_54
float[batch,77,2048] val_55
float[batch,77,512] val_56
float[batch,77,2048] val_57
float[batch,77,512] val_58
float[batch,77,2048] val_59
float[batch,77,512] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2048] val_63
float[batch,1,512] val_64
float[batch,1,512] val_65
float[batch,512] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] b366ae265b42
ln_final.weight FLOAT[512] 4950843754ac
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] d94420eafae8
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] be9b26a79124
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 88b4383ea9a8
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] aeae46688942
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 6e02ba75c98e
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 69bc5ba57e69
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 8da10c1943c5
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 01c62054df18
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] c8071800259d
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] a84c2630e8b8
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 550547ee5bd4
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 12adea2f2172
positional_embedding FLOAT[77,512] d4af2ec9529a
text_projection FLOAT[512,512] cc8d538a25d6
token_embedding.weight_fp16 FLOAT16[49408,512] 5bd725895fc1
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 8e8b200c9260
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] c55777208878
transformer.resblocks.0.ln_1.bias FLOAT[512] 21cc7ead8546
transformer.resblocks.0.ln_1.weight FLOAT[512] f4b8b3c6a9ee
transformer.resblocks.0.ln_2.bias FLOAT[512] b3e7d7843b27
transformer.resblocks.0.ln_2.weight FLOAT[512] 6dd9cded58e9
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 7bf5977f7d60
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 1956c67cf0e1
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] 8d35c64ca486
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 8e5223e1e6b7
transformer.resblocks.1.ln_1.bias FLOAT[512] 62b06013c852
transformer.resblocks.1.ln_1.weight FLOAT[512] 52476495a028
transformer.resblocks.1.ln_2.bias FLOAT[512] aa8f11f9a5b2
transformer.resblocks.1.ln_2.weight FLOAT[512] a13d9acdc9b7
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] c5835ebc3b60
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] faa061b12f8e
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 3e6ef4bfa349
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 95a410680bfc
transformer.resblocks.10.ln_1.bias FLOAT[512] 7991e5ff2981
transformer.resblocks.10.ln_1.weight FLOAT[512] af1d886dbec7
transformer.resblocks.10.ln_2.bias FLOAT[512] 70482708b1ff
transformer.resblocks.10.ln_2.weight FLOAT[512] 9457a850207c
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 16bf0fc83c8f
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 516bf9773977
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] d0c4209cbcd2
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 7895aa805906
transformer.resblocks.11.ln_1.bias FLOAT[512] 7ab0ab330548
transformer.resblocks.11.ln_1.weight FLOAT[512] 4539267ba97a
transformer.resblocks.11.ln_2.bias FLOAT[512] ee1a559ba4d7
transformer.resblocks.11.ln_2.weight FLOAT[512] 2584c2aeb30a
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] ac392cf3d074
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] d397eefea092
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] 80c36890d808
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] dfed131f33b4
transformer.resblocks.2.ln_1.bias FLOAT[512] 35890ec8b1bb
transformer.resblocks.2.ln_1.weight FLOAT[512] 4516d7e7f938
transformer.resblocks.2.ln_2.bias FLOAT[512] 068832300cea
transformer.resblocks.2.ln_2.weight FLOAT[512] 6bc1617872d7
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] 0cba91a5c2ad
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 3ea4e3be27e2
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] e755de34c986
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] be38139954c6
transformer.resblocks.3.ln_1.bias FLOAT[512] 316a0844e437
transformer.resblocks.3.ln_1.weight FLOAT[512] bb46753daf2a
transformer.resblocks.3.ln_2.bias FLOAT[512] 351036005c42
transformer.resblocks.3.ln_2.weight FLOAT[512] 1cbb41de8606
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] cec726dfbee7
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] eb5d1fe71cd1
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] fbb48b8157fb
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] b45b636c225c
transformer.resblocks.4.ln_1.bias FLOAT[512] 8151c43a92ee
transformer.resblocks.4.ln_1.weight FLOAT[512] 51e39c939537
transformer.resblocks.4.ln_2.bias FLOAT[512] 25792530b557
transformer.resblocks.4.ln_2.weight FLOAT[512] 28f06e401b55
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] d5300afc4251
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 2d953c7c8a87
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] c02e0ff70f2a
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 0874164e265e
transformer.resblocks.5.ln_1.bias FLOAT[512] 4eac35d10852
transformer.resblocks.5.ln_1.weight FLOAT[512] 21fa1379e908
transformer.resblocks.5.ln_2.bias FLOAT[512] b6ee39b5d72f
transformer.resblocks.5.ln_2.weight FLOAT[512] 91d0959c9507
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] de19caecd195
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 5613c401343f
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] c26f78f6ad5e
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 4a24422dffcb
transformer.resblocks.6.ln_1.bias FLOAT[512] 49512530c665
transformer.resblocks.6.ln_1.weight FLOAT[512] 7f48943b43fb
transformer.resblocks.6.ln_2.bias FLOAT[512] c800edac217e
transformer.resblocks.6.ln_2.weight FLOAT[512] 99bcc6884fe5
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] a6d35e58184c
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 334925c0a243
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] f8641ee8c394
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 08e87550b7e0
transformer.resblocks.7.ln_1.bias FLOAT[512] 855bbec14496
transformer.resblocks.7.ln_1.weight FLOAT[512] f1f42f466c01
transformer.resblocks.7.ln_2.bias FLOAT[512] 77a09bd7b9db
transformer.resblocks.7.ln_2.weight FLOAT[512] 4b14c9ec3804
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] bdcdf8886244
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 4f661d45b4c2
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 97edb01f0b03
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 5a750f18ca01
transformer.resblocks.8.ln_1.bias FLOAT[512] b21007eef6b5
transformer.resblocks.8.ln_1.weight FLOAT[512] 548608b3f66f
transformer.resblocks.8.ln_2.bias FLOAT[512] c8a0f839cfdd
transformer.resblocks.8.ln_2.weight FLOAT[512] fb0126717bde
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 2b9d1d4ef362
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 6c7951465860
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] e2d8295efb15
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 74810ddfc15a
transformer.resblocks.9.ln_1.bias FLOAT[512] 0c366f3f7a38
transformer.resblocks.9.ln_1.weight FLOAT[512] 1233e26f4f34
transformer.resblocks.9.ln_2.bias FLOAT[512] c5c2b5e6c202
transformer.resblocks.9.ln_2.weight FLOAT[512] 02a970a9aedd
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 60c37c85bc1f
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 706dddbe0f19
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2048,512] ff784c781ed5
val_11 FLOAT[512,1536] 13b8bc1bdd51
val_12 FLOAT[512,2048] ec6271aac65a
val_13 FLOAT[2048,512] cae4a7e553c7
val_14 FLOAT[512,1536] e8d8d35af998
val_15 FLOAT[512,2048] f466c57fe374
val_16 FLOAT[2048,512] da1c2bd07df4
val_17 FLOAT[512,1536] f855d91256dd
val_18 FLOAT[512,2048] f02c4d5c45ed
val_19 FLOAT[2048,512] 8ca249d68cde
val_2 FLOAT[512,1536] dcec25c29f5e
val_20 FLOAT[512,1536] c174b6cc2aa6
val_21 FLOAT[512,2048] b01eae4f4c9e
val_22 FLOAT[2048,512] 0579705bb538
val_23 FLOAT[512,1536] ca770b175ecd
val_24 FLOAT[512,2048] b937f9823cd4
val_25 FLOAT[2048,512] 03e1e84d1ea2
val_26 FLOAT[512,1536] 1d55e1e0d0e7
val_27 FLOAT[512,2048] b071626b6f0f
val_28 FLOAT[2048,512] d1e5ff8d8a79
val_29 FLOAT[512,1536] a3cf9229d414
val_3 FLOAT[512,2048] ded493c77f3e
val_30 FLOAT[512,2048] 93d90db84fd4
val_31 FLOAT[2048,512] f58cd6b2d1dd
val_32 FLOAT[512,1536] c4114caa8c45
val_33 FLOAT[512,2048] 06e0be449133
val_34 FLOAT[2048,512] b3614ac24ff3
val_35 FLOAT[512,1536] 7faccd50c748
val_36 FLOAT[512,2048] ef0f55224ddf
val_37 FLOAT[2048,512] 6a1fd5a8960a
val_4 FLOAT[2048,512] f50f18c10653
val_5 FLOAT[512,1536] 2ce7e004f27a
val_6 FLOAT[512,2048] 3a7575725773
val_7 FLOAT[2048,512] 05a7fa31c853
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[512,1536] 17f0ef8a9687
val_9 FLOAT[512,2048] 4eb9f738f4fb
+587
View File
@@ -0,0 +1,587 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,50,768] add_1088
float[batch,50,768] add_1109
float[batch,50,768] add_1224
float[batch,50,768] add_1245
float[batch,50,768] add_136
float[batch,50,768] add_1360
float[batch,50,768] add_1381
float[batch,50,768] add_1496
float[batch,50,768] add_1517
float[batch,1,768] add_1517_pooled
float[batch,50,768] add_157
float[batch,1,768] add_1632
float[batch,1,768] add_1653
float[batch,50,768] add_17
float[batch,50,768] add_272
float[batch,50,768] add_293
float[batch,50,768] add_408
float[batch,50,768] add_429
float[batch,50,768] add_544
float[batch,50,768] add_565
float[batch,50,768] add_680
float[batch,50,768] add_701
float[batch,50,768] add_816
float[batch,50,768] add_837
float[batch,50,768] add_952
float[batch,50,768] add_973
float[batch,1] clamp_min
float[batch,768,7,7] conv2d
float[batch,50,3072] gelu
float[batch,50,3072] gelu_1
float[batch,50,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,50,3072] gelu_2
float[batch,50,3072] gelu_3
float[batch,50,3072] gelu_4
float[batch,50,3072] gelu_5
float[batch,50,3072] gelu_6
float[batch,50,3072] gelu_7
float[batch,50,3072] gelu_8
float[batch,50,3072] gelu_9
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,50,768] layer_norm
float[batch,50,768] layer_norm_1
float[batch,50,768] layer_norm_10
float[batch,50,768] layer_norm_11
float[batch,50,768] layer_norm_12
float[batch,50,768] layer_norm_13
float[batch,50,768] layer_norm_14
float[batch,50,768] layer_norm_15
float[batch,50,768] layer_norm_16
float[batch,50,768] layer_norm_17
float[batch,50,768] layer_norm_18
float[batch,50,768] layer_norm_19
float[batch,50,768] layer_norm_2
float[batch,50,768] layer_norm_20
float[batch,50,768] layer_norm_21
float[batch,50,768] layer_norm_22
float[batch,50,768] layer_norm_23
float[batch,1,768] layer_norm_24
float[batch,50,768] layer_norm_3
float[batch,50,768] layer_norm_4
float[batch,50,768] layer_norm_5
float[batch,50,768] layer_norm_6
float[batch,50,768] layer_norm_7
float[batch,50,768] layer_norm_8
float[batch,50,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,50,3072] linear_10
float[batch,50,768] linear_11
float[batch,50,3072] linear_14
float[batch,50,768] linear_15
float[batch,50,3072] linear_18
float[batch,50,768] linear_19
float[batch,50,3072] linear_2
float[batch,50,3072] linear_22
float[batch,50,768] linear_23
float[batch,50,3072] linear_26
float[batch,50,768] linear_27
float[batch,50,768] linear_3
float[batch,50,3072] linear_30
float[batch,50,768] linear_31
float[batch,50,3072] linear_34
float[batch,50,768] linear_35
float[batch,50,3072] linear_38
float[batch,50,768] linear_39
float[batch,50,3072] linear_42
float[batch,50,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,50,3072] linear_6
float[batch,50,768] linear_7
float[batch,512] matmul
float[batch,50,768] node_scaled_dot_product_attention_10_k
float[batch,50,768] node_scaled_dot_product_attention_10_out
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_q
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_v
float[batch,50,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_v
float[batch,50,768] node_scaled_dot_product_attention_1_k
float[batch,50,768] node_scaled_dot_product_attention_1_out
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_q
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_v
float[batch,50,768] node_scaled_dot_product_attention_2_k
float[batch,50,768] node_scaled_dot_product_attention_2_out
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_q
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_v
float[batch,50,768] node_scaled_dot_product_attention_3_k
float[batch,50,768] node_scaled_dot_product_attention_3_out
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_q
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_v
float[batch,50,768] node_scaled_dot_product_attention_4_k
float[batch,50,768] node_scaled_dot_product_attention_4_out
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_q
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_v
float[batch,50,768] node_scaled_dot_product_attention_5_k
float[batch,50,768] node_scaled_dot_product_attention_5_out
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_q
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_v
float[batch,50,768] node_scaled_dot_product_attention_6_k
float[batch,50,768] node_scaled_dot_product_attention_6_out
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_q
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_v
float[batch,50,768] node_scaled_dot_product_attention_7_k
float[batch,50,768] node_scaled_dot_product_attention_7_out
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_q
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_v
float[batch,50,768] node_scaled_dot_product_attention_8_k
float[batch,50,768] node_scaled_dot_product_attention_8_out
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_q
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_v
float[batch,50,768] node_scaled_dot_product_attention_9_k
float[batch,50,768] node_scaled_dot_product_attention_9_out
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_q
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_v
float[batch,50,768] node_scaled_dot_product_attention_k
float[batch,50,768] node_scaled_dot_product_attention_out
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_q
float[batch,50,2304] node_scaled_dot_product_attention_qkv
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_v
float[batch,49,768] permute
float[batch,50,768] scaled_dot_product_attention
float[batch,50,768] scaled_dot_product_attention_1
float[batch,50,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,50,768] scaled_dot_product_attention_2
float[batch,50,768] scaled_dot_product_attention_3
float[batch,50,768] scaled_dot_product_attention_4
float[batch,50,768] scaled_dot_product_attention_5
float[batch,50,768] scaled_dot_product_attention_6
float[batch,50,768] scaled_dot_product_attention_7
float[batch,50,768] scaled_dot_product_attention_8
float[batch,50,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,50,768] val_43
float[batch,50,3072] val_44
float[batch,50,768] val_45
float[batch,50,3072] val_46
float[batch,50,768] val_47
float[batch,50,3072] val_48
float[batch,50,768] val_49
float[batch,50,3072] val_50
float[batch,50,768] val_51
float[batch,50,3072] val_52
float[batch,50,768] val_53
float[batch,50,3072] val_54
float[batch,50,768] val_55
float[batch,50,3072] val_56
float[batch,50,768] val_57
float[batch,50,3072] val_58
float[batch,50,768] val_59
float[batch,50,3072] val_60
float[batch,50,768] val_61
float[batch,50,3072] val_62
float[batch,50,768] val_63
float[batch,50,3072] val_64
float[batch,50,768] val_65
float[batch,1,3072] val_66
float[batch,1,768] val_67
float[batch,768] val_68
float[batch,768,49] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_43 = Pad (permute, val_3, val_4)
add_17 = Add (val_43, val_42)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_44 = MatMul (layer_norm_2, val_7)
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_45 = MatMul (gelu, val_8)
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_157 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_46 = MatMul (layer_norm_4, val_10)
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_47 = MatMul (gelu_1, val_11)
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_293 = Add (add_272, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_48 = MatMul (layer_norm_6, val_13)
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_49 = MatMul (gelu_2, val_14)
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_429 = Add (add_408, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_50 = MatMul (layer_norm_8, val_16)
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_51 = MatMul (gelu_3, val_17)
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_565 = Add (add_544, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_52 = MatMul (layer_norm_10, val_19)
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_53 = MatMul (gelu_4, val_20)
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_701 = Add (add_680, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_54 = MatMul (layer_norm_12, val_22)
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_55 = MatMul (gelu_5, val_23)
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_837 = Add (add_816, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_56 = MatMul (layer_norm_14, val_25)
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_57 = MatMul (gelu_6, val_26)
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_973 = Add (add_952, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_58 = MatMul (layer_norm_16, val_28)
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_59 = MatMul (gelu_7, val_29)
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1109 = Add (add_1088, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_60 = MatMul (layer_norm_18, val_31)
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_61 = MatMul (gelu_8, val_32)
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1245 = Add (add_1224, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_62 = MatMul (layer_norm_20, val_34)
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_63 = MatMul (gelu_9, val_35)
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1381 = Add (add_1360, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_64 = MatMul (layer_norm_22, val_37)
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_65 = MatMul (gelu_10, val_38)
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1517 = Add (add_1496, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_66 = MatMul (layer_norm_24, val_40)
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_67 = MatMul (gelu_11, val_41)
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1653 = Add (add_1632, linear_47)
val_68 = Squeeze (add_1653, val_5)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_Conv_704_fused_bias FLOAT[768] 319ad0497300
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] b2a1045363cb
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 8fa482c19854
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 9a0e8c4b4d01
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 262b0513389f
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 50e6c1588a51
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] e090968d454c
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] f40b162c8bbd
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 8cd8bc012827
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] f2f7a3e2e539
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 279caf870812
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] a1459cb44013
node_scaled_dot_product_attention_wo_t FLOAT[768,768] ab8d117e5234
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] abf6f1b398bf
val_11 FLOAT[3072,768] 6f6bdf40b31e
val_12 FLOAT[768,2304] 801beb4f4b87
val_13 FLOAT[768,3072] 307df3723fe3
val_14 FLOAT[3072,768] 38118726e652
val_15 FLOAT[768,2304] 75c434997235
val_16 FLOAT[768,3072] 1dc17788eb16
val_17 FLOAT[3072,768] d96c17a7b2a0
val_18 FLOAT[768,2304] 79d426fbb5b8
val_19 FLOAT[768,3072] 415530adfa3d
val_2 INT64[1] af5570f5a181
val_20 FLOAT[3072,768] 6cfc1b0951f4
val_21 FLOAT[768,2304] c6a5a46d771c
val_22 FLOAT[768,3072] f890537a0329
val_23 FLOAT[3072,768] 5f81eabd73b4
val_24 FLOAT[768,2304] ebee824ae9bf
val_25 FLOAT[768,3072] 80f492a20297
val_26 FLOAT[3072,768] f06b5266916f
val_27 FLOAT[768,2304] 14b884080842
val_28 FLOAT[768,3072] 62a9f78d75f2
val_29 FLOAT[3072,768] 1f70546a202f
val_3 INT64[6] 6b7d92eaae70
val_30 FLOAT[768,2304] c65bcd789f0e
val_31 FLOAT[768,3072] 565f4abeb3b9
val_32 FLOAT[3072,768] 9067c4f7a501
val_33 FLOAT[768,2304] 901953aa6548
val_34 FLOAT[768,3072] bcfc45eda33d
val_35 FLOAT[3072,768] 93bdf55a2f83
val_36 FLOAT[768,2304] a1c5ec355136
val_37 FLOAT[768,3072] 290b4a1472d0
val_38 FLOAT[3072,768] 17ec2f281c40
val_39 FLOAT[768,2304] a924ba280953
val_4 FLOAT[] df3f619804a9
val_40 FLOAT[768,3072] bc2b8b7e897a
val_41 FLOAT[3072,768] 4df8d6699363
val_42 FLOAT[1,50,768] 6a010096de96
val_5 INT64[1] 7c9fa136d441
val_6 FLOAT[768,2304] 682bbe739334
val_7 FLOAT[768,3072] 5dc13f1c83ce
val_8 FLOAT[3072,768] dad16ebe454a
val_9 FLOAT[768,2304] faa86ef65076
view_target INT64[3] 69b00f163d22
visual.conv1.weight FLOAT[768,3,32,32] e3440f6dce52
visual.ln_post.bias FLOAT[768] d561d5d2685e
visual.ln_post.weight FLOAT[768] 1e3a973fae2c
visual.ln_pre.bias FLOAT[768] 5964427fb2b6
visual.ln_pre.weight FLOAT[768] dcab2d5b165d
visual.proj FLOAT[768,512] 32cc67ebfbf2
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] ae0743cfe2c9
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 827069254894
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] 780a23e97c7c
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] f633829f5ffe
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] 48586fe8fbc7
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] c88a0aa23ca2
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] b4b7ec34ba3f
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 54b40a619123
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] a915fa91c0cf
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 10c97d7efb68
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 51a16d55a00a
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 2caa3dcf2c67
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] 224594e67af1
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 619e68844082
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] f07038d4abdc
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 5698fb04d0c4
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 3334517b1d37
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] c5b9b1550b85
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 5dbd83731a1b
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] 7b33d8615c23
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] 48de70b1b03d
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] e90fa6f04841
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] f29544308898
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] fb58de70ecf3
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 5c5855de0e1d
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 53c8383d9170
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 52382aa3e9a4
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] 4cad9353e8a7
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] f474f8f334a9
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] 79c401a0e1dd
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 98e100a3d5eb
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 195dcf6c6a15
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 51f3938dedcc
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 4752cbf06728
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] e62e12dcae6e
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] e404aa649844
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] 199a00e4ebf6
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 4aa7de0f761a
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 97ade6efcaa5
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 3d9acfea870d
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] cffd705cee79
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 316c4d9ea481
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 2810ffe11fbd
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] 8fc9340705af
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] d64368d4a763
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] 75ccc9a2ade5
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] b0c0925e9f68
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] bf7a663b2339
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 809b10c35a60
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 45a86f9b5ab3
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] b3842276b3dc
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] d79acc240cbb
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 488f75cca41c
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] 646a15aeaf0c
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] de62b2997298
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] e7d5e9d717ec
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 51a96c878cd5
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 374fc78129c3
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 2c7483bd527c
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] ed203cf5ef0a
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] 6c8c5113158c
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 553ed3307151
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 7d8a9f4da756
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] a5755a94d6de
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 06e68bbdac57
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 9c461c9a4572
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 47bd185c04d0
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] f56a48e7e941
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 820d361b9b47
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] 30506af65e47
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] bb53adeed51b
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] a610cd4d1242
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 657b02118789
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 8837d4f66852
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 91c47ad5eb6c
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 218ba20a9035
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] 7f39a27e061a
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 844d999e96cd
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 9bbf502334ac
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 99af1da64ffa
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 82e40cfe30ae
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] ddddcb2491b9
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 7246a831f7fb
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 4a495bdb09c9
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] 964e7d7e83af
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] d8a8395e15f2
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] c68432c9f45c
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 271d82713f12
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] ca2e42f0b3e6
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 0f9241dcaa2a
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 1ebef7b7c05f
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 3684e0b358a7
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 2a91cacdd812
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] cf0886da845e
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 4ba96ce8ffc6
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 52813b48a30d
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,512] add_1071
float[batch,77,512] add_1092
float[batch,77,512] add_119
float[batch,77,512] add_1207
float[batch,77,512] add_1228
float[batch,77,512] add_1343
float[batch,77,512] add_1364
float[batch,77,512] add_140
float[batch,77,512] add_1479
float[batch,77,512] add_1500
float[batch,1,512] add_1500_pooled
float[batch,1,512] add_1615
float[batch,1,512] add_1636
float[batch,77,512] add_255
float[batch,77,512] add_276
float[batch,77,512] add_391
float[batch,77,512] add_4
float[batch,77,512] add_412
float[batch,77,512] add_527
float[batch,77,512] add_548
float[batch,77,512] add_663
float[batch,77,512] add_684
float[batch,77,512] add_799
float[batch,77,512] add_820
float[batch,77,512] add_935
float[batch,77,512] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,2048] gelu
float[batch,77,2048] gelu_1
float[batch,77,2048] gelu_10
float[batch,1,2048] gelu_11
float[batch,77,2048] gelu_2
float[batch,77,2048] gelu_3
float[batch,77,2048] gelu_4
float[batch,77,2048] gelu_5
float[batch,77,2048] gelu_6
float[batch,77,2048] gelu_7
float[batch,77,2048] gelu_8
float[batch,77,2048] gelu_9
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,512] matmul
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] val_39
float[batch,77,512] val_40
float[batch,77,2048] val_41
float[batch,77,512] val_42
float[batch,77,2048] val_43
float[batch,77,512] val_44
float[batch,77,2048] val_45
float[batch,77,512] val_46
float[batch,77,2048] val_47
float[batch,77,512] val_48
float[batch,77,2048] val_49
float[batch,77,512] val_50
float[batch,77,2048] val_51
float[batch,77,512] val_52
float[batch,77,2048] val_53
float[batch,77,512] val_54
float[batch,77,2048] val_55
float[batch,77,512] val_56
float[batch,77,2048] val_57
float[batch,77,512] val_58
float[batch,77,2048] val_59
float[batch,77,512] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2048] val_63
float[batch,1,512] val_64
float[batch,1,512] val_65
float[batch,512] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] 5a68c9a16ef6
ln_final.weight FLOAT[512] cb9b1ddc64f0
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] fe556b709054
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 403181ff5e74
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] 7ea6fa13feab
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 538b50748b51
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] f275b22c8ed2
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 97ec12d95a64
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 6a2db54eca16
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 7310757e25e5
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 9e3c6f7a99e9
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 65f47882f8c0
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 360909217961
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 8eb1df26d9a7
positional_embedding FLOAT[77,512] f855ec818d83
text_projection FLOAT[512,512] ffbb883bcf0e
token_embedding.weight_fp16 FLOAT16[49408,512] 88f4bf5ebbf3
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 76cd164a85d1
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] c16010ff4923
transformer.resblocks.0.ln_1.bias FLOAT[512] eaee1d670395
transformer.resblocks.0.ln_1.weight FLOAT[512] e8c1ac52b20a
transformer.resblocks.0.ln_2.bias FLOAT[512] 37cec68b4515
transformer.resblocks.0.ln_2.weight FLOAT[512] cf0e0a5d32cd
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 38477469db1f
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 54f32551c20a
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] d0f109c02e86
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] ed255a490e47
transformer.resblocks.1.ln_1.bias FLOAT[512] ffb4d4083e4d
transformer.resblocks.1.ln_1.weight FLOAT[512] 5a9799e437b7
transformer.resblocks.1.ln_2.bias FLOAT[512] 991140558352
transformer.resblocks.1.ln_2.weight FLOAT[512] 7ad2b477887a
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] 1ffbcf0c966b
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] a42e48e85d4d
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] de96c31afc80
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 81bde412b17b
transformer.resblocks.10.ln_1.bias FLOAT[512] a7fa8da1ba77
transformer.resblocks.10.ln_1.weight FLOAT[512] 0e7c1c7dc268
transformer.resblocks.10.ln_2.bias FLOAT[512] 72bb29a5bc29
transformer.resblocks.10.ln_2.weight FLOAT[512] 117fdc978971
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] 9a0c8fe016bb
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] c642d2e6b530
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] f963816388f2
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] 68e1054a4576
transformer.resblocks.11.ln_1.bias FLOAT[512] 4855dcee0c6b
transformer.resblocks.11.ln_1.weight FLOAT[512] 2acaaec11e5b
transformer.resblocks.11.ln_2.bias FLOAT[512] 790c054c926a
transformer.resblocks.11.ln_2.weight FLOAT[512] 56f10d02361b
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] fd0ec13f593e
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] f080f50889c3
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] ba6681f6216b
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] b5b9a0bb15f8
transformer.resblocks.2.ln_1.bias FLOAT[512] 826e06a60890
transformer.resblocks.2.ln_1.weight FLOAT[512] d67de24efc39
transformer.resblocks.2.ln_2.bias FLOAT[512] 5108cf5fa897
transformer.resblocks.2.ln_2.weight FLOAT[512] cf7c9bf27930
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] fb6145739195
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 163bb0342bfd
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] 21e8d178dcec
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 5097daa63125
transformer.resblocks.3.ln_1.bias FLOAT[512] afd02ec4db6d
transformer.resblocks.3.ln_1.weight FLOAT[512] b5c96767867d
transformer.resblocks.3.ln_2.bias FLOAT[512] a39f705e5b36
transformer.resblocks.3.ln_2.weight FLOAT[512] 676693670a8e
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] 3a30581cc3e9
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 8676871ca80f
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] 9ee065153d5c
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 807603aec0d5
transformer.resblocks.4.ln_1.bias FLOAT[512] 6b3fc60bfc71
transformer.resblocks.4.ln_1.weight FLOAT[512] 33e84bde2c92
transformer.resblocks.4.ln_2.bias FLOAT[512] ae82c16506d0
transformer.resblocks.4.ln_2.weight FLOAT[512] 72137c165176
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 83aa23eec605
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 670424188422
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] 41a7b1aee3c9
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 8bffa3e96572
transformer.resblocks.5.ln_1.bias FLOAT[512] 0cd1e3d98ac5
transformer.resblocks.5.ln_1.weight FLOAT[512] bd01eb1f1148
transformer.resblocks.5.ln_2.bias FLOAT[512] 8ba5b4224aec
transformer.resblocks.5.ln_2.weight FLOAT[512] 518dba4963df
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 4475d034078c
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 775a220a88e8
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] 16415ccc998f
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] fbe74180b1b3
transformer.resblocks.6.ln_1.bias FLOAT[512] 865dd8306166
transformer.resblocks.6.ln_1.weight FLOAT[512] edda0be58274
transformer.resblocks.6.ln_2.bias FLOAT[512] 8c4c8f02e16c
transformer.resblocks.6.ln_2.weight FLOAT[512] fe49b592c388
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] fbe940c743b6
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 98d7a11e9af3
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] dee93761a6a2
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] df37d0ab48ff
transformer.resblocks.7.ln_1.bias FLOAT[512] 15b32d5109df
transformer.resblocks.7.ln_1.weight FLOAT[512] 32a74f93b930
transformer.resblocks.7.ln_2.bias FLOAT[512] c2b5e23d632c
transformer.resblocks.7.ln_2.weight FLOAT[512] 3ff8d34def28
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] ef898249e652
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 2544f1b17853
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] da452321d3c5
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] a0fc0ce459c2
transformer.resblocks.8.ln_1.bias FLOAT[512] 206ffccdc117
transformer.resblocks.8.ln_1.weight FLOAT[512] 05b2453b3f80
transformer.resblocks.8.ln_2.bias FLOAT[512] e8b0c2c118b2
transformer.resblocks.8.ln_2.weight FLOAT[512] 50e44e57931f
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] d8b75fc9be8a
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 3ff6cc55263d
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 6c55f2eb2f0c
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] a13bed94a593
transformer.resblocks.9.ln_1.bias FLOAT[512] 4fddc5c902ba
transformer.resblocks.9.ln_1.weight FLOAT[512] bd1ceaabbe9d
transformer.resblocks.9.ln_2.bias FLOAT[512] 6afe8c307529
transformer.resblocks.9.ln_2.weight FLOAT[512] 90ff0b6eb665
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 498a4c0258a7
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 2be07a5dfaf2
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2048,512] 51f259ad03f3
val_11 FLOAT[512,1536] 93118c6af6db
val_12 FLOAT[512,2048] c0f3308bc9dd
val_13 FLOAT[2048,512] 331f5cc8b814
val_14 FLOAT[512,1536] d61b354cef68
val_15 FLOAT[512,2048] 640e14e90f32
val_16 FLOAT[2048,512] 8fc73ad001d9
val_17 FLOAT[512,1536] 708dad92edb3
val_18 FLOAT[512,2048] 7bb8224c9000
val_19 FLOAT[2048,512] daef7a7efae4
val_2 FLOAT[512,1536] 044bc5a2b2f4
val_20 FLOAT[512,1536] 11c6fa5bc6f0
val_21 FLOAT[512,2048] 081c5da7ee61
val_22 FLOAT[2048,512] cd1e58ba5b88
val_23 FLOAT[512,1536] 49e6d96d8954
val_24 FLOAT[512,2048] c2a36cd73c58
val_25 FLOAT[2048,512] 6565207763d6
val_26 FLOAT[512,1536] 8fb76527708e
val_27 FLOAT[512,2048] 7e5fb2454ca0
val_28 FLOAT[2048,512] e6fc37b3c59e
val_29 FLOAT[512,1536] b2a35de53ed3
val_3 FLOAT[512,2048] b55d89a8913d
val_30 FLOAT[512,2048] 175fbd32c7a2
val_31 FLOAT[2048,512] 13075832fbe9
val_32 FLOAT[512,1536] 14384ed63a6e
val_33 FLOAT[512,2048] 618b8ad44943
val_34 FLOAT[2048,512] edfc676841a1
val_35 FLOAT[512,1536] f7b91783d792
val_36 FLOAT[512,2048] d9633a3f737c
val_37 FLOAT[2048,512] 0ec6f5eb2ada
val_4 FLOAT[2048,512] fdaa69ed9c37
val_5 FLOAT[512,1536] b1b855aa1b68
val_6 FLOAT[512,2048] cf7bb83e6e89
val_7 FLOAT[2048,512] 4fa5998350d1
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[512,1536] e6aaf160bd52
val_9 FLOAT[512,2048] 51143f9360df
@@ -0,0 +1,587 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,50,768] add_1088
float[batch,50,768] add_1109
float[batch,50,768] add_1224
float[batch,50,768] add_1245
float[batch,50,768] add_136
float[batch,50,768] add_1360
float[batch,50,768] add_1381
float[batch,50,768] add_1496
float[batch,50,768] add_1517
float[batch,1,768] add_1517_pooled
float[batch,50,768] add_157
float[batch,1,768] add_1632
float[batch,1,768] add_1653
float[batch,50,768] add_17
float[batch,50,768] add_272
float[batch,50,768] add_293
float[batch,50,768] add_408
float[batch,50,768] add_429
float[batch,50,768] add_544
float[batch,50,768] add_565
float[batch,50,768] add_680
float[batch,50,768] add_701
float[batch,50,768] add_816
float[batch,50,768] add_837
float[batch,50,768] add_952
float[batch,50,768] add_973
float[batch,1] clamp_min
float[batch,768,7,7] conv2d
float[batch,50,3072] gelu
float[batch,50,3072] gelu_1
float[batch,50,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,50,3072] gelu_2
float[batch,50,3072] gelu_3
float[batch,50,3072] gelu_4
float[batch,50,3072] gelu_5
float[batch,50,3072] gelu_6
float[batch,50,3072] gelu_7
float[batch,50,3072] gelu_8
float[batch,50,3072] gelu_9
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,50,768] layer_norm
float[batch,50,768] layer_norm_1
float[batch,50,768] layer_norm_10
float[batch,50,768] layer_norm_11
float[batch,50,768] layer_norm_12
float[batch,50,768] layer_norm_13
float[batch,50,768] layer_norm_14
float[batch,50,768] layer_norm_15
float[batch,50,768] layer_norm_16
float[batch,50,768] layer_norm_17
float[batch,50,768] layer_norm_18
float[batch,50,768] layer_norm_19
float[batch,50,768] layer_norm_2
float[batch,50,768] layer_norm_20
float[batch,50,768] layer_norm_21
float[batch,50,768] layer_norm_22
float[batch,50,768] layer_norm_23
float[batch,1,768] layer_norm_24
float[batch,50,768] layer_norm_3
float[batch,50,768] layer_norm_4
float[batch,50,768] layer_norm_5
float[batch,50,768] layer_norm_6
float[batch,50,768] layer_norm_7
float[batch,50,768] layer_norm_8
float[batch,50,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,50,3072] linear_10
float[batch,50,768] linear_11
float[batch,50,3072] linear_14
float[batch,50,768] linear_15
float[batch,50,3072] linear_18
float[batch,50,768] linear_19
float[batch,50,3072] linear_2
float[batch,50,3072] linear_22
float[batch,50,768] linear_23
float[batch,50,3072] linear_26
float[batch,50,768] linear_27
float[batch,50,768] linear_3
float[batch,50,3072] linear_30
float[batch,50,768] linear_31
float[batch,50,3072] linear_34
float[batch,50,768] linear_35
float[batch,50,3072] linear_38
float[batch,50,768] linear_39
float[batch,50,3072] linear_42
float[batch,50,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,50,3072] linear_6
float[batch,50,768] linear_7
float[batch,512] matmul
float[batch,50,768] node_scaled_dot_product_attention_10_k
float[batch,50,768] node_scaled_dot_product_attention_10_out
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_q
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_v
float[batch,50,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_v
float[batch,50,768] node_scaled_dot_product_attention_1_k
float[batch,50,768] node_scaled_dot_product_attention_1_out
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_q
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_v
float[batch,50,768] node_scaled_dot_product_attention_2_k
float[batch,50,768] node_scaled_dot_product_attention_2_out
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_q
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_v
float[batch,50,768] node_scaled_dot_product_attention_3_k
float[batch,50,768] node_scaled_dot_product_attention_3_out
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_q
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_v
float[batch,50,768] node_scaled_dot_product_attention_4_k
float[batch,50,768] node_scaled_dot_product_attention_4_out
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_q
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_v
float[batch,50,768] node_scaled_dot_product_attention_5_k
float[batch,50,768] node_scaled_dot_product_attention_5_out
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_q
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_v
float[batch,50,768] node_scaled_dot_product_attention_6_k
float[batch,50,768] node_scaled_dot_product_attention_6_out
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_q
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_v
float[batch,50,768] node_scaled_dot_product_attention_7_k
float[batch,50,768] node_scaled_dot_product_attention_7_out
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_q
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_v
float[batch,50,768] node_scaled_dot_product_attention_8_k
float[batch,50,768] node_scaled_dot_product_attention_8_out
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_q
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_v
float[batch,50,768] node_scaled_dot_product_attention_9_k
float[batch,50,768] node_scaled_dot_product_attention_9_out
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_q
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_v
float[batch,50,768] node_scaled_dot_product_attention_k
float[batch,50,768] node_scaled_dot_product_attention_out
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_q
float[batch,50,2304] node_scaled_dot_product_attention_qkv
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_v
float[batch,49,768] permute
float[batch,50,768] scaled_dot_product_attention
float[batch,50,768] scaled_dot_product_attention_1
float[batch,50,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,50,768] scaled_dot_product_attention_2
float[batch,50,768] scaled_dot_product_attention_3
float[batch,50,768] scaled_dot_product_attention_4
float[batch,50,768] scaled_dot_product_attention_5
float[batch,50,768] scaled_dot_product_attention_6
float[batch,50,768] scaled_dot_product_attention_7
float[batch,50,768] scaled_dot_product_attention_8
float[batch,50,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,50,768] val_43
float[batch,50,3072] val_44
float[batch,50,768] val_45
float[batch,50,3072] val_46
float[batch,50,768] val_47
float[batch,50,3072] val_48
float[batch,50,768] val_49
float[batch,50,3072] val_50
float[batch,50,768] val_51
float[batch,50,3072] val_52
float[batch,50,768] val_53
float[batch,50,3072] val_54
float[batch,50,768] val_55
float[batch,50,3072] val_56
float[batch,50,768] val_57
float[batch,50,3072] val_58
float[batch,50,768] val_59
float[batch,50,3072] val_60
float[batch,50,768] val_61
float[batch,50,3072] val_62
float[batch,50,768] val_63
float[batch,50,3072] val_64
float[batch,50,768] val_65
float[batch,1,3072] val_66
float[batch,1,768] val_67
float[batch,768] val_68
float[batch,768,49] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_43 = Pad (permute, val_3, val_4)
add_17 = Add (val_43, val_42)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_44 = MatMul (layer_norm_2, val_7)
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_45 = MatMul (gelu, val_8)
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_157 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_46 = MatMul (layer_norm_4, val_10)
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_47 = MatMul (gelu_1, val_11)
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_293 = Add (add_272, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_48 = MatMul (layer_norm_6, val_13)
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_49 = MatMul (gelu_2, val_14)
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_429 = Add (add_408, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_50 = MatMul (layer_norm_8, val_16)
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_51 = MatMul (gelu_3, val_17)
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_565 = Add (add_544, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_52 = MatMul (layer_norm_10, val_19)
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_53 = MatMul (gelu_4, val_20)
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_701 = Add (add_680, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_54 = MatMul (layer_norm_12, val_22)
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_55 = MatMul (gelu_5, val_23)
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_837 = Add (add_816, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_56 = MatMul (layer_norm_14, val_25)
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_57 = MatMul (gelu_6, val_26)
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_973 = Add (add_952, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_58 = MatMul (layer_norm_16, val_28)
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_59 = MatMul (gelu_7, val_29)
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1109 = Add (add_1088, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_60 = MatMul (layer_norm_18, val_31)
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_61 = MatMul (gelu_8, val_32)
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1245 = Add (add_1224, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_62 = MatMul (layer_norm_20, val_34)
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_63 = MatMul (gelu_9, val_35)
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1381 = Add (add_1360, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_64 = MatMul (layer_norm_22, val_37)
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_65 = MatMul (gelu_10, val_38)
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1517 = Add (add_1496, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_66 = MatMul (layer_norm_24, val_40)
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_67 = MatMul (gelu_11, val_41)
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1653 = Add (add_1632, linear_47)
val_68 = Squeeze (add_1653, val_5)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_Conv_704_fused_bias FLOAT[768] 799a25158bb7
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] bf9eef022b15
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 231143b9a626
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] a27e6288a7e0
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 9e3190e6b459
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 318582ea544e
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] e1304858071f
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] e8b5102608d2
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 1593fb3f0bdf
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 5c85df03d917
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 07205dff3c3f
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] c6d2159ac451
node_scaled_dot_product_attention_wo_t FLOAT[768,768] d298dea248ba
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] 9a765b083fc0
val_11 FLOAT[3072,768] eec977effed7
val_12 FLOAT[768,2304] 8c678c126da4
val_13 FLOAT[768,3072] 9c3780d937d4
val_14 FLOAT[3072,768] ab9f68b0ac5e
val_15 FLOAT[768,2304] c34595af10f2
val_16 FLOAT[768,3072] fc935bc9bc7c
val_17 FLOAT[3072,768] 825212361feb
val_18 FLOAT[768,2304] 274b4b571693
val_19 FLOAT[768,3072] 98873f99c7e5
val_2 INT64[1] af5570f5a181
val_20 FLOAT[3072,768] d93e9ac834fe
val_21 FLOAT[768,2304] 43896aacf7c6
val_22 FLOAT[768,3072] d405e6afdc40
val_23 FLOAT[3072,768] eb5a13664a10
val_24 FLOAT[768,2304] 1c0ceb5514ea
val_25 FLOAT[768,3072] 41d7ca48c916
val_26 FLOAT[3072,768] 33c2465329c5
val_27 FLOAT[768,2304] 9741b3461247
val_28 FLOAT[768,3072] 18939c4e36e9
val_29 FLOAT[3072,768] 1cfd1b2d91b8
val_3 INT64[6] 6b7d92eaae70
val_30 FLOAT[768,2304] 2e78aba72932
val_31 FLOAT[768,3072] 466519ef6d75
val_32 FLOAT[3072,768] 7f1140450ca7
val_33 FLOAT[768,2304] efb258d47c36
val_34 FLOAT[768,3072] e89f4942cb0b
val_35 FLOAT[3072,768] 379f57966677
val_36 FLOAT[768,2304] 8746e4da713e
val_37 FLOAT[768,3072] 66300aab7917
val_38 FLOAT[3072,768] e6cf84c991cd
val_39 FLOAT[768,2304] 0ded75fbda9d
val_4 FLOAT[] df3f619804a9
val_40 FLOAT[768,3072] d986ac5ccd5c
val_41 FLOAT[3072,768] 3210fb2359e6
val_42 FLOAT[1,50,768] 75204fd3cf6f
val_5 INT64[1] 7c9fa136d441
val_6 FLOAT[768,2304] 0348a656a124
val_7 FLOAT[768,3072] 3fec50a53a44
val_8 FLOAT[3072,768] aec843040321
val_9 FLOAT[768,2304] 30339b7e9306
view_target INT64[3] 69b00f163d22
visual.conv1.weight FLOAT[768,3,32,32] 5b58bf5c5846
visual.ln_post.bias FLOAT[768] e2cb5541df4f
visual.ln_post.weight FLOAT[768] 2d5daf680aa2
visual.ln_pre.bias FLOAT[768] fe454f7034bd
visual.ln_pre.weight FLOAT[768] bc5f1fdff4b8
visual.proj FLOAT[768,512] dde44e4e2f3f
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 1ec633291f01
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] fd44d047ec7e
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] eddb3de95fcf
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] 4bd136873d77
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] f22388b2fc16
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] 57d9c3df4c00
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 7a689cde92cd
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] b0fc6afc981a
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 857a6f08128f
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] cc8a0066aa13
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] a8eac74d8ac5
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] e3a514a089b0
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] bb225e0248b9
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 56a266523a2b
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] d26a378cdaca
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] e535b053f6b4
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 7d46d3860b88
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 8b958f0f920d
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 70b44ba19368
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] f474391150df
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] a9445a0c9e1f
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 27ad86621e1b
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 0b0d11fce730
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] eaf150b3bab5
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 1dfd5b94f0a6
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] c3a951043824
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 473aa6c5cf63
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] b2be989eb2f9
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 31481c8086b7
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] c152dcf7a9c9
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 2e9bb1848703
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 8af895689cc2
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 201e25275016
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 96fc48d21053
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] 498127250e6a
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] d9b6271d2db4
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] 41ec11c4433f
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 9cc8c6a84284
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 2f6f5b8ba5d7
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] c6a4ea5b0d91
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 7747f7e6a4ef
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 2e997f9c972e
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 45bf89bb0c98
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] d0f70d395bbc
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] 6f0016f00b12
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] 81c2849abebb
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] ea96a2454b11
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] eb3f0256c433
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] a248bde02047
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 1d0340604676
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] 4f9029592c3f
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 45cca5ea733e
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] fb42844a2277
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] 249a1d8b6d86
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] b2af754fb52e
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 8d14f227a87d
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 9b8d2f922b34
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 65ba214f673e
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] f7ef5d3562d0
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] 4e2ccb0a165f
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] e80ab11bb94b
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] d7d08ed74fa6
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 16331a1fad46
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 088dcc34f8b1
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 4e602c091077
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] e0a4fa9ec557
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 2e7cf53abb77
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] 8275394be666
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 4fcce19797d3
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] 918bcb8c5d62
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 890d9d9cf123
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 56a117bbf3d0
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 83512e372f10
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 49320fe551a8
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] d8c82cbe070b
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 1de5c2e2627f
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] 1312bbf94c4f
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] f52f5d7a3bcb
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 417a9b3afe3b
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 076cd0df0c53
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] a49258034d93
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] a5770708f258
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 01eb4d3d765b
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] e005cc2b217e
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] 3c8a44b7b95e
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] cca46ff64772
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] d475ef9a80c6
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] c6ddcff89448
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 063cacdf7556
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 6d43adcd0178
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 837f444fbd8e
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 86e0a9039686
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 424b279d9900
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] dc2f37b68119
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] bedd71d23ec6
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] b77004fe1146
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,512] add_1071
float[batch,77,512] add_1092
float[batch,77,512] add_119
float[batch,77,512] add_1207
float[batch,77,512] add_1228
float[batch,77,512] add_1343
float[batch,77,512] add_1364
float[batch,77,512] add_140
float[batch,77,512] add_1479
float[batch,77,512] add_1500
float[batch,1,512] add_1500_pooled
float[batch,1,512] add_1615
float[batch,1,512] add_1636
float[batch,77,512] add_255
float[batch,77,512] add_276
float[batch,77,512] add_391
float[batch,77,512] add_4
float[batch,77,512] add_412
float[batch,77,512] add_527
float[batch,77,512] add_548
float[batch,77,512] add_663
float[batch,77,512] add_684
float[batch,77,512] add_799
float[batch,77,512] add_820
float[batch,77,512] add_935
float[batch,77,512] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,2048] gelu
float[batch,77,2048] gelu_1
float[batch,77,2048] gelu_10
float[batch,1,2048] gelu_11
float[batch,77,2048] gelu_2
float[batch,77,2048] gelu_3
float[batch,77,2048] gelu_4
float[batch,77,2048] gelu_5
float[batch,77,2048] gelu_6
float[batch,77,2048] gelu_7
float[batch,77,2048] gelu_8
float[batch,77,2048] gelu_9
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,512] matmul
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] val_39
float[batch,77,512] val_40
float[batch,77,2048] val_41
float[batch,77,512] val_42
float[batch,77,2048] val_43
float[batch,77,512] val_44
float[batch,77,2048] val_45
float[batch,77,512] val_46
float[batch,77,2048] val_47
float[batch,77,512] val_48
float[batch,77,2048] val_49
float[batch,77,512] val_50
float[batch,77,2048] val_51
float[batch,77,512] val_52
float[batch,77,2048] val_53
float[batch,77,512] val_54
float[batch,77,2048] val_55
float[batch,77,512] val_56
float[batch,77,2048] val_57
float[batch,77,512] val_58
float[batch,77,2048] val_59
float[batch,77,512] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,2048] val_63
float[batch,1,512] val_64
float[batch,1,512] val_65
float[batch,512] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] efe640c21500
ln_final.weight FLOAT[512] e183bb4c4163
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] ee8fe959f29f
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 3d78852a3939
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] b56ad1606711
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] b3d858133d6e
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] b72afe18f050
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 0541782c5e67
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 9cb4897b8290
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] cd6d23bbfaa3
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 8d0ffc94141a
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] 7cabcf0a48b8
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] 6f6771ea24d4
node_scaled_dot_product_attention_wo_t FLOAT[512,512] 66677dc2e4e9
positional_embedding FLOAT[77,512] b3a6e832fb18
text_projection FLOAT[512,512] e9e98f1232eb
token_embedding.weight_fp16 FLOAT16[49408,512] d993f76776bb
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] 579de9156b71
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] 54e8398a937a
transformer.resblocks.0.ln_1.bias FLOAT[512] bed40fbdcb6b
transformer.resblocks.0.ln_1.weight FLOAT[512] 7bd7f86ddb79
transformer.resblocks.0.ln_2.bias FLOAT[512] da39e5fe58f2
transformer.resblocks.0.ln_2.weight FLOAT[512] 89bc220b375b
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] ac47fed9a163
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 1294896a70e6
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] facf1d841597
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 5ae56e7c6cc5
transformer.resblocks.1.ln_1.bias FLOAT[512] 839c87e72944
transformer.resblocks.1.ln_1.weight FLOAT[512] feaf35dccbd5
transformer.resblocks.1.ln_2.bias FLOAT[512] ed7ceb8083c3
transformer.resblocks.1.ln_2.weight FLOAT[512] 20a99bb95853
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] dae6b3aba658
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] c7a821e0caea
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 4074ac407e9b
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] c5286b71a9f9
transformer.resblocks.10.ln_1.bias FLOAT[512] 15a94d176ae7
transformer.resblocks.10.ln_1.weight FLOAT[512] 530317acfadb
transformer.resblocks.10.ln_2.bias FLOAT[512] ad23c04a2dd7
transformer.resblocks.10.ln_2.weight FLOAT[512] 7de486aae8d3
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] a3932c314b9e
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 5d191acb9282
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] 0d6f5212dccf
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] b4567e301bdd
transformer.resblocks.11.ln_1.bias FLOAT[512] b0874ecfd897
transformer.resblocks.11.ln_1.weight FLOAT[512] 8b008528f18d
transformer.resblocks.11.ln_2.bias FLOAT[512] 0329d2c6f765
transformer.resblocks.11.ln_2.weight FLOAT[512] 086045b4b7c0
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] e373a7cd325c
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] bba9c5e2bc8d
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] c2f5ff2a5a62
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 14b71c81429f
transformer.resblocks.2.ln_1.bias FLOAT[512] 42f6cb687067
transformer.resblocks.2.ln_1.weight FLOAT[512] 5320b22518f7
transformer.resblocks.2.ln_2.bias FLOAT[512] 57cf62d186b3
transformer.resblocks.2.ln_2.weight FLOAT[512] df37124dd862
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] bd7e692af19a
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] eaf0ba52849b
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] a8de0f7880b9
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 6366280e1205
transformer.resblocks.3.ln_1.bias FLOAT[512] 1655e9b23b1c
transformer.resblocks.3.ln_1.weight FLOAT[512] cc34814a6e18
transformer.resblocks.3.ln_2.bias FLOAT[512] 888ef7e1fcf1
transformer.resblocks.3.ln_2.weight FLOAT[512] 5a4436ad7aa4
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] f4f29a9ae38b
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] 9b76283a9cf6
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] b5994868d180
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] 294d8a5b1ae5
transformer.resblocks.4.ln_1.bias FLOAT[512] 52b041828133
transformer.resblocks.4.ln_1.weight FLOAT[512] 75a6ca5acbac
transformer.resblocks.4.ln_2.bias FLOAT[512] e4ba4b797199
transformer.resblocks.4.ln_2.weight FLOAT[512] 6ed7a1a0e818
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] cb11fd8caecd
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 35b8071447c5
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] a4e14137b04d
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 7bfe96c534e0
transformer.resblocks.5.ln_1.bias FLOAT[512] 5aec0dd4da43
transformer.resblocks.5.ln_1.weight FLOAT[512] 18664afc87c4
transformer.resblocks.5.ln_2.bias FLOAT[512] c3a730e92fb4
transformer.resblocks.5.ln_2.weight FLOAT[512] 9724008fde52
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 9c3b68c6b9cd
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 91a9f5c9e03d
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] c012de365bf7
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 9d08e311c39b
transformer.resblocks.6.ln_1.bias FLOAT[512] 64dc00a31668
transformer.resblocks.6.ln_1.weight FLOAT[512] 6cd9868841d3
transformer.resblocks.6.ln_2.bias FLOAT[512] d7ddd7d231a3
transformer.resblocks.6.ln_2.weight FLOAT[512] 9b3827eaa013
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] fdd7ad5d83db
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 30b8940fc1c9
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] fcdacd22a47c
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 813e8bd05335
transformer.resblocks.7.ln_1.bias FLOAT[512] e25b140884a6
transformer.resblocks.7.ln_1.weight FLOAT[512] 97e6bca02716
transformer.resblocks.7.ln_2.bias FLOAT[512] 55c56c8d36c1
transformer.resblocks.7.ln_2.weight FLOAT[512] 30c01eece8a5
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] 34cfe2d5442c
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 26665762ca9b
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 43e29bc54dda
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] d60663e6f191
transformer.resblocks.8.ln_1.bias FLOAT[512] 1e3c84f6bf2e
transformer.resblocks.8.ln_1.weight FLOAT[512] 9ecf6c151a10
transformer.resblocks.8.ln_2.bias FLOAT[512] 407de41c2e09
transformer.resblocks.8.ln_2.weight FLOAT[512] 608aa8392d14
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] d40f47a22882
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] e8f27d018dcb
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 3e086247045a
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 8e65ee24db07
transformer.resblocks.9.ln_1.bias FLOAT[512] 8cf6e1d922d2
transformer.resblocks.9.ln_1.weight FLOAT[512] 50850e877523
transformer.resblocks.9.ln_2.bias FLOAT[512] c2f650a0403d
transformer.resblocks.9.ln_2.weight FLOAT[512] c8869b1263ac
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] 7bcdc0bb1085
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 0cb98276ef95
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[2048,512] 85faea02c762
val_11 FLOAT[512,1536] e31015b4b870
val_12 FLOAT[512,2048] 3d3746498b20
val_13 FLOAT[2048,512] 9d60d5e9b28b
val_14 FLOAT[512,1536] 5cf528724865
val_15 FLOAT[512,2048] 193a9a97d832
val_16 FLOAT[2048,512] 1728eaf1285b
val_17 FLOAT[512,1536] 90ed45dae453
val_18 FLOAT[512,2048] 4d61a110f270
val_19 FLOAT[2048,512] b7faa6cec26f
val_2 FLOAT[512,1536] 768967a723d6
val_20 FLOAT[512,1536] 548b3e323ace
val_21 FLOAT[512,2048] d1f710e916a7
val_22 FLOAT[2048,512] e634a3a743ee
val_23 FLOAT[512,1536] d8320064e956
val_24 FLOAT[512,2048] 46b6f0d4a71b
val_25 FLOAT[2048,512] 5fefa32fd8a4
val_26 FLOAT[512,1536] 706f57ccabb3
val_27 FLOAT[512,2048] 6ff9afeed665
val_28 FLOAT[2048,512] a14c32793eb1
val_29 FLOAT[512,1536] 4e7d7658f25c
val_3 FLOAT[512,2048] c44b2a97a0b2
val_30 FLOAT[512,2048] c2e5282fccd4
val_31 FLOAT[2048,512] ba2e1972d2cb
val_32 FLOAT[512,1536] 13395a2dafaf
val_33 FLOAT[512,2048] efb598f6a4e9
val_34 FLOAT[2048,512] c2d67e875bd7
val_35 FLOAT[512,1536] 7c407b8dd0ae
val_36 FLOAT[512,2048] 7ad16ffb2986
val_37 FLOAT[2048,512] d0999af83e80
val_4 FLOAT[2048,512] 980d338b9cdf
val_5 FLOAT[512,1536] 55edc8395be9
val_6 FLOAT[512,2048] e8c312670124
val_7 FLOAT[2048,512] 6586593fc939
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[512,1536] d0b4e306d3ae
val_9 FLOAT[512,2048] b0c27a3fb3d8
@@ -0,0 +1,587 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,50,768] add_1088
float[batch,50,768] add_1109
float[batch,50,768] add_1224
float[batch,50,768] add_1245
float[batch,50,768] add_136
float[batch,50,768] add_1360
float[batch,50,768] add_1381
float[batch,50,768] add_1496
float[batch,50,768] add_1517
float[batch,1,768] add_1517_pooled
float[batch,50,768] add_157
float[batch,1,768] add_1632
float[batch,1,768] add_1653
float[batch,50,768] add_17
float[batch,50,768] add_272
float[batch,50,768] add_293
float[batch,50,768] add_408
float[batch,50,768] add_429
float[batch,50,768] add_544
float[batch,50,768] add_565
float[batch,50,768] add_680
float[batch,50,768] add_701
float[batch,50,768] add_816
float[batch,50,768] add_837
float[batch,50,768] add_952
float[batch,50,768] add_973
float[batch,1] clamp_min
float[batch,768,7,7] conv2d
float[batch,50,3072] gelu
float[batch,50,3072] gelu_1
float[batch,50,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,50,3072] gelu_2
float[batch,50,3072] gelu_3
float[batch,50,3072] gelu_4
float[batch,50,3072] gelu_5
float[batch,50,3072] gelu_6
float[batch,50,3072] gelu_7
float[batch,50,3072] gelu_8
float[batch,50,3072] gelu_9
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,50,768] layer_norm
float[batch,50,768] layer_norm_1
float[batch,50,768] layer_norm_10
float[batch,50,768] layer_norm_11
float[batch,50,768] layer_norm_12
float[batch,50,768] layer_norm_13
float[batch,50,768] layer_norm_14
float[batch,50,768] layer_norm_15
float[batch,50,768] layer_norm_16
float[batch,50,768] layer_norm_17
float[batch,50,768] layer_norm_18
float[batch,50,768] layer_norm_19
float[batch,50,768] layer_norm_2
float[batch,50,768] layer_norm_20
float[batch,50,768] layer_norm_21
float[batch,50,768] layer_norm_22
float[batch,50,768] layer_norm_23
float[batch,1,768] layer_norm_24
float[batch,50,768] layer_norm_3
float[batch,50,768] layer_norm_4
float[batch,50,768] layer_norm_5
float[batch,50,768] layer_norm_6
float[batch,50,768] layer_norm_7
float[batch,50,768] layer_norm_8
float[batch,50,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,50,3072] linear_10
float[batch,50,768] linear_11
float[batch,50,3072] linear_14
float[batch,50,768] linear_15
float[batch,50,3072] linear_18
float[batch,50,768] linear_19
float[batch,50,3072] linear_2
float[batch,50,3072] linear_22
float[batch,50,768] linear_23
float[batch,50,3072] linear_26
float[batch,50,768] linear_27
float[batch,50,768] linear_3
float[batch,50,3072] linear_30
float[batch,50,768] linear_31
float[batch,50,3072] linear_34
float[batch,50,768] linear_35
float[batch,50,3072] linear_38
float[batch,50,768] linear_39
float[batch,50,3072] linear_42
float[batch,50,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,50,3072] linear_6
float[batch,50,768] linear_7
float[batch,512] matmul
float[batch,50,768] node_scaled_dot_product_attention_10_k
float[batch,50,768] node_scaled_dot_product_attention_10_out
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_q
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_v
float[batch,50,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_v
float[batch,50,768] node_scaled_dot_product_attention_1_k
float[batch,50,768] node_scaled_dot_product_attention_1_out
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_q
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_v
float[batch,50,768] node_scaled_dot_product_attention_2_k
float[batch,50,768] node_scaled_dot_product_attention_2_out
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_q
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_v
float[batch,50,768] node_scaled_dot_product_attention_3_k
float[batch,50,768] node_scaled_dot_product_attention_3_out
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_q
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_v
float[batch,50,768] node_scaled_dot_product_attention_4_k
float[batch,50,768] node_scaled_dot_product_attention_4_out
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_q
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_v
float[batch,50,768] node_scaled_dot_product_attention_5_k
float[batch,50,768] node_scaled_dot_product_attention_5_out
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_q
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_v
float[batch,50,768] node_scaled_dot_product_attention_6_k
float[batch,50,768] node_scaled_dot_product_attention_6_out
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_q
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_v
float[batch,50,768] node_scaled_dot_product_attention_7_k
float[batch,50,768] node_scaled_dot_product_attention_7_out
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_q
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_v
float[batch,50,768] node_scaled_dot_product_attention_8_k
float[batch,50,768] node_scaled_dot_product_attention_8_out
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_q
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_v
float[batch,50,768] node_scaled_dot_product_attention_9_k
float[batch,50,768] node_scaled_dot_product_attention_9_out
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_q
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_v
float[batch,50,768] node_scaled_dot_product_attention_k
float[batch,50,768] node_scaled_dot_product_attention_out
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_q
float[batch,50,2304] node_scaled_dot_product_attention_qkv
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_v
float[batch,49,768] permute
float[batch,50,768] scaled_dot_product_attention
float[batch,50,768] scaled_dot_product_attention_1
float[batch,50,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,50,768] scaled_dot_product_attention_2
float[batch,50,768] scaled_dot_product_attention_3
float[batch,50,768] scaled_dot_product_attention_4
float[batch,50,768] scaled_dot_product_attention_5
float[batch,50,768] scaled_dot_product_attention_6
float[batch,50,768] scaled_dot_product_attention_7
float[batch,50,768] scaled_dot_product_attention_8
float[batch,50,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,50,768] val_43
float[batch,50,3072] val_44
float[batch,50,768] val_45
float[batch,50,3072] val_46
float[batch,50,768] val_47
float[batch,50,3072] val_48
float[batch,50,768] val_49
float[batch,50,3072] val_50
float[batch,50,768] val_51
float[batch,50,3072] val_52
float[batch,50,768] val_53
float[batch,50,3072] val_54
float[batch,50,768] val_55
float[batch,50,3072] val_56
float[batch,50,768] val_57
float[batch,50,3072] val_58
float[batch,50,768] val_59
float[batch,50,3072] val_60
float[batch,50,768] val_61
float[batch,50,3072] val_62
float[batch,50,768] val_63
float[batch,50,3072] val_64
float[batch,50,768] val_65
float[batch,1,3072] val_66
float[batch,1,768] val_67
float[batch,768] val_68
float[batch,768,49] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_43 = Pad (permute, val_3, val_4)
add_17 = Add (val_43, val_42)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_44 = MatMul (layer_norm_2, val_7)
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_45 = MatMul (gelu, val_8)
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_157 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_46 = MatMul (layer_norm_4, val_10)
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_47 = MatMul (gelu_1, val_11)
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_293 = Add (add_272, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_48 = MatMul (layer_norm_6, val_13)
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_49 = MatMul (gelu_2, val_14)
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_429 = Add (add_408, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_50 = MatMul (layer_norm_8, val_16)
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_51 = MatMul (gelu_3, val_17)
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_565 = Add (add_544, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_52 = MatMul (layer_norm_10, val_19)
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_53 = MatMul (gelu_4, val_20)
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_701 = Add (add_680, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_54 = MatMul (layer_norm_12, val_22)
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_55 = MatMul (gelu_5, val_23)
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_837 = Add (add_816, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_56 = MatMul (layer_norm_14, val_25)
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_57 = MatMul (gelu_6, val_26)
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_973 = Add (add_952, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_58 = MatMul (layer_norm_16, val_28)
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_59 = MatMul (gelu_7, val_29)
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1109 = Add (add_1088, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_60 = MatMul (layer_norm_18, val_31)
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_61 = MatMul (gelu_8, val_32)
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1245 = Add (add_1224, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_62 = MatMul (layer_norm_20, val_34)
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_63 = MatMul (gelu_9, val_35)
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1381 = Add (add_1360, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_64 = MatMul (layer_norm_22, val_37)
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_65 = MatMul (gelu_10, val_38)
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1517 = Add (add_1496, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_66 = MatMul (layer_norm_24, val_40)
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_67 = MatMul (gelu_11, val_41)
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1653 = Add (add_1632, linear_47)
val_68 = Squeeze (add_1653, val_5)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_Conv_704_fused_bias FLOAT[768] b3df0764eb6a
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] de4c2b1e169e
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] a7a369b02d5c
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 29c329de3475
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 095ad4a9397d
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] d79650e48d4e
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 7b9749d52192
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] e037982f06db
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 67036bbcdbc0
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] bbd035bdfe75
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 36ac3c276400
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ca6957676745
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 9834909ba1e0
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] d99e9ae91d85
val_11 FLOAT[3072,768] f1fefe16aa22
val_12 FLOAT[768,2304] 79d7967c68bc
val_13 FLOAT[768,3072] 843199ea1f8b
val_14 FLOAT[3072,768] 7edfe5f21841
val_15 FLOAT[768,2304] baa3e16299a6
val_16 FLOAT[768,3072] e6770693031c
val_17 FLOAT[3072,768] 0450b44ddd74
val_18 FLOAT[768,2304] 8246f03068e5
val_19 FLOAT[768,3072] 1dbf449d321a
val_2 INT64[1] af5570f5a181
val_20 FLOAT[3072,768] 260d433da0a2
val_21 FLOAT[768,2304] db6f827741b6
val_22 FLOAT[768,3072] 77679c787728
val_23 FLOAT[3072,768] 6349326ba95f
val_24 FLOAT[768,2304] 660f3487886e
val_25 FLOAT[768,3072] 22bccd3d2c8a
val_26 FLOAT[3072,768] a594c699995b
val_27 FLOAT[768,2304] 02bb99fc4e0b
val_28 FLOAT[768,3072] 87a29a91d1ca
val_29 FLOAT[3072,768] 67725069cdeb
val_3 INT64[6] 6b7d92eaae70
val_30 FLOAT[768,2304] 565a87df3ba7
val_31 FLOAT[768,3072] 9a04b82e2462
val_32 FLOAT[3072,768] a504b36e1b07
val_33 FLOAT[768,2304] 3acf64e64a54
val_34 FLOAT[768,3072] e7fae4785057
val_35 FLOAT[3072,768] 8e1862e9eca6
val_36 FLOAT[768,2304] bd77c9b0a06a
val_37 FLOAT[768,3072] 733163c3f936
val_38 FLOAT[3072,768] d5804dee3d1b
val_39 FLOAT[768,2304] acf28704aad0
val_4 FLOAT[] df3f619804a9
val_40 FLOAT[768,3072] 7d8044b87b59
val_41 FLOAT[3072,768] f7128035316d
val_42 FLOAT[1,50,768] ef82829c4bb6
val_5 INT64[1] 7c9fa136d441
val_6 FLOAT[768,2304] a2d2209f5f1b
val_7 FLOAT[768,3072] c50468fe0224
val_8 FLOAT[3072,768] 971f31adda9d
val_9 FLOAT[768,2304] 4f79dcdf5e10
view_target INT64[3] 69b00f163d22
visual.conv1.weight FLOAT[768,3,32,32] 3842cad86ba2
visual.ln_post.bias FLOAT[768] 531f76bebd59
visual.ln_post.weight FLOAT[768] 5f50ba024638
visual.ln_pre.bias FLOAT[768] aa86d703e250
visual.ln_pre.weight FLOAT[768] 5aae8ceade1b
visual.proj FLOAT[768,512] d47152b661e9
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 2fe9049bea6a
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] e5085612daef
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] 7ae30a32c6ca
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] 4b9648471e64
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] bbbdd9686813
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] ea3570f1f092
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 82b7fd25a9ce
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 1d1116a659c3
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] d0f98a6eaf60
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] ce63ee63b65b
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 476c5fe10359
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 9c27e93532da
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] 7c9befbe14cb
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] a93a217ebc79
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 1440321b24b0
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 6b86008d5e04
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 743903c4766d
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 1d60514cd9d6
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 93267b8ed2d1
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] a7e06184840d
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] 3aaf4653cc44
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] d100e893dd35
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 1bca375d0b83
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 7c9902f0b63d
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 69ac7ce862e2
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 18b85cf5023d
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 99ba72e7c37a
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] f3e864786593
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] e6159bdd677b
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] de5ef6855a64
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] d4a605c3a8fa
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 7bbb3bf75c58
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] ff99e99442b1
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 70e3b36a5600
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] cbc1fcc8f563
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] d502446c4dbf
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] 9a784c908cd9
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] a968bc6f6087
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 5b4bf2610fc0
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 50ef2f1ac2bc
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 6e5f1f833bca
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 83c25f829782
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] 5a7d7d09fb2a
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] ab26e712494e
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] b96bbcac2e55
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] da5a8433ed1c
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 6f9533a3f4d7
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 5a836f6430f3
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] a7b3ce305beb
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 7321ad5a0af4
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] 9dc4b496180c
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 590ca1f12161
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 4e83102b9400
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] 45f3508f3474
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 6cbeeb3ec803
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 605750319a4d
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 6fa35e36df73
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 89b1838ea908
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 61bcb58a576a
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] 8625fab11831
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] b5744d2c1b93
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] 9d61e041b29f
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] a0ee2ade416a
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 04e8916b949e
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 916da3cc16ae
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 0984b5e49461
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] fb0bc05e01f1
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] 718cf79fc471
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 6eedf7f26885
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] de00c742800b
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] a76f9d683c9f
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] c435a4520b47
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 404925de397c
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 00d13d3f83ad
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 8b80d70bbc78
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 5f5dc219dc91
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] d33c7fb5a4d5
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 0e29aaf66bca
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 4c4887f7a353
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 05953e688f42
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 3eddef0b71d1
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] e58f1461177e
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] c239c2dc1129
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 88d1d79606ad
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] f085e54edd4d
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] e4bca4fded06
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 09c2cb8896db
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 476954731a24
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] d1f9d1ab6f06
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] b662f79839a4
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 87d3664f766a
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 96ea1b5ab043
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 85337a770f55
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] edce7f1722b8
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] a23f829315a7
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 23f228e169e3
+625
View File
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,512] add_1012
float[batch,77,512] add_1127
float[batch,77,512] add_1156
float[batch,77,512] add_119
float[batch,77,512] add_1271
float[batch,77,512] add_1300
float[batch,77,512] add_1415
float[batch,77,512] add_1444
float[batch,77,512] add_148
float[batch,77,512] add_1559
float[batch,77,512] add_1588
float[batch,1,512] add_1588_pooled
float[batch,1,512] add_1703
float[batch,1,512] add_1732
float[batch,77,512] add_263
float[batch,77,512] add_292
float[batch,77,512] add_4
float[batch,77,512] add_407
float[batch,77,512] add_436
float[batch,77,512] add_551
float[batch,77,512] add_580
float[batch,77,512] add_695
float[batch,77,512] add_724
float[batch,77,512] add_839
float[batch,77,512] add_868
float[batch,77,512] add_983
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,512] embedding
float[batch,77,512] layer_norm
float[batch,77,512] layer_norm_1
float[batch,77,512] layer_norm_10
float[batch,77,512] layer_norm_11
float[batch,77,512] layer_norm_12
float[batch,77,512] layer_norm_13
float[batch,77,512] layer_norm_14
float[batch,77,512] layer_norm_15
float[batch,77,512] layer_norm_16
float[batch,77,512] layer_norm_17
float[batch,77,512] layer_norm_18
float[batch,77,512] layer_norm_19
float[batch,77,512] layer_norm_2
float[batch,77,512] layer_norm_20
float[batch,77,512] layer_norm_21
float[batch,77,512] layer_norm_22
float[batch,1,512] layer_norm_23
float[batch,77,512] layer_norm_3
float[batch,77,512] layer_norm_4
float[batch,77,512] layer_norm_5
float[batch,77,512] layer_norm_6
float[batch,77,512] layer_norm_7
float[batch,77,512] layer_norm_8
float[batch,77,512] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,2048] linear_10
float[batch,77,512] linear_11
float[batch,77,2048] linear_14
float[batch,77,512] linear_15
float[batch,77,2048] linear_18
float[batch,77,512] linear_19
float[batch,77,2048] linear_2
float[batch,77,2048] linear_22
float[batch,77,512] linear_23
float[batch,77,2048] linear_26
float[batch,77,512] linear_27
float[batch,77,512] linear_3
float[batch,77,2048] linear_30
float[batch,77,512] linear_31
float[batch,77,2048] linear_34
float[batch,77,512] linear_35
float[batch,77,2048] linear_38
float[batch,77,512] linear_39
float[batch,77,2048] linear_42
float[batch,77,512] linear_43
float[batch,1,2048] linear_46
float[batch,1,512] linear_47
float[batch,77,2048] linear_6
float[batch,77,512] linear_7
float[batch,512] matmul
float[batch,77,2048] mul_101
float[batch,77,2048] mul_106
float[batch,77,2048] mul_1064
float[batch,77,2048] mul_1069
float[batch,77,2048] mul_1171
float[batch,77,2048] mul_1176
float[batch,1,2048] mul_1278
float[batch,1,2048] mul_1283
float[batch,77,2048] mul_208
float[batch,77,2048] mul_213
float[batch,77,2048] mul_315
float[batch,77,2048] mul_320
float[batch,77,2048] mul_422
float[batch,77,2048] mul_427
float[batch,77,2048] mul_529
float[batch,77,2048] mul_534
float[batch,77,2048] mul_636
float[batch,77,2048] mul_641
float[batch,77,2048] mul_743
float[batch,77,2048] mul_748
float[batch,77,2048] mul_850
float[batch,77,2048] mul_855
float[batch,77,2048] mul_957
float[batch,77,2048] mul_962
float[batch,77,512] node_scaled_dot_product_attention_10_k
float[batch,77,512] node_scaled_dot_product_attention_10_out
float[batch,77,512] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_q
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv
float[batch,77,1536] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_10_v
float[batch,77,512] node_scaled_dot_product_attention_11_k
float[batch,1,512] node_scaled_dot_product_attention_11_out
float[batch,1,512] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_q
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv
float[batch,77,1536] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_11_v
float[batch,77,512] node_scaled_dot_product_attention_1_k
float[batch,77,512] node_scaled_dot_product_attention_1_out
float[batch,77,512] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_q
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv
float[batch,77,1536] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_1_v
float[batch,77,512] node_scaled_dot_product_attention_2_k
float[batch,77,512] node_scaled_dot_product_attention_2_out
float[batch,77,512] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_q
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv
float[batch,77,1536] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_2_v
float[batch,77,512] node_scaled_dot_product_attention_3_k
float[batch,77,512] node_scaled_dot_product_attention_3_out
float[batch,77,512] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_q
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv
float[batch,77,1536] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_3_v
float[batch,77,512] node_scaled_dot_product_attention_4_k
float[batch,77,512] node_scaled_dot_product_attention_4_out
float[batch,77,512] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_q
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv
float[batch,77,1536] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_4_v
float[batch,77,512] node_scaled_dot_product_attention_5_k
float[batch,77,512] node_scaled_dot_product_attention_5_out
float[batch,77,512] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_q
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv
float[batch,77,1536] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_5_v
float[batch,77,512] node_scaled_dot_product_attention_6_k
float[batch,77,512] node_scaled_dot_product_attention_6_out
float[batch,77,512] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_q
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv
float[batch,77,1536] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_6_v
float[batch,77,512] node_scaled_dot_product_attention_7_k
float[batch,77,512] node_scaled_dot_product_attention_7_out
float[batch,77,512] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_q
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv
float[batch,77,1536] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_7_v
float[batch,77,512] node_scaled_dot_product_attention_8_k
float[batch,77,512] node_scaled_dot_product_attention_8_out
float[batch,77,512] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_q
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv
float[batch,77,1536] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_8_v
float[batch,77,512] node_scaled_dot_product_attention_9_k
float[batch,77,512] node_scaled_dot_product_attention_9_out
float[batch,77,512] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_q
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv
float[batch,77,1536] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_9_v
float[batch,77,512] node_scaled_dot_product_attention_k
float[batch,77,512] node_scaled_dot_product_attention_out
float[batch,77,512] node_scaled_dot_product_attention_out_mm_out
float[batch,77,512] node_scaled_dot_product_attention_q
float[batch,77,1536] node_scaled_dot_product_attention_qkv
float[batch,77,1536] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,512] node_scaled_dot_product_attention_v
float[batch,77,512] scaled_dot_product_attention
float[batch,77,512] scaled_dot_product_attention_1
float[batch,77,512] scaled_dot_product_attention_10
float[batch,77,512] scaled_dot_product_attention_11
float[batch,1,512] scaled_dot_product_attention_11_pooled
float[batch,77,512] scaled_dot_product_attention_2
float[batch,77,512] scaled_dot_product_attention_3
float[batch,77,512] scaled_dot_product_attention_4
float[batch,77,512] scaled_dot_product_attention_5
float[batch,77,512] scaled_dot_product_attention_6
float[batch,77,512] scaled_dot_product_attention_7
float[batch,77,512] scaled_dot_product_attention_8
float[batch,77,512] scaled_dot_product_attention_9
float[batch,77,2048] sigmoid
float[batch,77,2048] sigmoid_1
float[batch,77,2048] sigmoid_10
float[batch,1,2048] sigmoid_11
float[batch,77,2048] sigmoid_2
float[batch,77,2048] sigmoid_3
float[batch,77,2048] sigmoid_4
float[batch,77,2048] sigmoid_5
float[batch,77,2048] sigmoid_6
float[batch,77,2048] sigmoid_7
float[batch,77,2048] sigmoid_8
float[batch,77,2048] sigmoid_9
float[batch,77,2048] val_40
float[batch,77,512] val_41
float[batch,77,2048] val_42
float[batch,77,512] val_43
float[batch,77,2048] val_44
float[batch,77,512] val_45
float[batch,77,2048] val_46
float[batch,77,512] val_47
float[batch,77,2048] val_48
float[batch,77,512] val_49
float[batch,77,2048] val_50
float[batch,77,512] val_51
float[batch,77,2048] val_52
float[batch,77,512] val_53
float[batch,77,2048] val_54
float[batch,77,512] val_55
float[batch,77,2048] val_56
float[batch,77,512] val_57
float[batch,77,2048] val_58
float[batch,77,512] val_59
float[batch,77,2048] val_60
float[batch,77,512] val_61
float[batch,77] val_62
float[batch,1,77] val_63
float[batch,1,2048] val_64
float[batch,1,512] val_65
float[batch,1,512] val_66
float[batch,512] val_67
>
{
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_39)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x512)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_40 = MatMul (layer_norm_1, val_4)
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
mul_101 = Mul (linear_2, val_2)
[node_sigmoid] sigmoid = Sigmoid (mul_101)
mul_106 = Mul (linear_2, sigmoid)
val_41 = MatMul (mul_106, val_5)
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
add_148 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x512)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_42 = MatMul (layer_norm_3, val_7)
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
mul_208 = Mul (linear_6, val_2)
sigmoid_1 = Sigmoid (mul_208)
mul_213 = Mul (linear_6, sigmoid_1)
val_43 = MatMul (mul_213, val_8)
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
add_292 = Add (add_263, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x512)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_44 = MatMul (layer_norm_5, val_10)
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
mul_315 = Mul (linear_10, val_2)
sigmoid_2 = Sigmoid (mul_315)
mul_320 = Mul (linear_10, sigmoid_2)
val_45 = MatMul (mul_320, val_11)
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
add_436 = Add (add_407, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x512)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_46 = MatMul (layer_norm_7, val_13)
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
mul_422 = Mul (linear_14, val_2)
sigmoid_3 = Sigmoid (mul_422)
mul_427 = Mul (linear_14, sigmoid_3)
val_47 = MatMul (mul_427, val_14)
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
add_580 = Add (add_551, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x512)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_48 = MatMul (layer_norm_9, val_16)
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
mul_529 = Mul (linear_18, val_2)
sigmoid_4 = Sigmoid (mul_529)
mul_534 = Mul (linear_18, sigmoid_4)
val_49 = MatMul (mul_534, val_17)
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
add_724 = Add (add_695, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x512)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_50 = MatMul (layer_norm_11, val_19)
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
mul_636 = Mul (linear_22, val_2)
sigmoid_5 = Sigmoid (mul_636)
mul_641 = Mul (linear_22, sigmoid_5)
val_51 = MatMul (mul_641, val_20)
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
add_868 = Add (add_839, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x512)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_52 = MatMul (layer_norm_13, val_22)
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
mul_743 = Mul (linear_26, val_2)
sigmoid_6 = Sigmoid (mul_743)
mul_748 = Mul (linear_26, sigmoid_6)
val_53 = MatMul (mul_748, val_23)
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
add_1012 = Add (add_983, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x512)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_54 = MatMul (layer_norm_15, val_25)
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
mul_850 = Mul (linear_30, val_2)
sigmoid_7 = Sigmoid (mul_850)
mul_855 = Mul (linear_30, sigmoid_7)
val_55 = MatMul (mul_855, val_26)
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
add_1156 = Add (add_1127, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x512)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_56 = MatMul (layer_norm_17, val_28)
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
mul_957 = Mul (linear_34, val_2)
sigmoid_8 = Sigmoid (mul_957)
mul_962 = Mul (linear_34, sigmoid_8)
val_57 = MatMul (mul_962, val_29)
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
add_1300 = Add (add_1271, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x512)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_58 = MatMul (layer_norm_19, val_31)
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
mul_1064 = Mul (linear_38, val_2)
sigmoid_9 = Sigmoid (mul_1064)
mul_1069 = Mul (linear_38, sigmoid_9)
val_59 = MatMul (mul_1069, val_32)
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
add_1444 = Add (add_1415, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x512)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_60 = MatMul (layer_norm_21, val_34)
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
mul_1171 = Mul (linear_42, val_2)
sigmoid_10 = Sigmoid (mul_1171)
mul_1176 = Mul (linear_42, sigmoid_10)
val_61 = MatMul (mul_1176, val_35)
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
add_1588 = Add (add_1559, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x512)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 8, q_num_heads: int = 8, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
val_63 = Unsqueeze (val_62, val_756_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_64 = MatMul (layer_norm_23, val_37)
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
mul_1278 = Mul (linear_46, val_2)
sigmoid_11 = Sigmoid (mul_1278)
mul_1283 = Mul (linear_46, sigmoid_11)
val_65 = MatMul (mul_1283, val_38)
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
add_1732 = Add (add_1703, linear_47)
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
val_67 = Squeeze (val_66, val_756_axes1)
[node_matmul] matmul = MatMul (val_67, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x512 INT64[3] b4aa8df238da
ln_final.bias FLOAT[512] ce3450f876c4
ln_final.weight FLOAT[512] b292168b3424
node_scaled_dot_product_attention_10_wo_t FLOAT[512,512] 9c604d28d751
node_scaled_dot_product_attention_11_wo_t FLOAT[512,512] 9f7271cb3bfb
node_scaled_dot_product_attention_1_wo_t FLOAT[512,512] d8059c3a86a5
node_scaled_dot_product_attention_2_wo_t FLOAT[512,512] 2bafcf15a307
node_scaled_dot_product_attention_3_wo_t FLOAT[512,512] 98b2d34d5506
node_scaled_dot_product_attention_4_wo_t FLOAT[512,512] 60a36b438d0e
node_scaled_dot_product_attention_5_wo_t FLOAT[512,512] 3babc0771cb4
node_scaled_dot_product_attention_6_wo_t FLOAT[512,512] 2534aa274ffd
node_scaled_dot_product_attention_7_wo_t FLOAT[512,512] 5d53931e1f28
node_scaled_dot_product_attention_8_wo_t FLOAT[512,512] a3b9aca4464f
node_scaled_dot_product_attention_9_wo_t FLOAT[512,512] d345ba3399db
node_scaled_dot_product_attention_wo_t FLOAT[512,512] c8242d57be39
positional_embedding FLOAT[77,512] f1924bec1da7
text_projection FLOAT[512,512] 32bf713d93ef
token_embedding.weight_fp16 FLOAT16[49408,512] d00ab7521d86
transformer.resblocks.0.attn.in_proj_bias FLOAT[1536] d32299e69efa
transformer.resblocks.0.attn.out_proj.bias FLOAT[512] 0201253778b7
transformer.resblocks.0.ln_1.bias FLOAT[512] 4c3a5fea3bb9
transformer.resblocks.0.ln_1.weight FLOAT[512] 63ff766b75d8
transformer.resblocks.0.ln_2.bias FLOAT[512] e74088139231
transformer.resblocks.0.ln_2.weight FLOAT[512] 79a22d455900
transformer.resblocks.0.mlp.c_fc.bias FLOAT[2048] 3b4d4901a3b5
transformer.resblocks.0.mlp.c_proj.bias FLOAT[512] 188f33bb4757
transformer.resblocks.1.attn.in_proj_bias FLOAT[1536] c9d81796c0b2
transformer.resblocks.1.attn.out_proj.bias FLOAT[512] 9e43e115fa8f
transformer.resblocks.1.ln_1.bias FLOAT[512] 3a450e663846
transformer.resblocks.1.ln_1.weight FLOAT[512] 1963f616bf07
transformer.resblocks.1.ln_2.bias FLOAT[512] 4213eabdcba1
transformer.resblocks.1.ln_2.weight FLOAT[512] d8526b2bc327
transformer.resblocks.1.mlp.c_fc.bias FLOAT[2048] e777a17a2925
transformer.resblocks.1.mlp.c_proj.bias FLOAT[512] 3648728f425b
transformer.resblocks.10.attn.in_proj_bias FLOAT[1536] 441aa38901b0
transformer.resblocks.10.attn.out_proj.bias FLOAT[512] 1c63b8c36fb5
transformer.resblocks.10.ln_1.bias FLOAT[512] 0346307e49ba
transformer.resblocks.10.ln_1.weight FLOAT[512] 3e8c3262de00
transformer.resblocks.10.ln_2.bias FLOAT[512] b2833158298a
transformer.resblocks.10.ln_2.weight FLOAT[512] 4e7b148a5f01
transformer.resblocks.10.mlp.c_fc.bias FLOAT[2048] c24af7b4eb5e
transformer.resblocks.10.mlp.c_proj.bias FLOAT[512] 215d15328e29
transformer.resblocks.11.attn.in_proj_bias FLOAT[1536] bdc13d7d44e2
transformer.resblocks.11.attn.out_proj.bias FLOAT[512] d91ac26614b3
transformer.resblocks.11.ln_1.bias FLOAT[512] d9479dbb6011
transformer.resblocks.11.ln_1.weight FLOAT[512] b1d1b3119bc5
transformer.resblocks.11.ln_2.bias FLOAT[512] 59cab22a6bd0
transformer.resblocks.11.ln_2.weight FLOAT[512] a57f31f2c582
transformer.resblocks.11.mlp.c_fc.bias FLOAT[2048] 5694b470ea2c
transformer.resblocks.11.mlp.c_proj.bias FLOAT[512] ac578a0ba6c7
transformer.resblocks.2.attn.in_proj_bias FLOAT[1536] fe56a28bd3fc
transformer.resblocks.2.attn.out_proj.bias FLOAT[512] 8183ac94de8d
transformer.resblocks.2.ln_1.bias FLOAT[512] c42fa86e95c7
transformer.resblocks.2.ln_1.weight FLOAT[512] 3b549797e7e7
transformer.resblocks.2.ln_2.bias FLOAT[512] 6fda0ca8c934
transformer.resblocks.2.ln_2.weight FLOAT[512] 1205ef352cb6
transformer.resblocks.2.mlp.c_fc.bias FLOAT[2048] df21163ca3af
transformer.resblocks.2.mlp.c_proj.bias FLOAT[512] 70307a5bc433
transformer.resblocks.3.attn.in_proj_bias FLOAT[1536] b7d1fd964e21
transformer.resblocks.3.attn.out_proj.bias FLOAT[512] 0cf9f6028cfc
transformer.resblocks.3.ln_1.bias FLOAT[512] 698113ac9d61
transformer.resblocks.3.ln_1.weight FLOAT[512] 07fbe9360942
transformer.resblocks.3.ln_2.bias FLOAT[512] e529e40a8f00
transformer.resblocks.3.ln_2.weight FLOAT[512] 6e88512bfecf
transformer.resblocks.3.mlp.c_fc.bias FLOAT[2048] eb04fb72b023
transformer.resblocks.3.mlp.c_proj.bias FLOAT[512] eb3fe54e0e93
transformer.resblocks.4.attn.in_proj_bias FLOAT[1536] a2fce30d4bc1
transformer.resblocks.4.attn.out_proj.bias FLOAT[512] f5d602c5eb6f
transformer.resblocks.4.ln_1.bias FLOAT[512] 276b8112ba5b
transformer.resblocks.4.ln_1.weight FLOAT[512] f4b4ec45aa82
transformer.resblocks.4.ln_2.bias FLOAT[512] 1e1cca6ce8b5
transformer.resblocks.4.ln_2.weight FLOAT[512] 2323b1333960
transformer.resblocks.4.mlp.c_fc.bias FLOAT[2048] 4ea6df392930
transformer.resblocks.4.mlp.c_proj.bias FLOAT[512] 66eb1fc51c19
transformer.resblocks.5.attn.in_proj_bias FLOAT[1536] c4486945444f
transformer.resblocks.5.attn.out_proj.bias FLOAT[512] 4f3b93ab25cd
transformer.resblocks.5.ln_1.bias FLOAT[512] 806ee4abb23b
transformer.resblocks.5.ln_1.weight FLOAT[512] 1f2443a32eef
transformer.resblocks.5.ln_2.bias FLOAT[512] edd0381d7c81
transformer.resblocks.5.ln_2.weight FLOAT[512] 74e063b337a4
transformer.resblocks.5.mlp.c_fc.bias FLOAT[2048] 3d402c553838
transformer.resblocks.5.mlp.c_proj.bias FLOAT[512] 61e43bf06100
transformer.resblocks.6.attn.in_proj_bias FLOAT[1536] bd11e4068b8f
transformer.resblocks.6.attn.out_proj.bias FLOAT[512] 708172ac84a2
transformer.resblocks.6.ln_1.bias FLOAT[512] a259f878b607
transformer.resblocks.6.ln_1.weight FLOAT[512] a6fd7f09485a
transformer.resblocks.6.ln_2.bias FLOAT[512] 5ccbcd999897
transformer.resblocks.6.ln_2.weight FLOAT[512] 753177b32de3
transformer.resblocks.6.mlp.c_fc.bias FLOAT[2048] 452f9c9303c4
transformer.resblocks.6.mlp.c_proj.bias FLOAT[512] 35fd6566df22
transformer.resblocks.7.attn.in_proj_bias FLOAT[1536] 0542d0863f14
transformer.resblocks.7.attn.out_proj.bias FLOAT[512] 14d761545da2
transformer.resblocks.7.ln_1.bias FLOAT[512] 268416f07be1
transformer.resblocks.7.ln_1.weight FLOAT[512] 2a08f53b695f
transformer.resblocks.7.ln_2.bias FLOAT[512] 967d9d4bbe97
transformer.resblocks.7.ln_2.weight FLOAT[512] aeee1215b2dd
transformer.resblocks.7.mlp.c_fc.bias FLOAT[2048] f433e0eecc0f
transformer.resblocks.7.mlp.c_proj.bias FLOAT[512] 7205754a62ca
transformer.resblocks.8.attn.in_proj_bias FLOAT[1536] 612f49653f12
transformer.resblocks.8.attn.out_proj.bias FLOAT[512] 762f867d19a6
transformer.resblocks.8.ln_1.bias FLOAT[512] 33dce532b8de
transformer.resblocks.8.ln_1.weight FLOAT[512] 8d4049f2cb5c
transformer.resblocks.8.ln_2.bias FLOAT[512] f043d604fddc
transformer.resblocks.8.ln_2.weight FLOAT[512] b9250123ee84
transformer.resblocks.8.mlp.c_fc.bias FLOAT[2048] 2527351ba870
transformer.resblocks.8.mlp.c_proj.bias FLOAT[512] 74787f403049
transformer.resblocks.9.attn.in_proj_bias FLOAT[1536] 7eb7ed5a43b7
transformer.resblocks.9.attn.out_proj.bias FLOAT[512] 10a539dea9d9
transformer.resblocks.9.ln_1.bias FLOAT[512] 0f9f980f8460
transformer.resblocks.9.ln_1.weight FLOAT[512] 366f129fa8f7
transformer.resblocks.9.ln_2.bias FLOAT[512] 795ac435c837
transformer.resblocks.9.ln_2.weight FLOAT[512] fa901b89a513
transformer.resblocks.9.mlp.c_fc.bias FLOAT[2048] c3444f83c6dd
transformer.resblocks.9.mlp.c_proj.bias FLOAT[512] 45df9c0b759e
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[512,2048] 2a63e59cdc0a
val_11 FLOAT[2048,512] 5eb8f3cf7012
val_12 FLOAT[512,1536] 795b799a9e09
val_13 FLOAT[512,2048] a729c49c8621
val_14 FLOAT[2048,512] d35fb36972fe
val_15 FLOAT[512,1536] ccd63f7e58dd
val_16 FLOAT[512,2048] 7d1d9bfba7a2
val_17 FLOAT[2048,512] 3757dcc96255
val_18 FLOAT[512,1536] 56f4d30aa15e
val_19 FLOAT[512,2048] 2aeb16747f48
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[2048,512] 412c410554fe
val_21 FLOAT[512,1536] d13d64cdec9a
val_22 FLOAT[512,2048] cb9d8744711f
val_23 FLOAT[2048,512] 17be77940c16
val_24 FLOAT[512,1536] 1a9d203a6eea
val_25 FLOAT[512,2048] 7f885136f7fd
val_26 FLOAT[2048,512] b68b9588638f
val_27 FLOAT[512,1536] 7727e95ed9f9
val_28 FLOAT[512,2048] ec4f4c69ab38
val_29 FLOAT[2048,512] 6cd5e4304ee7
val_3 FLOAT[512,1536] 34a5d38122d6
val_30 FLOAT[512,1536] c78c1744c187
val_31 FLOAT[512,2048] a1731674b145
val_32 FLOAT[2048,512] 05bf603c8641
val_33 FLOAT[512,1536] 340269901bd5
val_34 FLOAT[512,2048] 9f737303b0b7
val_35 FLOAT[2048,512] 3918d2227b99
val_36 FLOAT[512,1536] 0dcd389dbd6b
val_37 FLOAT[512,2048] 4bfc4d5c4e8b
val_38 FLOAT[2048,512] cacacccf89f1
val_4 FLOAT[512,2048] 9add3b7bfa51
val_5 FLOAT[2048,512] 4723c12b3d6e
val_6 FLOAT[512,1536] 6f43747047fd
val_7 FLOAT[512,2048] 89df61e73dc3
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[2048,512] 396523db5e8f
val_9 FLOAT[512,1536] 85c6c5cc2459
+636
View File
@@ -0,0 +1,636 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,50,768] add_1000
float[batch,50,768] add_1029
float[batch,50,768] add_1144
float[batch,50,768] add_1173
float[batch,50,768] add_1288
float[batch,50,768] add_1317
float[batch,50,768] add_136
float[batch,50,768] add_1432
float[batch,50,768] add_1461
float[batch,50,768] add_1576
float[batch,50,768] add_1605
float[batch,1,768] add_1605_pooled
float[batch,50,768] add_165
float[batch,50,768] add_17
float[batch,1,768] add_1720
float[batch,1,768] add_1749
float[batch,50,768] add_280
float[batch,50,768] add_309
float[batch,50,768] add_424
float[batch,50,768] add_453
float[batch,50,768] add_568
float[batch,50,768] add_597
float[batch,50,768] add_712
float[batch,50,768] add_741
float[batch,50,768] add_856
float[batch,50,768] add_885
float[batch,1] clamp_min
float[batch,768,7,7] conv2d
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,50,768] layer_norm
float[batch,50,768] layer_norm_1
float[batch,50,768] layer_norm_10
float[batch,50,768] layer_norm_11
float[batch,50,768] layer_norm_12
float[batch,50,768] layer_norm_13
float[batch,50,768] layer_norm_14
float[batch,50,768] layer_norm_15
float[batch,50,768] layer_norm_16
float[batch,50,768] layer_norm_17
float[batch,50,768] layer_norm_18
float[batch,50,768] layer_norm_19
float[batch,50,768] layer_norm_2
float[batch,50,768] layer_norm_20
float[batch,50,768] layer_norm_21
float[batch,50,768] layer_norm_22
float[batch,50,768] layer_norm_23
float[batch,1,768] layer_norm_24
float[batch,50,768] layer_norm_3
float[batch,50,768] layer_norm_4
float[batch,50,768] layer_norm_5
float[batch,50,768] layer_norm_6
float[batch,50,768] layer_norm_7
float[batch,50,768] layer_norm_8
float[batch,50,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,50,3072] linear_10
float[batch,50,768] linear_11
float[batch,50,3072] linear_14
float[batch,50,768] linear_15
float[batch,50,3072] linear_18
float[batch,50,768] linear_19
float[batch,50,3072] linear_2
float[batch,50,3072] linear_22
float[batch,50,768] linear_23
float[batch,50,3072] linear_26
float[batch,50,768] linear_27
float[batch,50,768] linear_3
float[batch,50,3072] linear_30
float[batch,50,768] linear_31
float[batch,50,3072] linear_34
float[batch,50,768] linear_35
float[batch,50,3072] linear_38
float[batch,50,768] linear_39
float[batch,50,3072] linear_42
float[batch,50,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,50,3072] linear_6
float[batch,50,768] linear_7
float[batch,512] matmul
float[batch,50,3072] mul_1078
float[batch,50,3072] mul_1083
float[batch,50,3072] mul_115
float[batch,50,3072] mul_1185
float[batch,50,3072] mul_1190
float[batch,50,3072] mul_120
float[batch,1,3072] mul_1292
float[batch,1,3072] mul_1297
float[batch,50,3072] mul_222
float[batch,50,3072] mul_227
float[batch,50,3072] mul_329
float[batch,50,3072] mul_334
float[batch,50,3072] mul_436
float[batch,50,3072] mul_441
float[batch,50,3072] mul_543
float[batch,50,3072] mul_548
float[batch,50,3072] mul_650
float[batch,50,3072] mul_655
float[batch,50,3072] mul_757
float[batch,50,3072] mul_762
float[batch,50,3072] mul_864
float[batch,50,3072] mul_869
float[batch,50,3072] mul_971
float[batch,50,3072] mul_976
float[batch,50,768] node_scaled_dot_product_attention_10_k
float[batch,50,768] node_scaled_dot_product_attention_10_out
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_q
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_v
float[batch,50,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_v
float[batch,50,768] node_scaled_dot_product_attention_1_k
float[batch,50,768] node_scaled_dot_product_attention_1_out
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_q
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_v
float[batch,50,768] node_scaled_dot_product_attention_2_k
float[batch,50,768] node_scaled_dot_product_attention_2_out
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_q
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_v
float[batch,50,768] node_scaled_dot_product_attention_3_k
float[batch,50,768] node_scaled_dot_product_attention_3_out
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_q
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_v
float[batch,50,768] node_scaled_dot_product_attention_4_k
float[batch,50,768] node_scaled_dot_product_attention_4_out
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_q
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_v
float[batch,50,768] node_scaled_dot_product_attention_5_k
float[batch,50,768] node_scaled_dot_product_attention_5_out
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_q
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_v
float[batch,50,768] node_scaled_dot_product_attention_6_k
float[batch,50,768] node_scaled_dot_product_attention_6_out
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_q
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_v
float[batch,50,768] node_scaled_dot_product_attention_7_k
float[batch,50,768] node_scaled_dot_product_attention_7_out
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_q
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_v
float[batch,50,768] node_scaled_dot_product_attention_8_k
float[batch,50,768] node_scaled_dot_product_attention_8_out
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_q
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_v
float[batch,50,768] node_scaled_dot_product_attention_9_k
float[batch,50,768] node_scaled_dot_product_attention_9_out
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_q
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_v
float[batch,50,768] node_scaled_dot_product_attention_k
float[batch,50,768] node_scaled_dot_product_attention_out
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_q
float[batch,50,2304] node_scaled_dot_product_attention_qkv
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_v
float[batch,49,768] permute
float[batch,50,768] scaled_dot_product_attention
float[batch,50,768] scaled_dot_product_attention_1
float[batch,50,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,50,768] scaled_dot_product_attention_2
float[batch,50,768] scaled_dot_product_attention_3
float[batch,50,768] scaled_dot_product_attention_4
float[batch,50,768] scaled_dot_product_attention_5
float[batch,50,768] scaled_dot_product_attention_6
float[batch,50,768] scaled_dot_product_attention_7
float[batch,50,768] scaled_dot_product_attention_8
float[batch,50,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,50,3072] sigmoid
float[batch,50,3072] sigmoid_1
float[batch,50,3072] sigmoid_10
float[batch,1,3072] sigmoid_11
float[batch,50,3072] sigmoid_2
float[batch,50,3072] sigmoid_3
float[batch,50,3072] sigmoid_4
float[batch,50,3072] sigmoid_5
float[batch,50,3072] sigmoid_6
float[batch,50,3072] sigmoid_7
float[batch,50,3072] sigmoid_8
float[batch,50,3072] sigmoid_9
float[batch,50,768] val_44
float[batch,50,3072] val_45
float[batch,50,768] val_46
float[batch,50,3072] val_47
float[batch,50,768] val_48
float[batch,50,3072] val_49
float[batch,50,768] val_50
float[batch,50,3072] val_51
float[batch,50,768] val_52
float[batch,50,3072] val_53
float[batch,50,768] val_54
float[batch,50,3072] val_55
float[batch,50,768] val_56
float[batch,50,3072] val_57
float[batch,50,768] val_58
float[batch,50,3072] val_59
float[batch,50,768] val_60
float[batch,50,3072] val_61
float[batch,50,768] val_62
float[batch,50,3072] val_63
float[batch,50,768] val_64
float[batch,50,3072] val_65
float[batch,50,768] val_66
float[batch,1,3072] val_67
float[batch,1,768] val_68
float[batch,768] val_69
float[batch,768,49] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_705_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_44 = Pad (permute, val_4, val_5)
add_17 = Add (val_44, val_43)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_7)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_45 = MatMul (layer_norm_2, val_8)
linear_2 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_fc.bias")
mul_115 = Mul (linear_2, val_3)
[node_sigmoid] sigmoid = Sigmoid (mul_115)
mul_120 = Mul (linear_2, sigmoid)
val_46 = MatMul (mul_120, val_9)
linear_3 = Add (val_46, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_165 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_165, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_10)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_280 = Add (add_165, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_280, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_47 = MatMul (layer_norm_4, val_11)
linear_6 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_fc.bias")
mul_222 = Mul (linear_6, val_3)
sigmoid_1 = Sigmoid (mul_222)
mul_227 = Mul (linear_6, sigmoid_1)
val_48 = MatMul (mul_227, val_12)
linear_7 = Add (val_48, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_309 = Add (add_280, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_309, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_13)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_424 = Add (add_309, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_424, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_49 = MatMul (layer_norm_6, val_14)
linear_10 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_fc.bias")
mul_329 = Mul (linear_10, val_3)
sigmoid_2 = Sigmoid (mul_329)
mul_334 = Mul (linear_10, sigmoid_2)
val_50 = MatMul (mul_334, val_15)
linear_11 = Add (val_50, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_453 = Add (add_424, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_453, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_16)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_568 = Add (add_453, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_568, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_51 = MatMul (layer_norm_8, val_17)
linear_14 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_fc.bias")
mul_436 = Mul (linear_14, val_3)
sigmoid_3 = Sigmoid (mul_436)
mul_441 = Mul (linear_14, sigmoid_3)
val_52 = MatMul (mul_441, val_18)
linear_15 = Add (val_52, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_597 = Add (add_568, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_597, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_19)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_712 = Add (add_597, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_712, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_53 = MatMul (layer_norm_10, val_20)
linear_18 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_fc.bias")
mul_543 = Mul (linear_18, val_3)
sigmoid_4 = Sigmoid (mul_543)
mul_548 = Mul (linear_18, sigmoid_4)
val_54 = MatMul (mul_548, val_21)
linear_19 = Add (val_54, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_741 = Add (add_712, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_741, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_22)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_856 = Add (add_741, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_856, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_55 = MatMul (layer_norm_12, val_23)
linear_22 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_fc.bias")
mul_650 = Mul (linear_22, val_3)
sigmoid_5 = Sigmoid (mul_650)
mul_655 = Mul (linear_22, sigmoid_5)
val_56 = MatMul (mul_655, val_24)
linear_23 = Add (val_56, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_885 = Add (add_856, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_885, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_25)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_1000 = Add (add_885, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1000, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_57 = MatMul (layer_norm_14, val_26)
linear_26 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_fc.bias")
mul_757 = Mul (linear_26, val_3)
sigmoid_6 = Sigmoid (mul_757)
mul_762 = Mul (linear_26, sigmoid_6)
val_58 = MatMul (mul_762, val_27)
linear_27 = Add (val_58, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_1029 = Add (add_1000, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1029, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_28)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1144 = Add (add_1029, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1144, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_59 = MatMul (layer_norm_16, val_29)
linear_30 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_fc.bias")
mul_864 = Mul (linear_30, val_3)
sigmoid_7 = Sigmoid (mul_864)
mul_869 = Mul (linear_30, sigmoid_7)
val_60 = MatMul (mul_869, val_30)
linear_31 = Add (val_60, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1173 = Add (add_1144, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1173, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_31)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1288 = Add (add_1173, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1288, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_61 = MatMul (layer_norm_18, val_32)
linear_34 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_fc.bias")
mul_971 = Mul (linear_34, val_3)
sigmoid_8 = Sigmoid (mul_971)
mul_976 = Mul (linear_34, sigmoid_8)
val_62 = MatMul (mul_976, val_33)
linear_35 = Add (val_62, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1317 = Add (add_1288, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1317, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_34)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1432 = Add (add_1317, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1432, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_63 = MatMul (layer_norm_20, val_35)
linear_38 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_fc.bias")
mul_1078 = Mul (linear_38, val_3)
sigmoid_9 = Sigmoid (mul_1078)
mul_1083 = Mul (linear_38, sigmoid_9)
val_64 = MatMul (mul_1083, val_36)
linear_39 = Add (val_64, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1461 = Add (add_1432, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1461, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_37)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1576 = Add (add_1461, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1576, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_65 = MatMul (layer_norm_22, val_38)
linear_42 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_fc.bias")
mul_1185 = Mul (linear_42, val_3)
sigmoid_10 = Sigmoid (mul_1185)
mul_1190 = Mul (linear_42, sigmoid_10)
val_66 = MatMul (mul_1190, val_39)
linear_43 = Add (val_66, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1605 = Add (add_1576, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1605, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_40)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_6, val_6)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1605] add_1605_pooled = Slice (add_1605, val_2, val_6, val_6)
add_1720 = Add (add_1605_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1720, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_67 = MatMul (layer_norm_24, val_41)
linear_46 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_fc.bias")
mul_1292 = Mul (linear_46, val_3)
sigmoid_11 = Sigmoid (mul_1292)
mul_1297 = Mul (linear_46, sigmoid_11)
val_68 = MatMul (mul_1297, val_42)
linear_47 = Add (val_68, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1749 = Add (add_1720, linear_47)
val_69 = Squeeze (add_1749, val_6)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_69, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_Conv_705_fused_bias FLOAT[768] 3f1fdeba0a96
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] b37ec39306ec
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 55015c54b68e
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 6dc6738d93d1
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 9525e2172347
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] ce578205e776
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 0e5e67651d0a
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] f54176cf5e80
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 7778114695dc
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 59d3e42916a6
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 5ff8780a14c8
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 269a0b0102c1
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 2fa1267ea4b1
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,2304] f5e6ed04c6b4
val_11 FLOAT[768,3072] 1d8e960ece36
val_12 FLOAT[3072,768] 7ca34bb6184c
val_13 FLOAT[768,2304] 41d9239d0b23
val_14 FLOAT[768,3072] 0db8e992e631
val_15 FLOAT[3072,768] 16f5c0a3f37d
val_16 FLOAT[768,2304] 8b0e4a013e3c
val_17 FLOAT[768,3072] 49313db4e68e
val_18 FLOAT[3072,768] 10c545909ff6
val_19 FLOAT[768,2304] 9d0de5cb5be8
val_2 INT64[1] af5570f5a181
val_20 FLOAT[768,3072] be60f587cf2a
val_21 FLOAT[3072,768] 125cf7f097c3
val_22 FLOAT[768,2304] e4019e47b282
val_23 FLOAT[768,3072] 7392bf6e3aca
val_24 FLOAT[3072,768] 47a868b95489
val_25 FLOAT[768,2304] 3c6e3968b8b8
val_26 FLOAT[768,3072] c84d968cac19
val_27 FLOAT[3072,768] 1a73d442cc31
val_28 FLOAT[768,2304] 18f133983a9e
val_29 FLOAT[768,3072] 4e575ad9e4a4
val_3 FLOAT[] c2e7ddfe3114
val_30 FLOAT[3072,768] 5d105e70fd25
val_31 FLOAT[768,2304] 7394f700b270
val_32 FLOAT[768,3072] af9454e7e72c
val_33 FLOAT[3072,768] 0384196cdf7d
val_34 FLOAT[768,2304] 1b9592e0690f
val_35 FLOAT[768,3072] 94e913e280cd
val_36 FLOAT[3072,768] 8e65cfabc8b6
val_37 FLOAT[768,2304] 1ad1732e6519
val_38 FLOAT[768,3072] 0b52afc4984a
val_39 FLOAT[3072,768] 8365128ed631
val_4 INT64[6] 6b7d92eaae70
val_40 FLOAT[768,2304] 96246d08fb55
val_41 FLOAT[768,3072] 8e903896ac57
val_42 FLOAT[3072,768] c46a0ba00fc5
val_43 FLOAT[1,50,768] 17773a51fc5d
val_5 FLOAT[] df3f619804a9
val_6 INT64[1] 7c9fa136d441
val_7 FLOAT[768,2304] 7d0a7ceaffb7
val_8 FLOAT[768,3072] f5def8fd12f5
val_9 FLOAT[3072,768] a3017fb78784
view_target INT64[3] 69b00f163d22
visual.conv1.weight FLOAT[768,3,32,32] ae6c9eaa401d
visual.ln_post.bias FLOAT[768] 52148d3ca662
visual.ln_post.weight FLOAT[768] 7852fb82fbeb
visual.ln_pre.bias FLOAT[768] 21345b0509de
visual.ln_pre.weight FLOAT[768] 588459d11d9f
visual.proj FLOAT[768,512] 5fc358a09847
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 0673b9d3faa0
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 45bcb15a04ed
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] 4b15737435c4
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] 4d2d4f55c64c
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] 405d8b0bf353
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] eb1585c759b1
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 9c9632c42092
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] f58e7734d8aa
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 872eb7416b61
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 15d5fa8692ba
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 517c1c1dc496
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 4bb7567067d2
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] ff7378e17797
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] dfc4338f11ef
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 6dbac278fff4
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 0a1dde6dd16e
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 9ad1108c0595
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] f090b0d13061
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 5fe9c7ee5cc3
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] faf736142587
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] ba49b1131419
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 284af60b3c25
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 88503516c49a
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] a6ef2e5550bc
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] c92d8ccdc4b2
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] e66141f1ab4e
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 282faa36d1b6
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] c2e1ccab04a3
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] 9e09e313cfb3
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] 39c54590d157
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 7128eec1da8a
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] a7f37999e897
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 54d82746844f
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 6fbabaf171e9
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] dc532e38cd35
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] 6f33f49122dd
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] c524e18aa280
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] 9e036e4e8200
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 87eb79e29201
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 10ce1952da4a
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] e1c1d3cc540b
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] acbbe91195f9
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] ec3b6555f2f2
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] a3c490154ca6
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] 4a49315bd052
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] 3290c7a2deec
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 2820d405fa93
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 03440c04e911
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 8048b9f7e128
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] fd8e8b530083
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] 5b3c545a7841
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] 28880a85ce93
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] b21364cd3224
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] 6f9fa776276d
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] d8d4c705dfa6
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 486a8069c1dd
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 35d304845651
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 90bdd90d4b56
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 6364d03eb22e
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] 19ae82bcf7e6
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] 5c6356852ecb
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] ae1ca8c060ab
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] ca9b54fd0522
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 2ae170703f56
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 33c448ccad77
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 708ddf5cdbd1
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 0e1030b1b420
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] 8094e4aa49e5
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] 282ddf36d559
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] 969e1345cf78
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 4f547f0ca837
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 988a5fa2168a
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 9a4cba6b1d8d
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] bc7c930349bb
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 1b285e7fc0fa
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 54a84ff26735
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] dc4fd964ed4a
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] d1778ae9b165
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 4b507e53fdd1
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] acc9f25aa56c
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] dd79652ddee4
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 9c557d59f9e7
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 14dca1fc9452
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] 3863c5fe487c
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] bec8aaa02d0b
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] c06a207a6c72
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] de42cbff2dd5
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 3316a2dded5c
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] ffebf6eaed7a
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] a5491a315b46
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] e3861fb2d7a9
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] dfd2951f1353
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] 3e6b81abf126
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] de726a40eb67
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 9ed0917fe47e
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] c4cda4ff2d44
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
+625
View File
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
<
float[batch,77,768] add_1012
float[batch,77,768] add_1127
float[batch,77,768] add_1156
float[batch,77,768] add_119
float[batch,77,768] add_1271
float[batch,77,768] add_1300
float[batch,77,768] add_1415
float[batch,77,768] add_1444
float[batch,77,768] add_148
float[batch,77,768] add_1559
float[batch,77,768] add_1588
float[batch,1,768] add_1588_pooled
float[batch,1,768] add_1703
float[batch,1,768] add_1732
float[batch,77,768] add_263
float[batch,77,768] add_292
float[batch,77,768] add_4
float[batch,77,768] add_407
float[batch,77,768] add_436
float[batch,77,768] add_551
float[batch,77,768] add_580
float[batch,77,768] add_695
float[batch,77,768] add_724
float[batch,77,768] add_839
float[batch,77,768] add_868
float[batch,77,768] add_983
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,768] embedding
float[batch,77,768] layer_norm
float[batch,77,768] layer_norm_1
float[batch,77,768] layer_norm_10
float[batch,77,768] layer_norm_11
float[batch,77,768] layer_norm_12
float[batch,77,768] layer_norm_13
float[batch,77,768] layer_norm_14
float[batch,77,768] layer_norm_15
float[batch,77,768] layer_norm_16
float[batch,77,768] layer_norm_17
float[batch,77,768] layer_norm_18
float[batch,77,768] layer_norm_19
float[batch,77,768] layer_norm_2
float[batch,77,768] layer_norm_20
float[batch,77,768] layer_norm_21
float[batch,77,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,77,768] layer_norm_3
float[batch,77,768] layer_norm_4
float[batch,77,768] layer_norm_5
float[batch,77,768] layer_norm_6
float[batch,77,768] layer_norm_7
float[batch,77,768] layer_norm_8
float[batch,77,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,3072] linear_10
float[batch,77,768] linear_11
float[batch,77,3072] linear_14
float[batch,77,768] linear_15
float[batch,77,3072] linear_18
float[batch,77,768] linear_19
float[batch,77,3072] linear_2
float[batch,77,3072] linear_22
float[batch,77,768] linear_23
float[batch,77,3072] linear_26
float[batch,77,768] linear_27
float[batch,77,768] linear_3
float[batch,77,3072] linear_30
float[batch,77,768] linear_31
float[batch,77,3072] linear_34
float[batch,77,768] linear_35
float[batch,77,3072] linear_38
float[batch,77,768] linear_39
float[batch,77,3072] linear_42
float[batch,77,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,77,3072] linear_6
float[batch,77,768] linear_7
float[batch,768] matmul
float[batch,77,3072] mul_101
float[batch,77,3072] mul_106
float[batch,77,3072] mul_1064
float[batch,77,3072] mul_1069
float[batch,77,3072] mul_1171
float[batch,77,3072] mul_1176
float[batch,1,3072] mul_1278
float[batch,1,3072] mul_1283
float[batch,77,3072] mul_208
float[batch,77,3072] mul_213
float[batch,77,3072] mul_315
float[batch,77,3072] mul_320
float[batch,77,3072] mul_422
float[batch,77,3072] mul_427
float[batch,77,3072] mul_529
float[batch,77,3072] mul_534
float[batch,77,3072] mul_636
float[batch,77,3072] mul_641
float[batch,77,3072] mul_743
float[batch,77,3072] mul_748
float[batch,77,3072] mul_850
float[batch,77,3072] mul_855
float[batch,77,3072] mul_957
float[batch,77,3072] mul_962
float[batch,77,768] node_scaled_dot_product_attention_10_k
float[batch,77,768] node_scaled_dot_product_attention_10_out
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_q
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_v
float[batch,77,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_q
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_v
float[batch,77,768] node_scaled_dot_product_attention_1_k
float[batch,77,768] node_scaled_dot_product_attention_1_out
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_q
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_v
float[batch,77,768] node_scaled_dot_product_attention_2_k
float[batch,77,768] node_scaled_dot_product_attention_2_out
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_q
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_v
float[batch,77,768] node_scaled_dot_product_attention_3_k
float[batch,77,768] node_scaled_dot_product_attention_3_out
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_q
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_v
float[batch,77,768] node_scaled_dot_product_attention_4_k
float[batch,77,768] node_scaled_dot_product_attention_4_out
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_q
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_v
float[batch,77,768] node_scaled_dot_product_attention_5_k
float[batch,77,768] node_scaled_dot_product_attention_5_out
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_q
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_v
float[batch,77,768] node_scaled_dot_product_attention_6_k
float[batch,77,768] node_scaled_dot_product_attention_6_out
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_q
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_v
float[batch,77,768] node_scaled_dot_product_attention_7_k
float[batch,77,768] node_scaled_dot_product_attention_7_out
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_q
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_v
float[batch,77,768] node_scaled_dot_product_attention_8_k
float[batch,77,768] node_scaled_dot_product_attention_8_out
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_q
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_v
float[batch,77,768] node_scaled_dot_product_attention_9_k
float[batch,77,768] node_scaled_dot_product_attention_9_out
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_q
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_v
float[batch,77,768] node_scaled_dot_product_attention_k
float[batch,77,768] node_scaled_dot_product_attention_out
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_q
float[batch,77,2304] node_scaled_dot_product_attention_qkv
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_v
float[batch,77,768] scaled_dot_product_attention
float[batch,77,768] scaled_dot_product_attention_1
float[batch,77,768] scaled_dot_product_attention_10
float[batch,77,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_11_pooled
float[batch,77,768] scaled_dot_product_attention_2
float[batch,77,768] scaled_dot_product_attention_3
float[batch,77,768] scaled_dot_product_attention_4
float[batch,77,768] scaled_dot_product_attention_5
float[batch,77,768] scaled_dot_product_attention_6
float[batch,77,768] scaled_dot_product_attention_7
float[batch,77,768] scaled_dot_product_attention_8
float[batch,77,768] scaled_dot_product_attention_9
float[batch,77,3072] sigmoid
float[batch,77,3072] sigmoid_1
float[batch,77,3072] sigmoid_10
float[batch,1,3072] sigmoid_11
float[batch,77,3072] sigmoid_2
float[batch,77,3072] sigmoid_3
float[batch,77,3072] sigmoid_4
float[batch,77,3072] sigmoid_5
float[batch,77,3072] sigmoid_6
float[batch,77,3072] sigmoid_7
float[batch,77,3072] sigmoid_8
float[batch,77,3072] sigmoid_9
float[batch,77,3072] val_40
float[batch,77,768] val_41
float[batch,77,3072] val_42
float[batch,77,768] val_43
float[batch,77,3072] val_44
float[batch,77,768] val_45
float[batch,77,3072] val_46
float[batch,77,768] val_47
float[batch,77,3072] val_48
float[batch,77,768] val_49
float[batch,77,3072] val_50
float[batch,77,768] val_51
float[batch,77,3072] val_52
float[batch,77,768] val_53
float[batch,77,3072] val_54
float[batch,77,768] val_55
float[batch,77,3072] val_56
float[batch,77,768] val_57
float[batch,77,3072] val_58
float[batch,77,768] val_59
float[batch,77,3072] val_60
float[batch,77,768] val_61
float[batch,77] val_62
float[batch,1,77] val_63
float[batch,1,3072] val_64
float[batch,1,768] val_65
float[batch,1,768] val_66
float[batch,768] val_67
>
{
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_39)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_40 = MatMul (layer_norm_1, val_4)
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
mul_101 = Mul (linear_2, val_2)
[node_sigmoid] sigmoid = Sigmoid (mul_101)
mul_106 = Mul (linear_2, sigmoid)
val_41 = MatMul (mul_106, val_5)
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
add_148 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_42 = MatMul (layer_norm_3, val_7)
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
mul_208 = Mul (linear_6, val_2)
sigmoid_1 = Sigmoid (mul_208)
mul_213 = Mul (linear_6, sigmoid_1)
val_43 = MatMul (mul_213, val_8)
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
add_292 = Add (add_263, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_44 = MatMul (layer_norm_5, val_10)
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
mul_315 = Mul (linear_10, val_2)
sigmoid_2 = Sigmoid (mul_315)
mul_320 = Mul (linear_10, sigmoid_2)
val_45 = MatMul (mul_320, val_11)
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
add_436 = Add (add_407, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_46 = MatMul (layer_norm_7, val_13)
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
mul_422 = Mul (linear_14, val_2)
sigmoid_3 = Sigmoid (mul_422)
mul_427 = Mul (linear_14, sigmoid_3)
val_47 = MatMul (mul_427, val_14)
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
add_580 = Add (add_551, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_48 = MatMul (layer_norm_9, val_16)
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
mul_529 = Mul (linear_18, val_2)
sigmoid_4 = Sigmoid (mul_529)
mul_534 = Mul (linear_18, sigmoid_4)
val_49 = MatMul (mul_534, val_17)
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
add_724 = Add (add_695, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_50 = MatMul (layer_norm_11, val_19)
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
mul_636 = Mul (linear_22, val_2)
sigmoid_5 = Sigmoid (mul_636)
mul_641 = Mul (linear_22, sigmoid_5)
val_51 = MatMul (mul_641, val_20)
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
add_868 = Add (add_839, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_52 = MatMul (layer_norm_13, val_22)
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
mul_743 = Mul (linear_26, val_2)
sigmoid_6 = Sigmoid (mul_743)
mul_748 = Mul (linear_26, sigmoid_6)
val_53 = MatMul (mul_748, val_23)
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
add_1012 = Add (add_983, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_54 = MatMul (layer_norm_15, val_25)
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
mul_850 = Mul (linear_30, val_2)
sigmoid_7 = Sigmoid (mul_850)
mul_855 = Mul (linear_30, sigmoid_7)
val_55 = MatMul (mul_855, val_26)
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
add_1156 = Add (add_1127, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_56 = MatMul (layer_norm_17, val_28)
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
mul_957 = Mul (linear_34, val_2)
sigmoid_8 = Sigmoid (mul_957)
mul_962 = Mul (linear_34, sigmoid_8)
val_57 = MatMul (mul_962, val_29)
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
add_1300 = Add (add_1271, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_58 = MatMul (layer_norm_19, val_31)
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
mul_1064 = Mul (linear_38, val_2)
sigmoid_9 = Sigmoid (mul_1064)
mul_1069 = Mul (linear_38, sigmoid_9)
val_59 = MatMul (mul_1069, val_32)
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
add_1444 = Add (add_1415, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_60 = MatMul (layer_norm_21, val_34)
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
mul_1171 = Mul (linear_42, val_2)
sigmoid_10 = Sigmoid (mul_1171)
mul_1176 = Mul (linear_42, sigmoid_10)
val_61 = MatMul (mul_1176, val_35)
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
add_1588 = Add (add_1559, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
val_63 = Unsqueeze (val_62, val_756_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_64 = MatMul (layer_norm_23, val_37)
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
mul_1278 = Mul (linear_46, val_2)
sigmoid_11 = Sigmoid (mul_1278)
mul_1283 = Mul (linear_46, sigmoid_11)
val_65 = MatMul (mul_1283, val_38)
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
add_1732 = Add (add_1703, linear_47)
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
val_67 = Squeeze (val_66, val_756_axes1)
[node_matmul] matmul = MatMul (val_67, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
ln_final.bias FLOAT[768] 24ef686a3811
ln_final.weight FLOAT[768] 90401134ebc2
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 33b3c2faeec0
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 627db25bab1a
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] a9c4827c9b71
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] ce918b7f7fd9
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 0885acfa8515
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 36aa32fbd11b
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 1f82d8f2379b
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] c40f056d3cf3
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] cc96211ddb8b
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 547559af9a43
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 11fc02159fee
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 25864468d72a
positional_embedding FLOAT[77,768] bc34583d00bb
text_projection FLOAT[768,768] 297c30270a81
token_embedding.weight_fp16 FLOAT16[49408,768] cd79c56fec7f
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] d0d0a593526d
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] eeb44f4cafc4
transformer.resblocks.0.ln_1.bias FLOAT[768] 981891667f14
transformer.resblocks.0.ln_1.weight FLOAT[768] 83e196ff4689
transformer.resblocks.0.ln_2.bias FLOAT[768] 83e6ca3579c4
transformer.resblocks.0.ln_2.weight FLOAT[768] 779beaae8827
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 353ddfcf807b
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 29228570ef08
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] f5474f69c797
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 018185d1ec09
transformer.resblocks.1.ln_1.bias FLOAT[768] dffd221c0808
transformer.resblocks.1.ln_1.weight FLOAT[768] 9e7f02ae921b
transformer.resblocks.1.ln_2.bias FLOAT[768] f55facea44ec
transformer.resblocks.1.ln_2.weight FLOAT[768] 150f8b44b824
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 372d57587fa9
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 26fb32b4d44e
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] d7ee40b43813
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] ae8a04744a84
transformer.resblocks.10.ln_1.bias FLOAT[768] c83ebebd7937
transformer.resblocks.10.ln_1.weight FLOAT[768] bc410f1333e5
transformer.resblocks.10.ln_2.bias FLOAT[768] dc0ee38ee489
transformer.resblocks.10.ln_2.weight FLOAT[768] 3720b7101c21
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] 995a817a1442
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 122d34ffde8d
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 7514b9a61f82
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] ef4488e89523
transformer.resblocks.11.ln_1.bias FLOAT[768] 73d4ed77afb5
transformer.resblocks.11.ln_1.weight FLOAT[768] 4132833dc58e
transformer.resblocks.11.ln_2.bias FLOAT[768] 2ca6ff6e9328
transformer.resblocks.11.ln_2.weight FLOAT[768] 455009800b1b
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] d7ecb06ca7c6
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 3ad758f8131b
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 8cba74e6e560
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 83cea634fcbd
transformer.resblocks.2.ln_1.bias FLOAT[768] 70afcdb905b6
transformer.resblocks.2.ln_1.weight FLOAT[768] 56ad91c17d4f
transformer.resblocks.2.ln_2.bias FLOAT[768] e38b898696ff
transformer.resblocks.2.ln_2.weight FLOAT[768] 814a49aca793
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] f837204853ab
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 6257a06d35ac
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 15f1749786b3
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] c6b1e61e8886
transformer.resblocks.3.ln_1.bias FLOAT[768] 5d9751034f85
transformer.resblocks.3.ln_1.weight FLOAT[768] 560d9d9823b4
transformer.resblocks.3.ln_2.bias FLOAT[768] 4d4ffd062651
transformer.resblocks.3.ln_2.weight FLOAT[768] 6385651fea1d
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 260ff0902383
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] e7a0849029f5
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 5cbbf2b511ca
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] f2262f77acf1
transformer.resblocks.4.ln_1.bias FLOAT[768] 12813757a620
transformer.resblocks.4.ln_1.weight FLOAT[768] fec69e70cf60
transformer.resblocks.4.ln_2.bias FLOAT[768] 4f47f9291a35
transformer.resblocks.4.ln_2.weight FLOAT[768] fc5a7208d838
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 24d43d4a155c
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 783a03e212d9
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] bc1d86da0b41
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 20edd81662d9
transformer.resblocks.5.ln_1.bias FLOAT[768] faac686c132b
transformer.resblocks.5.ln_1.weight FLOAT[768] a637470738b9
transformer.resblocks.5.ln_2.bias FLOAT[768] c026109a877e
transformer.resblocks.5.ln_2.weight FLOAT[768] 89617b08b136
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 4bd7c7549045
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] bcbd49bec96a
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] dec645bdd955
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 994fbcf03d1a
transformer.resblocks.6.ln_1.bias FLOAT[768] c57bcb859e1a
transformer.resblocks.6.ln_1.weight FLOAT[768] b33681bc8c1a
transformer.resblocks.6.ln_2.bias FLOAT[768] 5b267bdea78a
transformer.resblocks.6.ln_2.weight FLOAT[768] 0473630e47bd
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 813d7893c20e
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 4bc372e2a8c7
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 8dfdc0587f46
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 1ca96c8d693e
transformer.resblocks.7.ln_1.bias FLOAT[768] 0f3fd7cd1c53
transformer.resblocks.7.ln_1.weight FLOAT[768] 0cd479804d82
transformer.resblocks.7.ln_2.bias FLOAT[768] e3ae07c86aba
transformer.resblocks.7.ln_2.weight FLOAT[768] 4a3e18521fe5
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 970242360506
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] df73f9c08db9
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 4c630b292636
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 40e234c02af8
transformer.resblocks.8.ln_1.bias FLOAT[768] 0aeea9e63a14
transformer.resblocks.8.ln_1.weight FLOAT[768] 1035ad8632b4
transformer.resblocks.8.ln_2.bias FLOAT[768] 81cf9a7fcf82
transformer.resblocks.8.ln_2.weight FLOAT[768] 08e6e05e91e2
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 52f3024582a4
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 8eedab868fcb
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 9084d707bd17
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 9de67295770a
transformer.resblocks.9.ln_1.bias FLOAT[768] 0fd74c48266a
transformer.resblocks.9.ln_1.weight FLOAT[768] cf07ef9cf17f
transformer.resblocks.9.ln_2.bias FLOAT[768] e128886ce24a
transformer.resblocks.9.ln_2.weight FLOAT[768] 7fcba32881be
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] af8e1978f2e5
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] cedb21bc86be
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] becf0a485fbf
val_11 FLOAT[3072,768] 361bb9c28152
val_12 FLOAT[768,2304] c74517b252b4
val_13 FLOAT[768,3072] c672f499d51e
val_14 FLOAT[3072,768] 5b5295c28b42
val_15 FLOAT[768,2304] d24f7de07e9d
val_16 FLOAT[768,3072] 2df618a84aba
val_17 FLOAT[3072,768] f44e250f5637
val_18 FLOAT[768,2304] e8625bea5892
val_19 FLOAT[768,3072] 330a5ed3a81c
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[3072,768] 6f465adf084b
val_21 FLOAT[768,2304] 54363c219abf
val_22 FLOAT[768,3072] 9815641baa66
val_23 FLOAT[3072,768] 8d62b6a4c15f
val_24 FLOAT[768,2304] 1675402a49d0
val_25 FLOAT[768,3072] 9951104c7282
val_26 FLOAT[3072,768] 172c1dbebd92
val_27 FLOAT[768,2304] 6388fde71847
val_28 FLOAT[768,3072] 311fa850c6eb
val_29 FLOAT[3072,768] 854e0ff26d2b
val_3 FLOAT[768,2304] 75881149a676
val_30 FLOAT[768,2304] c258a2400ebe
val_31 FLOAT[768,3072] 2a8dde704853
val_32 FLOAT[3072,768] 319104669bdf
val_33 FLOAT[768,2304] 08e74a34b1f6
val_34 FLOAT[768,3072] 780ce099bd67
val_35 FLOAT[3072,768] 62ea2cceed5e
val_36 FLOAT[768,2304] 0d5ba1350052
val_37 FLOAT[768,3072] 5d1308c03da1
val_38 FLOAT[3072,768] c41278efa2e1
val_4 FLOAT[768,3072] 6f1b1f6544bd
val_5 FLOAT[3072,768] 545c09861a36
val_6 FLOAT[768,2304] 0d8ac1780b93
val_7 FLOAT[768,3072] 2e19ecbd93d7
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[3072,768] ba1b54d512b3
val_9 FLOAT[768,2304] c693fdc22294
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
<
float[batch,77,768] add_1012
float[batch,77,768] add_1127
float[batch,77,768] add_1156
float[batch,77,768] add_119
float[batch,77,768] add_1271
float[batch,77,768] add_1300
float[batch,77,768] add_1415
float[batch,77,768] add_1444
float[batch,77,768] add_148
float[batch,77,768] add_1559
float[batch,77,768] add_1588
float[batch,1,768] add_1588_pooled
float[batch,1,768] add_1703
float[batch,1,768] add_1732
float[batch,77,768] add_263
float[batch,77,768] add_292
float[batch,77,768] add_4
float[batch,77,768] add_407
float[batch,77,768] add_436
float[batch,77,768] add_551
float[batch,77,768] add_580
float[batch,77,768] add_695
float[batch,77,768] add_724
float[batch,77,768] add_839
float[batch,77,768] add_868
float[batch,77,768] add_983
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,768] embedding
float[batch,77,768] layer_norm
float[batch,77,768] layer_norm_1
float[batch,77,768] layer_norm_10
float[batch,77,768] layer_norm_11
float[batch,77,768] layer_norm_12
float[batch,77,768] layer_norm_13
float[batch,77,768] layer_norm_14
float[batch,77,768] layer_norm_15
float[batch,77,768] layer_norm_16
float[batch,77,768] layer_norm_17
float[batch,77,768] layer_norm_18
float[batch,77,768] layer_norm_19
float[batch,77,768] layer_norm_2
float[batch,77,768] layer_norm_20
float[batch,77,768] layer_norm_21
float[batch,77,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,77,768] layer_norm_3
float[batch,77,768] layer_norm_4
float[batch,77,768] layer_norm_5
float[batch,77,768] layer_norm_6
float[batch,77,768] layer_norm_7
float[batch,77,768] layer_norm_8
float[batch,77,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,3072] linear_10
float[batch,77,768] linear_11
float[batch,77,3072] linear_14
float[batch,77,768] linear_15
float[batch,77,3072] linear_18
float[batch,77,768] linear_19
float[batch,77,3072] linear_2
float[batch,77,3072] linear_22
float[batch,77,768] linear_23
float[batch,77,3072] linear_26
float[batch,77,768] linear_27
float[batch,77,768] linear_3
float[batch,77,3072] linear_30
float[batch,77,768] linear_31
float[batch,77,3072] linear_34
float[batch,77,768] linear_35
float[batch,77,3072] linear_38
float[batch,77,768] linear_39
float[batch,77,3072] linear_42
float[batch,77,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,77,3072] linear_6
float[batch,77,768] linear_7
float[batch,768] matmul
float[batch,77,3072] mul_101
float[batch,77,3072] mul_106
float[batch,77,3072] mul_1064
float[batch,77,3072] mul_1069
float[batch,77,3072] mul_1171
float[batch,77,3072] mul_1176
float[batch,1,3072] mul_1278
float[batch,1,3072] mul_1283
float[batch,77,3072] mul_208
float[batch,77,3072] mul_213
float[batch,77,3072] mul_315
float[batch,77,3072] mul_320
float[batch,77,3072] mul_422
float[batch,77,3072] mul_427
float[batch,77,3072] mul_529
float[batch,77,3072] mul_534
float[batch,77,3072] mul_636
float[batch,77,3072] mul_641
float[batch,77,3072] mul_743
float[batch,77,3072] mul_748
float[batch,77,3072] mul_850
float[batch,77,3072] mul_855
float[batch,77,3072] mul_957
float[batch,77,3072] mul_962
float[batch,77,768] node_scaled_dot_product_attention_10_k
float[batch,77,768] node_scaled_dot_product_attention_10_out
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_q
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_v
float[batch,77,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_q
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_v
float[batch,77,768] node_scaled_dot_product_attention_1_k
float[batch,77,768] node_scaled_dot_product_attention_1_out
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_q
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_v
float[batch,77,768] node_scaled_dot_product_attention_2_k
float[batch,77,768] node_scaled_dot_product_attention_2_out
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_q
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_v
float[batch,77,768] node_scaled_dot_product_attention_3_k
float[batch,77,768] node_scaled_dot_product_attention_3_out
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_q
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_v
float[batch,77,768] node_scaled_dot_product_attention_4_k
float[batch,77,768] node_scaled_dot_product_attention_4_out
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_q
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_v
float[batch,77,768] node_scaled_dot_product_attention_5_k
float[batch,77,768] node_scaled_dot_product_attention_5_out
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_q
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_v
float[batch,77,768] node_scaled_dot_product_attention_6_k
float[batch,77,768] node_scaled_dot_product_attention_6_out
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_q
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_v
float[batch,77,768] node_scaled_dot_product_attention_7_k
float[batch,77,768] node_scaled_dot_product_attention_7_out
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_q
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_v
float[batch,77,768] node_scaled_dot_product_attention_8_k
float[batch,77,768] node_scaled_dot_product_attention_8_out
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_q
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_v
float[batch,77,768] node_scaled_dot_product_attention_9_k
float[batch,77,768] node_scaled_dot_product_attention_9_out
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_q
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_v
float[batch,77,768] node_scaled_dot_product_attention_k
float[batch,77,768] node_scaled_dot_product_attention_out
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_q
float[batch,77,2304] node_scaled_dot_product_attention_qkv
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_v
float[batch,77,768] scaled_dot_product_attention
float[batch,77,768] scaled_dot_product_attention_1
float[batch,77,768] scaled_dot_product_attention_10
float[batch,77,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_11_pooled
float[batch,77,768] scaled_dot_product_attention_2
float[batch,77,768] scaled_dot_product_attention_3
float[batch,77,768] scaled_dot_product_attention_4
float[batch,77,768] scaled_dot_product_attention_5
float[batch,77,768] scaled_dot_product_attention_6
float[batch,77,768] scaled_dot_product_attention_7
float[batch,77,768] scaled_dot_product_attention_8
float[batch,77,768] scaled_dot_product_attention_9
float[batch,77,3072] sigmoid
float[batch,77,3072] sigmoid_1
float[batch,77,3072] sigmoid_10
float[batch,1,3072] sigmoid_11
float[batch,77,3072] sigmoid_2
float[batch,77,3072] sigmoid_3
float[batch,77,3072] sigmoid_4
float[batch,77,3072] sigmoid_5
float[batch,77,3072] sigmoid_6
float[batch,77,3072] sigmoid_7
float[batch,77,3072] sigmoid_8
float[batch,77,3072] sigmoid_9
float[batch,77,3072] val_40
float[batch,77,768] val_41
float[batch,77,3072] val_42
float[batch,77,768] val_43
float[batch,77,3072] val_44
float[batch,77,768] val_45
float[batch,77,3072] val_46
float[batch,77,768] val_47
float[batch,77,3072] val_48
float[batch,77,768] val_49
float[batch,77,3072] val_50
float[batch,77,768] val_51
float[batch,77,3072] val_52
float[batch,77,768] val_53
float[batch,77,3072] val_54
float[batch,77,768] val_55
float[batch,77,3072] val_56
float[batch,77,768] val_57
float[batch,77,3072] val_58
float[batch,77,768] val_59
float[batch,77,3072] val_60
float[batch,77,768] val_61
float[batch,77] val_62
float[batch,1,77] val_63
float[batch,1,3072] val_64
float[batch,1,768] val_65
float[batch,1,768] val_66
float[batch,768] val_67
>
{
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_39)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_40 = MatMul (layer_norm_1, val_4)
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
mul_101 = Mul (linear_2, val_2)
[node_sigmoid] sigmoid = Sigmoid (mul_101)
mul_106 = Mul (linear_2, sigmoid)
val_41 = MatMul (mul_106, val_5)
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
add_148 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_42 = MatMul (layer_norm_3, val_7)
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
mul_208 = Mul (linear_6, val_2)
sigmoid_1 = Sigmoid (mul_208)
mul_213 = Mul (linear_6, sigmoid_1)
val_43 = MatMul (mul_213, val_8)
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
add_292 = Add (add_263, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_44 = MatMul (layer_norm_5, val_10)
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
mul_315 = Mul (linear_10, val_2)
sigmoid_2 = Sigmoid (mul_315)
mul_320 = Mul (linear_10, sigmoid_2)
val_45 = MatMul (mul_320, val_11)
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
add_436 = Add (add_407, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_46 = MatMul (layer_norm_7, val_13)
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
mul_422 = Mul (linear_14, val_2)
sigmoid_3 = Sigmoid (mul_422)
mul_427 = Mul (linear_14, sigmoid_3)
val_47 = MatMul (mul_427, val_14)
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
add_580 = Add (add_551, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_48 = MatMul (layer_norm_9, val_16)
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
mul_529 = Mul (linear_18, val_2)
sigmoid_4 = Sigmoid (mul_529)
mul_534 = Mul (linear_18, sigmoid_4)
val_49 = MatMul (mul_534, val_17)
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
add_724 = Add (add_695, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_50 = MatMul (layer_norm_11, val_19)
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
mul_636 = Mul (linear_22, val_2)
sigmoid_5 = Sigmoid (mul_636)
mul_641 = Mul (linear_22, sigmoid_5)
val_51 = MatMul (mul_641, val_20)
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
add_868 = Add (add_839, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_52 = MatMul (layer_norm_13, val_22)
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
mul_743 = Mul (linear_26, val_2)
sigmoid_6 = Sigmoid (mul_743)
mul_748 = Mul (linear_26, sigmoid_6)
val_53 = MatMul (mul_748, val_23)
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
add_1012 = Add (add_983, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_54 = MatMul (layer_norm_15, val_25)
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
mul_850 = Mul (linear_30, val_2)
sigmoid_7 = Sigmoid (mul_850)
mul_855 = Mul (linear_30, sigmoid_7)
val_55 = MatMul (mul_855, val_26)
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
add_1156 = Add (add_1127, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_56 = MatMul (layer_norm_17, val_28)
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
mul_957 = Mul (linear_34, val_2)
sigmoid_8 = Sigmoid (mul_957)
mul_962 = Mul (linear_34, sigmoid_8)
val_57 = MatMul (mul_962, val_29)
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
add_1300 = Add (add_1271, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_58 = MatMul (layer_norm_19, val_31)
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
mul_1064 = Mul (linear_38, val_2)
sigmoid_9 = Sigmoid (mul_1064)
mul_1069 = Mul (linear_38, sigmoid_9)
val_59 = MatMul (mul_1069, val_32)
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
add_1444 = Add (add_1415, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_60 = MatMul (layer_norm_21, val_34)
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
mul_1171 = Mul (linear_42, val_2)
sigmoid_10 = Sigmoid (mul_1171)
mul_1176 = Mul (linear_42, sigmoid_10)
val_61 = MatMul (mul_1176, val_35)
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
add_1588 = Add (add_1559, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
val_63 = Unsqueeze (val_62, val_756_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_64 = MatMul (layer_norm_23, val_37)
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
mul_1278 = Mul (linear_46, val_2)
sigmoid_11 = Sigmoid (mul_1278)
mul_1283 = Mul (linear_46, sigmoid_11)
val_65 = MatMul (mul_1283, val_38)
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
add_1732 = Add (add_1703, linear_47)
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
val_67 = Squeeze (val_66, val_756_axes1)
[node_matmul] matmul = MatMul (val_67, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
ln_final.bias FLOAT[768] d286215150b6
ln_final.weight FLOAT[768] 556d0ffe7ae2
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 1c074aa507a2
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 63eb58c92dd2
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 6896d1e0ee1d
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 09c23c4b994e
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 7adf7a3d9055
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] df9e23e5aa97
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 44fdfd19f1d2
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] bdbc27e4e696
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 63eedb4bcf46
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 8e550d35db51
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 1793c397c3d2
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 7f1441e4a0fe
positional_embedding FLOAT[77,768] 365813339aa5
text_projection FLOAT[768,768] 5ef115a768a2
token_embedding.weight_fp16 FLOAT16[49408,768] 8ea9cf1b13d2
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] db4f2dac345c
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] fd39871a5805
transformer.resblocks.0.ln_1.bias FLOAT[768] c1e0edc8f8d3
transformer.resblocks.0.ln_1.weight FLOAT[768] 139680612efe
transformer.resblocks.0.ln_2.bias FLOAT[768] 0ad2afc8a7e9
transformer.resblocks.0.ln_2.weight FLOAT[768] d70b1f74a2ba
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] e97e657a6731
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 9cbe9596e1e3
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] 89d8ec9ef5d1
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 93b7488e382a
transformer.resblocks.1.ln_1.bias FLOAT[768] f08ce32b0d58
transformer.resblocks.1.ln_1.weight FLOAT[768] 9c06809bb745
transformer.resblocks.1.ln_2.bias FLOAT[768] d07dd290c7a6
transformer.resblocks.1.ln_2.weight FLOAT[768] 4cec4f426bce
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] c10871f4f504
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] a9a2729972de
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] c2c524d8941c
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 9bff4f79bb02
transformer.resblocks.10.ln_1.bias FLOAT[768] 2c5eb37c55b7
transformer.resblocks.10.ln_1.weight FLOAT[768] a3d6dd83fd17
transformer.resblocks.10.ln_2.bias FLOAT[768] 7bfe3e64135b
transformer.resblocks.10.ln_2.weight FLOAT[768] 1a312de0e8f1
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] dce4d8e95c76
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] a2d446605c22
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 497e6db56d0b
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 95b695c3e6a8
transformer.resblocks.11.ln_1.bias FLOAT[768] b36f19bb4fec
transformer.resblocks.11.ln_1.weight FLOAT[768] e415058984dc
transformer.resblocks.11.ln_2.bias FLOAT[768] 48712b435496
transformer.resblocks.11.ln_2.weight FLOAT[768] 0fb804dfc22f
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] a09090df612c
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 1bd4d19aa81f
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] d6b2a1d5a827
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] ce27580bfd87
transformer.resblocks.2.ln_1.bias FLOAT[768] d09dea29753f
transformer.resblocks.2.ln_1.weight FLOAT[768] c5741c559ed2
transformer.resblocks.2.ln_2.bias FLOAT[768] 11895c25bac2
transformer.resblocks.2.ln_2.weight FLOAT[768] 701dda7d9c3a
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 5a89f6018472
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 06ef8e06c2b1
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] b0af6f9fa5fd
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] bd93e4bf77a5
transformer.resblocks.3.ln_1.bias FLOAT[768] 3dd5d11731b1
transformer.resblocks.3.ln_1.weight FLOAT[768] ce5de647476d
transformer.resblocks.3.ln_2.bias FLOAT[768] 7ab05da61921
transformer.resblocks.3.ln_2.weight FLOAT[768] 77f16f3c79ff
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 45f8ec47287d
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] dbe30485268a
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] fbf6adc184cb
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 701c51e7ad8a
transformer.resblocks.4.ln_1.bias FLOAT[768] 460e2bc911d0
transformer.resblocks.4.ln_1.weight FLOAT[768] 1986d66ad476
transformer.resblocks.4.ln_2.bias FLOAT[768] 20ee0eefe132
transformer.resblocks.4.ln_2.weight FLOAT[768] daf7a12aaac0
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] f235f8681826
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] db88b437b52e
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 00da7a3a5f3c
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 884778acc4e0
transformer.resblocks.5.ln_1.bias FLOAT[768] d99fee1e1116
transformer.resblocks.5.ln_1.weight FLOAT[768] 109751f4dbca
transformer.resblocks.5.ln_2.bias FLOAT[768] 12873bce8dcb
transformer.resblocks.5.ln_2.weight FLOAT[768] 840079e07f74
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 4847554a8ab3
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 39a53314a1f6
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 7b4f253be60f
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 1dad977fde56
transformer.resblocks.6.ln_1.bias FLOAT[768] 17b32dba2aac
transformer.resblocks.6.ln_1.weight FLOAT[768] a95e72fd2942
transformer.resblocks.6.ln_2.bias FLOAT[768] fcce38776014
transformer.resblocks.6.ln_2.weight FLOAT[768] bfde37afa778
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] a757f0b548b8
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 363b5c0d2fa0
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 46c08f30a78f
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] e3beb749da5f
transformer.resblocks.7.ln_1.bias FLOAT[768] b893bd254e1d
transformer.resblocks.7.ln_1.weight FLOAT[768] 255fe8f4fc1f
transformer.resblocks.7.ln_2.bias FLOAT[768] b784ad2ce37f
transformer.resblocks.7.ln_2.weight FLOAT[768] 95210a4cd584
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] afa5ca735ffb
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] f960011a8d8e
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 2d1f692f89ec
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 51343df5d850
transformer.resblocks.8.ln_1.bias FLOAT[768] cdbb836e2789
transformer.resblocks.8.ln_1.weight FLOAT[768] 122988155cd0
transformer.resblocks.8.ln_2.bias FLOAT[768] aa80b9e13a23
transformer.resblocks.8.ln_2.weight FLOAT[768] 5154eccd86d7
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 5b72ae7e48f0
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 764c4a6fcc4e
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 5f6abd210ab4
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 5da06515b9e5
transformer.resblocks.9.ln_1.bias FLOAT[768] 601003f5e967
transformer.resblocks.9.ln_1.weight FLOAT[768] 581c2da66568
transformer.resblocks.9.ln_2.bias FLOAT[768] c6a05064dd2a
transformer.resblocks.9.ln_2.weight FLOAT[768] f86bf7b972a2
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] aec415dd090a
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 465e1defff38
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] 34ad1a717bb7
val_11 FLOAT[3072,768] 224f0d090796
val_12 FLOAT[768,2304] 983563554a9c
val_13 FLOAT[768,3072] 4baf276d71be
val_14 FLOAT[3072,768] 65497e87db12
val_15 FLOAT[768,2304] 24e94e7fecdf
val_16 FLOAT[768,3072] 82d8dde8df3b
val_17 FLOAT[3072,768] 5a12b45cda8c
val_18 FLOAT[768,2304] 4e74fb61ba71
val_19 FLOAT[768,3072] e6d253726b40
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[3072,768] fe12e2c4c89d
val_21 FLOAT[768,2304] d1bf82bb4e41
val_22 FLOAT[768,3072] c377e9d76d23
val_23 FLOAT[3072,768] d3cf2eedc465
val_24 FLOAT[768,2304] 9f7c1fb02db8
val_25 FLOAT[768,3072] 873f936e84e6
val_26 FLOAT[3072,768] eb491afd6a4b
val_27 FLOAT[768,2304] 02f87b197b40
val_28 FLOAT[768,3072] 2219992f4041
val_29 FLOAT[3072,768] 87149610dbde
val_3 FLOAT[768,2304] 164125074a4a
val_30 FLOAT[768,2304] e28bc4825bb8
val_31 FLOAT[768,3072] eb93ed5475ac
val_32 FLOAT[3072,768] da4c849626a1
val_33 FLOAT[768,2304] fc2f6dd80fec
val_34 FLOAT[768,3072] fcf2debc80d4
val_35 FLOAT[3072,768] ada0cda2dcbe
val_36 FLOAT[768,2304] ee2f91e8e6e4
val_37 FLOAT[768,3072] 328902d83703
val_38 FLOAT[3072,768] e1bee6ed74d6
val_4 FLOAT[768,3072] 3487c88198dc
val_5 FLOAT[3072,768] f0d750a6e422
val_6 FLOAT[768,2304] 76292c6fcb80
val_7 FLOAT[768,3072] d23839378a0f
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[3072,768] 9ceee1af6903
val_9 FLOAT[768,2304] a4a8df6c8434
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
<
float[batch,77,768] add_1071
float[batch,77,768] add_1092
float[batch,77,768] add_119
float[batch,77,768] add_1207
float[batch,77,768] add_1228
float[batch,77,768] add_1343
float[batch,77,768] add_1364
float[batch,77,768] add_140
float[batch,77,768] add_1479
float[batch,77,768] add_1500
float[batch,1,768] add_1500_pooled
float[batch,1,768] add_1615
float[batch,1,768] add_1636
float[batch,77,768] add_255
float[batch,77,768] add_276
float[batch,77,768] add_391
float[batch,77,768] add_4
float[batch,77,768] add_412
float[batch,77,768] add_527
float[batch,77,768] add_548
float[batch,77,768] add_663
float[batch,77,768] add_684
float[batch,77,768] add_799
float[batch,77,768] add_820
float[batch,77,768] add_935
float[batch,77,768] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,768] embedding
float[batch,77,3072] gelu
float[batch,77,3072] gelu_1
float[batch,77,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,77,3072] gelu_2
float[batch,77,3072] gelu_3
float[batch,77,3072] gelu_4
float[batch,77,3072] gelu_5
float[batch,77,3072] gelu_6
float[batch,77,3072] gelu_7
float[batch,77,3072] gelu_8
float[batch,77,3072] gelu_9
float[batch,77,768] layer_norm
float[batch,77,768] layer_norm_1
float[batch,77,768] layer_norm_10
float[batch,77,768] layer_norm_11
float[batch,77,768] layer_norm_12
float[batch,77,768] layer_norm_13
float[batch,77,768] layer_norm_14
float[batch,77,768] layer_norm_15
float[batch,77,768] layer_norm_16
float[batch,77,768] layer_norm_17
float[batch,77,768] layer_norm_18
float[batch,77,768] layer_norm_19
float[batch,77,768] layer_norm_2
float[batch,77,768] layer_norm_20
float[batch,77,768] layer_norm_21
float[batch,77,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,77,768] layer_norm_3
float[batch,77,768] layer_norm_4
float[batch,77,768] layer_norm_5
float[batch,77,768] layer_norm_6
float[batch,77,768] layer_norm_7
float[batch,77,768] layer_norm_8
float[batch,77,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,3072] linear_10
float[batch,77,768] linear_11
float[batch,77,3072] linear_14
float[batch,77,768] linear_15
float[batch,77,3072] linear_18
float[batch,77,768] linear_19
float[batch,77,3072] linear_2
float[batch,77,3072] linear_22
float[batch,77,768] linear_23
float[batch,77,3072] linear_26
float[batch,77,768] linear_27
float[batch,77,768] linear_3
float[batch,77,3072] linear_30
float[batch,77,768] linear_31
float[batch,77,3072] linear_34
float[batch,77,768] linear_35
float[batch,77,3072] linear_38
float[batch,77,768] linear_39
float[batch,77,3072] linear_42
float[batch,77,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,77,3072] linear_6
float[batch,77,768] linear_7
float[batch,768] matmul
float[batch,77,768] node_scaled_dot_product_attention_10_k
float[batch,77,768] node_scaled_dot_product_attention_10_out
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_q
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_v
float[batch,77,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_q
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_v
float[batch,77,768] node_scaled_dot_product_attention_1_k
float[batch,77,768] node_scaled_dot_product_attention_1_out
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_q
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_v
float[batch,77,768] node_scaled_dot_product_attention_2_k
float[batch,77,768] node_scaled_dot_product_attention_2_out
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_q
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_v
float[batch,77,768] node_scaled_dot_product_attention_3_k
float[batch,77,768] node_scaled_dot_product_attention_3_out
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_q
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_v
float[batch,77,768] node_scaled_dot_product_attention_4_k
float[batch,77,768] node_scaled_dot_product_attention_4_out
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_q
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_v
float[batch,77,768] node_scaled_dot_product_attention_5_k
float[batch,77,768] node_scaled_dot_product_attention_5_out
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_q
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_v
float[batch,77,768] node_scaled_dot_product_attention_6_k
float[batch,77,768] node_scaled_dot_product_attention_6_out
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_q
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_v
float[batch,77,768] node_scaled_dot_product_attention_7_k
float[batch,77,768] node_scaled_dot_product_attention_7_out
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_q
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_v
float[batch,77,768] node_scaled_dot_product_attention_8_k
float[batch,77,768] node_scaled_dot_product_attention_8_out
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_q
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_v
float[batch,77,768] node_scaled_dot_product_attention_9_k
float[batch,77,768] node_scaled_dot_product_attention_9_out
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_q
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_v
float[batch,77,768] node_scaled_dot_product_attention_k
float[batch,77,768] node_scaled_dot_product_attention_out
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_q
float[batch,77,2304] node_scaled_dot_product_attention_qkv
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_v
float[batch,77,768] scaled_dot_product_attention
float[batch,77,768] scaled_dot_product_attention_1
float[batch,77,768] scaled_dot_product_attention_10
float[batch,77,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_11_pooled
float[batch,77,768] scaled_dot_product_attention_2
float[batch,77,768] scaled_dot_product_attention_3
float[batch,77,768] scaled_dot_product_attention_4
float[batch,77,768] scaled_dot_product_attention_5
float[batch,77,768] scaled_dot_product_attention_6
float[batch,77,768] scaled_dot_product_attention_7
float[batch,77,768] scaled_dot_product_attention_8
float[batch,77,768] scaled_dot_product_attention_9
float[batch,77,3072] val_39
float[batch,77,768] val_40
float[batch,77,3072] val_41
float[batch,77,768] val_42
float[batch,77,3072] val_43
float[batch,77,768] val_44
float[batch,77,3072] val_45
float[batch,77,768] val_46
float[batch,77,3072] val_47
float[batch,77,768] val_48
float[batch,77,3072] val_49
float[batch,77,768] val_50
float[batch,77,3072] val_51
float[batch,77,768] val_52
float[batch,77,3072] val_53
float[batch,77,768] val_54
float[batch,77,3072] val_55
float[batch,77,768] val_56
float[batch,77,3072] val_57
float[batch,77,768] val_58
float[batch,77,3072] val_59
float[batch,77,768] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,3072] val_63
float[batch,1,768] val_64
float[batch,1,768] val_65
float[batch,768] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
ln_final.bias FLOAT[768] dba19084d90b
ln_final.weight FLOAT[768] b558c4ac6e38
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 9c29135c341b
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 5482e0adfd4b
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 510a6c1a7f62
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 15b2edc712cd
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 121810cb2bdc
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 36423c7c7dc8
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] f5f46c8dec9e
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 7b90e7139301
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 1366123ce262
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 1b5ed0d56361
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ee2d9d8da4b1
node_scaled_dot_product_attention_wo_t FLOAT[768,768] c8141613ecf2
positional_embedding FLOAT[77,768] 5f16dd1fc44e
text_projection FLOAT[768,768] c7676f9eb616
token_embedding.weight_fp16 FLOAT16[49408,768] 35540399de50
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 26eb8c55f6ee
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] f22968b0dc0c
transformer.resblocks.0.ln_1.bias FLOAT[768] a4c53ca350e4
transformer.resblocks.0.ln_1.weight FLOAT[768] 0851e4f4f882
transformer.resblocks.0.ln_2.bias FLOAT[768] f4b22a0217a9
transformer.resblocks.0.ln_2.weight FLOAT[768] 4cda2f17081f
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 847b227c6e17
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 12679d2237e4
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] decfe6e317bd
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 01ef02edb4a2
transformer.resblocks.1.ln_1.bias FLOAT[768] a39ca069958d
transformer.resblocks.1.ln_1.weight FLOAT[768] 294ea5a480f1
transformer.resblocks.1.ln_2.bias FLOAT[768] 53647a13720d
transformer.resblocks.1.ln_2.weight FLOAT[768] 5f92a36ca43c
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] b017930dd91d
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 93043e95bb7d
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] b5a89ab0b04b
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] c0bb6f3319e6
transformer.resblocks.10.ln_1.bias FLOAT[768] 0e2fc54879b1
transformer.resblocks.10.ln_1.weight FLOAT[768] 32c8d658d754
transformer.resblocks.10.ln_2.bias FLOAT[768] 19a0d3e5855e
transformer.resblocks.10.ln_2.weight FLOAT[768] ad658175f96c
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] a73c20f5540c
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 0f886f533529
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 8e461d08e6f8
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] bf37c9466e17
transformer.resblocks.11.ln_1.bias FLOAT[768] 6e0d2c68c6cc
transformer.resblocks.11.ln_1.weight FLOAT[768] 7efbee7c4565
transformer.resblocks.11.ln_2.bias FLOAT[768] 8e0c2e643ed7
transformer.resblocks.11.ln_2.weight FLOAT[768] dc9e8ae0aede
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] cd0d0466a3fd
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] edd2dbea2ffe
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 9666ebb96405
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 1463435a07fb
transformer.resblocks.2.ln_1.bias FLOAT[768] 78823461abcd
transformer.resblocks.2.ln_1.weight FLOAT[768] f3ad62968853
transformer.resblocks.2.ln_2.bias FLOAT[768] 3b3d1d096c91
transformer.resblocks.2.ln_2.weight FLOAT[768] 5df5c5eb6fd3
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 1133494758ec
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] eab4287b962b
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 2b52a1baaef9
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 59ddfc83ef8b
transformer.resblocks.3.ln_1.bias FLOAT[768] c8be2da71bd0
transformer.resblocks.3.ln_1.weight FLOAT[768] 5d7a02bbf439
transformer.resblocks.3.ln_2.bias FLOAT[768] 07d680b1f04c
transformer.resblocks.3.ln_2.weight FLOAT[768] 349131c8a2d2
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] e44c994d07fc
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] fcaa21fc72a4
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] eb84d55f0c3e
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 53e0f650f47e
transformer.resblocks.4.ln_1.bias FLOAT[768] 16a61e013ddd
transformer.resblocks.4.ln_1.weight FLOAT[768] e9ea7fd1868c
transformer.resblocks.4.ln_2.bias FLOAT[768] b1ac526e4301
transformer.resblocks.4.ln_2.weight FLOAT[768] fde28576ba34
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 8223b5d1fb09
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 379ee8747604
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] ff94f77514df
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 1ca7cbd1471c
transformer.resblocks.5.ln_1.bias FLOAT[768] 2f9ea66e0577
transformer.resblocks.5.ln_1.weight FLOAT[768] 36f0b6a808c1
transformer.resblocks.5.ln_2.bias FLOAT[768] ec08e034c6ff
transformer.resblocks.5.ln_2.weight FLOAT[768] ac111777f520
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 5c278c0c3274
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] d9910081cc44
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] d62604830b92
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] b705ca052d30
transformer.resblocks.6.ln_1.bias FLOAT[768] 07d82afbab22
transformer.resblocks.6.ln_1.weight FLOAT[768] 8256675e19d0
transformer.resblocks.6.ln_2.bias FLOAT[768] 953404a3d37b
transformer.resblocks.6.ln_2.weight FLOAT[768] b17ab6076aab
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 37545d0d9128
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 79a685ff0011
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] d886811316d2
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 835bd9cdae2d
transformer.resblocks.7.ln_1.bias FLOAT[768] b88f06a36824
transformer.resblocks.7.ln_1.weight FLOAT[768] a4be6aa18e1c
transformer.resblocks.7.ln_2.bias FLOAT[768] 2cdd15269d84
transformer.resblocks.7.ln_2.weight FLOAT[768] b3239799bdbf
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] ef541d16508d
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 8de30eac19d2
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] bfe69edc540d
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 09894ad69af0
transformer.resblocks.8.ln_1.bias FLOAT[768] 0abe4ed09bc3
transformer.resblocks.8.ln_1.weight FLOAT[768] 9f1d141bf733
transformer.resblocks.8.ln_2.bias FLOAT[768] 932fb764600a
transformer.resblocks.8.ln_2.weight FLOAT[768] 619fca305b9c
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 766096a4e090
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 9d3f26ff64e3
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] acdc8a659353
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 3f216f97b2f6
transformer.resblocks.9.ln_1.bias FLOAT[768] 00bc262927d1
transformer.resblocks.9.ln_1.weight FLOAT[768] 7836027ca7db
transformer.resblocks.9.ln_2.bias FLOAT[768] bfdc38862ddf
transformer.resblocks.9.ln_2.weight FLOAT[768] 590573170b29
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 60efb9311587
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 26002a9af872
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[3072,768] 24ac16dcc61d
val_11 FLOAT[768,2304] 8b3727b50c7a
val_12 FLOAT[768,3072] a1bf18910032
val_13 FLOAT[3072,768] 6b0461d463df
val_14 FLOAT[768,2304] cc051ebc1112
val_15 FLOAT[768,3072] 7432131a70c7
val_16 FLOAT[3072,768] b395ec090fb9
val_17 FLOAT[768,2304] dd20f30e4ed6
val_18 FLOAT[768,3072] 5a5c97b57e5c
val_19 FLOAT[3072,768] c0a3f7969ef4
val_2 FLOAT[768,2304] 98ef4ca875d5
val_20 FLOAT[768,2304] 4847af810307
val_21 FLOAT[768,3072] a51cbbfb819e
val_22 FLOAT[3072,768] ab6ccb1d9924
val_23 FLOAT[768,2304] e25c52182f6d
val_24 FLOAT[768,3072] 02da0af43baf
val_25 FLOAT[3072,768] caef7c45dead
val_26 FLOAT[768,2304] 70ca90b566ad
val_27 FLOAT[768,3072] 81338c391bc3
val_28 FLOAT[3072,768] 12a481029464
val_29 FLOAT[768,2304] 19e05964b861
val_3 FLOAT[768,3072] b0a11fe04530
val_30 FLOAT[768,3072] b657bfff47b2
val_31 FLOAT[3072,768] b6c4743c42cb
val_32 FLOAT[768,2304] 9a267e68cc16
val_33 FLOAT[768,3072] 68a924995109
val_34 FLOAT[3072,768] ee6f12848617
val_35 FLOAT[768,2304] 6d5336947763
val_36 FLOAT[768,3072] c6fafd2605fc
val_37 FLOAT[3072,768] f364208d3cde
val_4 FLOAT[3072,768] 5dc64a2d6992
val_5 FLOAT[768,2304] 02dbdeb4a500
val_6 FLOAT[768,3072] c30e44280a1c
val_7 FLOAT[3072,768] 0bd58b00429c
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[768,2304] ab766f5157d5
val_9 FLOAT[768,3072] af61028b2540
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
<
float[batch,77,768] add_1071
float[batch,77,768] add_1092
float[batch,77,768] add_119
float[batch,77,768] add_1207
float[batch,77,768] add_1228
float[batch,77,768] add_1343
float[batch,77,768] add_1364
float[batch,77,768] add_140
float[batch,77,768] add_1479
float[batch,77,768] add_1500
float[batch,1,768] add_1500_pooled
float[batch,1,768] add_1615
float[batch,1,768] add_1636
float[batch,77,768] add_255
float[batch,77,768] add_276
float[batch,77,768] add_391
float[batch,77,768] add_4
float[batch,77,768] add_412
float[batch,77,768] add_527
float[batch,77,768] add_548
float[batch,77,768] add_663
float[batch,77,768] add_684
float[batch,77,768] add_799
float[batch,77,768] add_820
float[batch,77,768] add_935
float[batch,77,768] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,768] embedding
float[batch,77,3072] gelu
float[batch,77,3072] gelu_1
float[batch,77,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,77,3072] gelu_2
float[batch,77,3072] gelu_3
float[batch,77,3072] gelu_4
float[batch,77,3072] gelu_5
float[batch,77,3072] gelu_6
float[batch,77,3072] gelu_7
float[batch,77,3072] gelu_8
float[batch,77,3072] gelu_9
float[batch,77,768] layer_norm
float[batch,77,768] layer_norm_1
float[batch,77,768] layer_norm_10
float[batch,77,768] layer_norm_11
float[batch,77,768] layer_norm_12
float[batch,77,768] layer_norm_13
float[batch,77,768] layer_norm_14
float[batch,77,768] layer_norm_15
float[batch,77,768] layer_norm_16
float[batch,77,768] layer_norm_17
float[batch,77,768] layer_norm_18
float[batch,77,768] layer_norm_19
float[batch,77,768] layer_norm_2
float[batch,77,768] layer_norm_20
float[batch,77,768] layer_norm_21
float[batch,77,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,77,768] layer_norm_3
float[batch,77,768] layer_norm_4
float[batch,77,768] layer_norm_5
float[batch,77,768] layer_norm_6
float[batch,77,768] layer_norm_7
float[batch,77,768] layer_norm_8
float[batch,77,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,3072] linear_10
float[batch,77,768] linear_11
float[batch,77,3072] linear_14
float[batch,77,768] linear_15
float[batch,77,3072] linear_18
float[batch,77,768] linear_19
float[batch,77,3072] linear_2
float[batch,77,3072] linear_22
float[batch,77,768] linear_23
float[batch,77,3072] linear_26
float[batch,77,768] linear_27
float[batch,77,768] linear_3
float[batch,77,3072] linear_30
float[batch,77,768] linear_31
float[batch,77,3072] linear_34
float[batch,77,768] linear_35
float[batch,77,3072] linear_38
float[batch,77,768] linear_39
float[batch,77,3072] linear_42
float[batch,77,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,77,3072] linear_6
float[batch,77,768] linear_7
float[batch,768] matmul
float[batch,77,768] node_scaled_dot_product_attention_10_k
float[batch,77,768] node_scaled_dot_product_attention_10_out
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_q
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_v
float[batch,77,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_q
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_v
float[batch,77,768] node_scaled_dot_product_attention_1_k
float[batch,77,768] node_scaled_dot_product_attention_1_out
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_q
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_v
float[batch,77,768] node_scaled_dot_product_attention_2_k
float[batch,77,768] node_scaled_dot_product_attention_2_out
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_q
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_v
float[batch,77,768] node_scaled_dot_product_attention_3_k
float[batch,77,768] node_scaled_dot_product_attention_3_out
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_q
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_v
float[batch,77,768] node_scaled_dot_product_attention_4_k
float[batch,77,768] node_scaled_dot_product_attention_4_out
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_q
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_v
float[batch,77,768] node_scaled_dot_product_attention_5_k
float[batch,77,768] node_scaled_dot_product_attention_5_out
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_q
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_v
float[batch,77,768] node_scaled_dot_product_attention_6_k
float[batch,77,768] node_scaled_dot_product_attention_6_out
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_q
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_v
float[batch,77,768] node_scaled_dot_product_attention_7_k
float[batch,77,768] node_scaled_dot_product_attention_7_out
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_q
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_v
float[batch,77,768] node_scaled_dot_product_attention_8_k
float[batch,77,768] node_scaled_dot_product_attention_8_out
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_q
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_v
float[batch,77,768] node_scaled_dot_product_attention_9_k
float[batch,77,768] node_scaled_dot_product_attention_9_out
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_q
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_v
float[batch,77,768] node_scaled_dot_product_attention_k
float[batch,77,768] node_scaled_dot_product_attention_out
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_q
float[batch,77,2304] node_scaled_dot_product_attention_qkv
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_v
float[batch,77,768] scaled_dot_product_attention
float[batch,77,768] scaled_dot_product_attention_1
float[batch,77,768] scaled_dot_product_attention_10
float[batch,77,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_11_pooled
float[batch,77,768] scaled_dot_product_attention_2
float[batch,77,768] scaled_dot_product_attention_3
float[batch,77,768] scaled_dot_product_attention_4
float[batch,77,768] scaled_dot_product_attention_5
float[batch,77,768] scaled_dot_product_attention_6
float[batch,77,768] scaled_dot_product_attention_7
float[batch,77,768] scaled_dot_product_attention_8
float[batch,77,768] scaled_dot_product_attention_9
float[batch,77,3072] val_39
float[batch,77,768] val_40
float[batch,77,3072] val_41
float[batch,77,768] val_42
float[batch,77,3072] val_43
float[batch,77,768] val_44
float[batch,77,3072] val_45
float[batch,77,768] val_46
float[batch,77,3072] val_47
float[batch,77,768] val_48
float[batch,77,3072] val_49
float[batch,77,768] val_50
float[batch,77,3072] val_51
float[batch,77,768] val_52
float[batch,77,3072] val_53
float[batch,77,768] val_54
float[batch,77,3072] val_55
float[batch,77,768] val_56
float[batch,77,3072] val_57
float[batch,77,768] val_58
float[batch,77,3072] val_59
float[batch,77,768] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,3072] val_63
float[batch,1,768] val_64
float[batch,1,768] val_65
float[batch,768] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
ln_final.bias FLOAT[768] 30c84addd7dc
ln_final.weight FLOAT[768] 936045b63db3
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] f5fd8960b58d
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] d2850462e0b9
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] cf9abbd271d1
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 5ded100b6e84
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 01024b85a06e
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 0b9acec4b2e6
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] cbca05b9d9fe
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 5e9ab0f91a45
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] 255febaa4d9c
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] df7ff8890f7c
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 099b6af4bf51
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 7c7e21a8f1d8
positional_embedding FLOAT[77,768] 74b83c21f924
text_projection FLOAT[768,768] a7db3e5b8230
token_embedding.weight_fp16 FLOAT16[49408,768] 3d31c5df8866
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] b9f289f968f2
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] eec5507eadfd
transformer.resblocks.0.ln_1.bias FLOAT[768] b45fd3874a2a
transformer.resblocks.0.ln_1.weight FLOAT[768] 22c2648b8f74
transformer.resblocks.0.ln_2.bias FLOAT[768] 7e8b79893c2b
transformer.resblocks.0.ln_2.weight FLOAT[768] 495854802ac1
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 7fb7cc86028b
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] 47072acf49d3
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] c4292cbf9071
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 66cbfe7fbf07
transformer.resblocks.1.ln_1.bias FLOAT[768] f4f4a2723d71
transformer.resblocks.1.ln_1.weight FLOAT[768] 8424b7d6f5bf
transformer.resblocks.1.ln_2.bias FLOAT[768] aaff5c96703b
transformer.resblocks.1.ln_2.weight FLOAT[768] 4e76bad46dc6
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 523c3986c9dc
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 49445537ffc6
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] e40baa6a8bf4
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 63894b912d6b
transformer.resblocks.10.ln_1.bias FLOAT[768] 41630195b37b
transformer.resblocks.10.ln_1.weight FLOAT[768] 91b4e4ec3f1d
transformer.resblocks.10.ln_2.bias FLOAT[768] e0d4ab114055
transformer.resblocks.10.ln_2.weight FLOAT[768] 7a05f33ac5cb
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] dc5a235cd23d
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] fca583582108
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 1238efe37956
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] be1c46be8acc
transformer.resblocks.11.ln_1.bias FLOAT[768] 703f1909a44d
transformer.resblocks.11.ln_1.weight FLOAT[768] 8da1a86af565
transformer.resblocks.11.ln_2.bias FLOAT[768] e58a4584244c
transformer.resblocks.11.ln_2.weight FLOAT[768] c8c745a0c9f5
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 1be83aabcafe
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 553ad2d09902
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 6b6f4c6df638
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 20673f00f48e
transformer.resblocks.2.ln_1.bias FLOAT[768] 40e06fbee78c
transformer.resblocks.2.ln_1.weight FLOAT[768] 6f7066ec3b3b
transformer.resblocks.2.ln_2.bias FLOAT[768] 90c95ea442f6
transformer.resblocks.2.ln_2.weight FLOAT[768] a8d464390483
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] b21eeb1a71df
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 94455c01cfe1
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 1ba57a07e715
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 7576149e51fd
transformer.resblocks.3.ln_1.bias FLOAT[768] 7a3fb3db1ae5
transformer.resblocks.3.ln_1.weight FLOAT[768] f4241418f2fc
transformer.resblocks.3.ln_2.bias FLOAT[768] 21d4f7b01d7b
transformer.resblocks.3.ln_2.weight FLOAT[768] 73adb99b0cb9
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 2ee327bc099a
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] cffb52185a45
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 3a4b4cc4b235
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 3ae63fc9bdb5
transformer.resblocks.4.ln_1.bias FLOAT[768] 060e3d8bad0a
transformer.resblocks.4.ln_1.weight FLOAT[768] d1bf33fb4c76
transformer.resblocks.4.ln_2.bias FLOAT[768] 172d7f3c8751
transformer.resblocks.4.ln_2.weight FLOAT[768] 6a7a96a9decb
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 3c8fc61589c9
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 9d7c390f4ea7
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 6a524b933a36
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] 5a9161bb9533
transformer.resblocks.5.ln_1.bias FLOAT[768] 1e9f698804d5
transformer.resblocks.5.ln_1.weight FLOAT[768] cd8563b08598
transformer.resblocks.5.ln_2.bias FLOAT[768] a21a662d5f19
transformer.resblocks.5.ln_2.weight FLOAT[768] 538a6ecd1318
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 4f858a93fd51
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] e15429213a03
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 4d72c77bf2ce
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] ea204f17e6af
transformer.resblocks.6.ln_1.bias FLOAT[768] bf9bb20f6aff
transformer.resblocks.6.ln_1.weight FLOAT[768] 6c5c44242938
transformer.resblocks.6.ln_2.bias FLOAT[768] 50a5b7c18b09
transformer.resblocks.6.ln_2.weight FLOAT[768] 0350b1dac9ed
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 581778bc039c
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 20a5d3fe5057
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] d9c5d4a06613
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] eba146c26b8e
transformer.resblocks.7.ln_1.bias FLOAT[768] d01a759ba3c9
transformer.resblocks.7.ln_1.weight FLOAT[768] 345cad3a1265
transformer.resblocks.7.ln_2.bias FLOAT[768] 0cb9356c26e0
transformer.resblocks.7.ln_2.weight FLOAT[768] 1f3e48680af5
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] b9f87c33200a
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 3b835d2fcd8d
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 1acad7b55635
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 4b085c47eef1
transformer.resblocks.8.ln_1.bias FLOAT[768] d8224267ae98
transformer.resblocks.8.ln_1.weight FLOAT[768] 3f8d1bde3aca
transformer.resblocks.8.ln_2.bias FLOAT[768] 34a72cb44854
transformer.resblocks.8.ln_2.weight FLOAT[768] b0bba471fd51
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] de3f9d47f5e1
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] f0d003f5a94b
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 06518f1cd334
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] a2b63fcbf47c
transformer.resblocks.9.ln_1.bias FLOAT[768] 6b9df3388ffd
transformer.resblocks.9.ln_1.weight FLOAT[768] 9ad39b8a7f34
transformer.resblocks.9.ln_2.bias FLOAT[768] 186dbcc9e4a5
transformer.resblocks.9.ln_2.weight FLOAT[768] 32f052b29716
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] f500198e6370
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] bcd96cc7e6d7
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[3072,768] fe54acea429e
val_11 FLOAT[768,2304] 85c524a38422
val_12 FLOAT[768,3072] d120faa20a20
val_13 FLOAT[3072,768] 0d4d1d8f8c71
val_14 FLOAT[768,2304] f7ffbcce3ddb
val_15 FLOAT[768,3072] d42495f58759
val_16 FLOAT[3072,768] da4ffce089c3
val_17 FLOAT[768,2304] f474e1ca7890
val_18 FLOAT[768,3072] 027be79020cc
val_19 FLOAT[3072,768] cd351eabc99a
val_2 FLOAT[768,2304] ef3fc6c030dd
val_20 FLOAT[768,2304] 78ac4dae395f
val_21 FLOAT[768,3072] fa8bdfc3ab03
val_22 FLOAT[3072,768] cb2f4f19a369
val_23 FLOAT[768,2304] 7e17490b88ad
val_24 FLOAT[768,3072] a9ad1504f0e6
val_25 FLOAT[3072,768] 2b45215f725a
val_26 FLOAT[768,2304] 1693aed3a079
val_27 FLOAT[768,3072] 9eafdba7fffb
val_28 FLOAT[3072,768] 0b67022b1be6
val_29 FLOAT[768,2304] 79e2aee8a0e3
val_3 FLOAT[768,3072] a1071d1a17e6
val_30 FLOAT[768,3072] 589df4467fa2
val_31 FLOAT[3072,768] 4c5cf2b0cb96
val_32 FLOAT[768,2304] 750976e22af0
val_33 FLOAT[768,3072] 0d36a45752e0
val_34 FLOAT[3072,768] 6cf5730bec22
val_35 FLOAT[768,2304] 980d2d2dfb0a
val_36 FLOAT[768,3072] 1cc3aafe5324
val_37 FLOAT[3072,768] 0b5906653ce2
val_4 FLOAT[3072,768] 353c9f24e275
val_5 FLOAT[768,2304] 59b703214a17
val_6 FLOAT[768,3072] 4eae32e1c5f7
val_7 FLOAT[3072,768] 933d793850fd
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[768,2304] f265bfe82714
val_9 FLOAT[768,3072] 07e033a582be
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,576 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
<
float[batch,77,768] add_1071
float[batch,77,768] add_1092
float[batch,77,768] add_119
float[batch,77,768] add_1207
float[batch,77,768] add_1228
float[batch,77,768] add_1343
float[batch,77,768] add_1364
float[batch,77,768] add_140
float[batch,77,768] add_1479
float[batch,77,768] add_1500
float[batch,1,768] add_1500_pooled
float[batch,1,768] add_1615
float[batch,1,768] add_1636
float[batch,77,768] add_255
float[batch,77,768] add_276
float[batch,77,768] add_391
float[batch,77,768] add_4
float[batch,77,768] add_412
float[batch,77,768] add_527
float[batch,77,768] add_548
float[batch,77,768] add_663
float[batch,77,768] add_684
float[batch,77,768] add_799
float[batch,77,768] add_820
float[batch,77,768] add_935
float[batch,77,768] add_956
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,768] embedding
float[batch,77,3072] gelu
float[batch,77,3072] gelu_1
float[batch,77,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,77,3072] gelu_2
float[batch,77,3072] gelu_3
float[batch,77,3072] gelu_4
float[batch,77,3072] gelu_5
float[batch,77,3072] gelu_6
float[batch,77,3072] gelu_7
float[batch,77,3072] gelu_8
float[batch,77,3072] gelu_9
float[batch,77,768] layer_norm
float[batch,77,768] layer_norm_1
float[batch,77,768] layer_norm_10
float[batch,77,768] layer_norm_11
float[batch,77,768] layer_norm_12
float[batch,77,768] layer_norm_13
float[batch,77,768] layer_norm_14
float[batch,77,768] layer_norm_15
float[batch,77,768] layer_norm_16
float[batch,77,768] layer_norm_17
float[batch,77,768] layer_norm_18
float[batch,77,768] layer_norm_19
float[batch,77,768] layer_norm_2
float[batch,77,768] layer_norm_20
float[batch,77,768] layer_norm_21
float[batch,77,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,77,768] layer_norm_3
float[batch,77,768] layer_norm_4
float[batch,77,768] layer_norm_5
float[batch,77,768] layer_norm_6
float[batch,77,768] layer_norm_7
float[batch,77,768] layer_norm_8
float[batch,77,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,3072] linear_10
float[batch,77,768] linear_11
float[batch,77,3072] linear_14
float[batch,77,768] linear_15
float[batch,77,3072] linear_18
float[batch,77,768] linear_19
float[batch,77,3072] linear_2
float[batch,77,3072] linear_22
float[batch,77,768] linear_23
float[batch,77,3072] linear_26
float[batch,77,768] linear_27
float[batch,77,768] linear_3
float[batch,77,3072] linear_30
float[batch,77,768] linear_31
float[batch,77,3072] linear_34
float[batch,77,768] linear_35
float[batch,77,3072] linear_38
float[batch,77,768] linear_39
float[batch,77,3072] linear_42
float[batch,77,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,77,3072] linear_6
float[batch,77,768] linear_7
float[batch,768] matmul
float[batch,77,768] node_scaled_dot_product_attention_10_k
float[batch,77,768] node_scaled_dot_product_attention_10_out
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_q
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_v
float[batch,77,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_q
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_v
float[batch,77,768] node_scaled_dot_product_attention_1_k
float[batch,77,768] node_scaled_dot_product_attention_1_out
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_q
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_v
float[batch,77,768] node_scaled_dot_product_attention_2_k
float[batch,77,768] node_scaled_dot_product_attention_2_out
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_q
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_v
float[batch,77,768] node_scaled_dot_product_attention_3_k
float[batch,77,768] node_scaled_dot_product_attention_3_out
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_q
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_v
float[batch,77,768] node_scaled_dot_product_attention_4_k
float[batch,77,768] node_scaled_dot_product_attention_4_out
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_q
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_v
float[batch,77,768] node_scaled_dot_product_attention_5_k
float[batch,77,768] node_scaled_dot_product_attention_5_out
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_q
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_v
float[batch,77,768] node_scaled_dot_product_attention_6_k
float[batch,77,768] node_scaled_dot_product_attention_6_out
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_q
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_v
float[batch,77,768] node_scaled_dot_product_attention_7_k
float[batch,77,768] node_scaled_dot_product_attention_7_out
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_q
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_v
float[batch,77,768] node_scaled_dot_product_attention_8_k
float[batch,77,768] node_scaled_dot_product_attention_8_out
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_q
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_v
float[batch,77,768] node_scaled_dot_product_attention_9_k
float[batch,77,768] node_scaled_dot_product_attention_9_out
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_q
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_v
float[batch,77,768] node_scaled_dot_product_attention_k
float[batch,77,768] node_scaled_dot_product_attention_out
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_q
float[batch,77,2304] node_scaled_dot_product_attention_qkv
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_v
float[batch,77,768] scaled_dot_product_attention
float[batch,77,768] scaled_dot_product_attention_1
float[batch,77,768] scaled_dot_product_attention_10
float[batch,77,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_11_pooled
float[batch,77,768] scaled_dot_product_attention_2
float[batch,77,768] scaled_dot_product_attention_3
float[batch,77,768] scaled_dot_product_attention_4
float[batch,77,768] scaled_dot_product_attention_5
float[batch,77,768] scaled_dot_product_attention_6
float[batch,77,768] scaled_dot_product_attention_7
float[batch,77,768] scaled_dot_product_attention_8
float[batch,77,768] scaled_dot_product_attention_9
float[batch,77,3072] val_39
float[batch,77,768] val_40
float[batch,77,3072] val_41
float[batch,77,768] val_42
float[batch,77,3072] val_43
float[batch,77,768] val_44
float[batch,77,3072] val_45
float[batch,77,768] val_46
float[batch,77,3072] val_47
float[batch,77,768] val_48
float[batch,77,3072] val_49
float[batch,77,768] val_50
float[batch,77,3072] val_51
float[batch,77,768] val_52
float[batch,77,3072] val_53
float[batch,77,768] val_54
float[batch,77,3072] val_55
float[batch,77,768] val_56
float[batch,77,3072] val_57
float[batch,77,768] val_58
float[batch,77,3072] val_59
float[batch,77,768] val_60
float[batch,77] val_61
float[batch,1,77] val_62
float[batch,1,3072] val_63
float[batch,1,768] val_64
float[batch,1,768] val_65
float[batch,768] val_66
>
{
val_38 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_38)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_2)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_39 = MatMul (layer_norm_1, val_3)
linear_2 = Add (val_39, "transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_40 = MatMul (gelu, val_4)
linear_3 = Add (val_40, "transformer.resblocks.0.mlp.c_proj.bias")
add_140 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_140, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_5)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_255 = Add (add_140, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_255, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_41 = MatMul (layer_norm_3, val_6)
linear_6 = Add (val_41, "transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_42 = MatMul (gelu_1, val_7)
linear_7 = Add (val_42, "transformer.resblocks.1.mlp.c_proj.bias")
add_276 = Add (add_255, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_276, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_8)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_391 = Add (add_276, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_391, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_43 = MatMul (layer_norm_5, val_9)
linear_10 = Add (val_43, "transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_44 = MatMul (gelu_2, val_10)
linear_11 = Add (val_44, "transformer.resblocks.2.mlp.c_proj.bias")
add_412 = Add (add_391, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_412, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_11)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_527 = Add (add_412, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_527, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_45 = MatMul (layer_norm_7, val_12)
linear_14 = Add (val_45, "transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_46 = MatMul (gelu_3, val_13)
linear_15 = Add (val_46, "transformer.resblocks.3.mlp.c_proj.bias")
add_548 = Add (add_527, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_548, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_14)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_663 = Add (add_548, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_663, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_47 = MatMul (layer_norm_9, val_15)
linear_18 = Add (val_47, "transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_48 = MatMul (gelu_4, val_16)
linear_19 = Add (val_48, "transformer.resblocks.4.mlp.c_proj.bias")
add_684 = Add (add_663, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_684, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_17)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_799 = Add (add_684, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_799, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_49 = MatMul (layer_norm_11, val_18)
linear_22 = Add (val_49, "transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_50 = MatMul (gelu_5, val_19)
linear_23 = Add (val_50, "transformer.resblocks.5.mlp.c_proj.bias")
add_820 = Add (add_799, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_820, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_20)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_935 = Add (add_820, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_935, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_51 = MatMul (layer_norm_13, val_21)
linear_26 = Add (val_51, "transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_52 = MatMul (gelu_6, val_22)
linear_27 = Add (val_52, "transformer.resblocks.6.mlp.c_proj.bias")
add_956 = Add (add_935, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_956, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_23)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1071 = Add (add_956, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1071, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_53 = MatMul (layer_norm_15, val_24)
linear_30 = Add (val_53, "transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_54 = MatMul (gelu_7, val_25)
linear_31 = Add (val_54, "transformer.resblocks.7.mlp.c_proj.bias")
add_1092 = Add (add_1071, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1092, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_26)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1207 = Add (add_1092, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1207, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_55 = MatMul (layer_norm_17, val_27)
linear_34 = Add (val_55, "transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_56 = MatMul (gelu_8, val_28)
linear_35 = Add (val_56, "transformer.resblocks.8.mlp.c_proj.bias")
add_1228 = Add (add_1207, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1228, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_29)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1343 = Add (add_1228, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1343, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_57 = MatMul (layer_norm_19, val_30)
linear_38 = Add (val_57, "transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_58 = MatMul (gelu_9, val_31)
linear_39 = Add (val_58, "transformer.resblocks.9.mlp.c_proj.bias")
add_1364 = Add (add_1343, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1364, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_32)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1479 = Add (add_1364, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1479, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_59 = MatMul (layer_norm_21, val_33)
linear_42 = Add (val_59, "transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_60 = MatMul (gelu_10, val_34)
linear_43 = Add (val_60, "transformer.resblocks.10.mlp.c_proj.bias")
add_1500 = Add (add_1479, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1500, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_35)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_61 = Gather <axis: int = 0> (val_755_eye, argmax)
val_62 = Unsqueeze (val_61, val_755_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_62, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1500] add_1500_pooled = MatMul (val_62, add_1500)
add_1615 = Add (add_1500_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1615, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_63 = MatMul (layer_norm_23, val_36)
linear_46 = Add (val_63, "transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_64 = MatMul (gelu_11, val_37)
linear_47 = Add (val_64, "transformer.resblocks.11.mlp.c_proj.bias")
add_1636 = Add (add_1615, linear_47)
val_65 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1636, "ln_final.weight", "ln_final.bias")
val_66 = Squeeze (val_65, val_755_axes1)
[node_matmul] matmul = MatMul (val_66, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
ln_final.bias FLOAT[768] c992ab0ecfd9
ln_final.weight FLOAT[768] 73dbda688f86
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 469afc6ab45c
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] d05855ab4a88
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] f1ee379183ef
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 1e321e1fbd84
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] 09e78c9562c2
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] b45c38a2a752
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 3f023d1a10ce
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 4ecd1fb339ba
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] b933621f3d77
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 71526d157cb3
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] 8156ac0dcc1e
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 09b1fc6a299b
positional_embedding FLOAT[77,768] c03105daaff7
text_projection FLOAT[768,768] 2c54309eab91
token_embedding.weight_fp16 FLOAT16[49408,768] e0d27b0a1d13
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 6855c3dfa318
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 78d610b759c1
transformer.resblocks.0.ln_1.bias FLOAT[768] 67e41d2b625c
transformer.resblocks.0.ln_1.weight FLOAT[768] b556a1a54d2b
transformer.resblocks.0.ln_2.bias FLOAT[768] 065a5f3fe1c7
transformer.resblocks.0.ln_2.weight FLOAT[768] 1bc58241463a
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] 9ef411daf65f
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] d367b8b9cb54
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] ad3cee41e51e
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] ee9947b47605
transformer.resblocks.1.ln_1.bias FLOAT[768] 9a124af632f4
transformer.resblocks.1.ln_1.weight FLOAT[768] 40513d916c8c
transformer.resblocks.1.ln_2.bias FLOAT[768] a99e658dab12
transformer.resblocks.1.ln_2.weight FLOAT[768] c638a11ff7c7
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 6ce6bc19129d
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 9625b388f4e5
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] dd95a0354164
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] a158022f8285
transformer.resblocks.10.ln_1.bias FLOAT[768] a69051803658
transformer.resblocks.10.ln_1.weight FLOAT[768] 9144dc4ef1c0
transformer.resblocks.10.ln_2.bias FLOAT[768] a8bf79324e5a
transformer.resblocks.10.ln_2.weight FLOAT[768] 28685f36e318
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] a74defa9f8c9
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] a71172ae51ae
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 5614e9e9d977
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 54e2e76228de
transformer.resblocks.11.ln_1.bias FLOAT[768] a17b9b500c10
transformer.resblocks.11.ln_1.weight FLOAT[768] 16cf2c2555d4
transformer.resblocks.11.ln_2.bias FLOAT[768] 2e3e2967f957
transformer.resblocks.11.ln_2.weight FLOAT[768] 031a1e1c3791
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 1677dd278c15
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 422cf251d973
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] b11873fa6768
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] c31fd7ac8335
transformer.resblocks.2.ln_1.bias FLOAT[768] f1eabf1c4dbc
transformer.resblocks.2.ln_1.weight FLOAT[768] 95620c90d0e3
transformer.resblocks.2.ln_2.bias FLOAT[768] abec62d14e15
transformer.resblocks.2.ln_2.weight FLOAT[768] b15802262242
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 3283da4371a3
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 065d589bca3a
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] de0035461e4c
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] e861d0361087
transformer.resblocks.3.ln_1.bias FLOAT[768] c445226b4302
transformer.resblocks.3.ln_1.weight FLOAT[768] e74f52aacfcb
transformer.resblocks.3.ln_2.bias FLOAT[768] 1a5f10caf1b2
transformer.resblocks.3.ln_2.weight FLOAT[768] 9e357533f484
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] e9bb2581da77
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 4d5e14684444
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] c06752712c7a
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 7b03fbe9bfb6
transformer.resblocks.4.ln_1.bias FLOAT[768] 0fe043439405
transformer.resblocks.4.ln_1.weight FLOAT[768] ec5dcc004f30
transformer.resblocks.4.ln_2.bias FLOAT[768] bca4169b1c13
transformer.resblocks.4.ln_2.weight FLOAT[768] 7cf7b34911ed
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] ce2da17bc2d4
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 87052e2e3d2e
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 8b1190b24a4f
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] e5ea56efdd32
transformer.resblocks.5.ln_1.bias FLOAT[768] 42bbd9975a3c
transformer.resblocks.5.ln_1.weight FLOAT[768] e159cc022636
transformer.resblocks.5.ln_2.bias FLOAT[768] b18f11ee7cd4
transformer.resblocks.5.ln_2.weight FLOAT[768] 9f0043035f80
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 0c4c502c5191
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 8780c0c7c927
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 37c1d41e1b4b
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 3aa25ef1a7dd
transformer.resblocks.6.ln_1.bias FLOAT[768] 8ff2bea068b3
transformer.resblocks.6.ln_1.weight FLOAT[768] 1666f8d84bfb
transformer.resblocks.6.ln_2.bias FLOAT[768] da9c0db8c914
transformer.resblocks.6.ln_2.weight FLOAT[768] 4e76d667c03d
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 6cbc67b46cef
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] 548f1a24e3aa
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 1f8dbcb4fd2b
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 247afea3fa9d
transformer.resblocks.7.ln_1.bias FLOAT[768] 8177ee4ed31a
transformer.resblocks.7.ln_1.weight FLOAT[768] 488dfc6cde5c
transformer.resblocks.7.ln_2.bias FLOAT[768] 9d3db40dd540
transformer.resblocks.7.ln_2.weight FLOAT[768] e9bf49d2da71
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 84dfa6fe5229
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 5a7791739a04
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 21e5df6eaebd
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 5a10ea1e45e9
transformer.resblocks.8.ln_1.bias FLOAT[768] f8f0b0679331
transformer.resblocks.8.ln_1.weight FLOAT[768] 81dee3ee1240
transformer.resblocks.8.ln_2.bias FLOAT[768] ccf641f6159a
transformer.resblocks.8.ln_2.weight FLOAT[768] b249eca4d932
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] cfdcc49e57f8
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 9d3931e06d68
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] a2f183e31740
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] be9c5f822d76
transformer.resblocks.9.ln_1.bias FLOAT[768] 1d3048486bd4
transformer.resblocks.9.ln_1.weight FLOAT[768] 48acd9d78206
transformer.resblocks.9.ln_2.bias FLOAT[768] cffb19d63eb5
transformer.resblocks.9.ln_2.weight FLOAT[768] 3439f03db054
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 29a4560aa2a6
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 9f8d237bbfda
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[3072,768] bd889606df80
val_11 FLOAT[768,2304] c47fb0aed52b
val_12 FLOAT[768,3072] 05b0978cbecc
val_13 FLOAT[3072,768] 5b2337332c71
val_14 FLOAT[768,2304] 967c45bb2c83
val_15 FLOAT[768,3072] c2235517f1e8
val_16 FLOAT[3072,768] 44d71f294426
val_17 FLOAT[768,2304] 231a24880193
val_18 FLOAT[768,3072] 04cd70b3e51d
val_19 FLOAT[3072,768] acd75af5bece
val_2 FLOAT[768,2304] 975a6dc893bc
val_20 FLOAT[768,2304] b9ce71a03908
val_21 FLOAT[768,3072] 9bf19abd96e2
val_22 FLOAT[3072,768] 948a7e6eea94
val_23 FLOAT[768,2304] 89a8ab390983
val_24 FLOAT[768,3072] 6934d030327f
val_25 FLOAT[3072,768] c3bc566d0960
val_26 FLOAT[768,2304] d720492ebba4
val_27 FLOAT[768,3072] 3e57b1fd1b19
val_28 FLOAT[3072,768] 40880a43afce
val_29 FLOAT[768,2304] 09d222e9bf49
val_3 FLOAT[768,3072] 9c88b9f60ba3
val_30 FLOAT[768,3072] 9201babad57c
val_31 FLOAT[3072,768] 9120aabd0903
val_32 FLOAT[768,2304] 829413f86370
val_33 FLOAT[768,3072] 3cb0704ebe22
val_34 FLOAT[3072,768] fa1873c11efe
val_35 FLOAT[768,2304] ff3d9f3ee14f
val_36 FLOAT[768,3072] d7e4ec7c29c4
val_37 FLOAT[3072,768] 029ca32c575b
val_4 FLOAT[3072,768] b55f76a56831
val_5 FLOAT[768,2304] 64fec1365790
val_6 FLOAT[768,3072] 3d96a1653380
val_7 FLOAT[3072,768] be075a4243fa
val_755_axes1 INT64[1] 7c9fa136d441
val_755_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[768,2304] 3e9ba3c9b156
val_9 FLOAT[768,3072] faadd8021d32
File diff suppressed because it is too large Load Diff
+625
View File
@@ -0,0 +1,625 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,768] text_embedding)
<
float[batch,77,768] add_1012
float[batch,77,768] add_1127
float[batch,77,768] add_1156
float[batch,77,768] add_119
float[batch,77,768] add_1271
float[batch,77,768] add_1300
float[batch,77,768] add_1415
float[batch,77,768] add_1444
float[batch,77,768] add_148
float[batch,77,768] add_1559
float[batch,77,768] add_1588
float[batch,1,768] add_1588_pooled
float[batch,1,768] add_1703
float[batch,1,768] add_1732
float[batch,77,768] add_263
float[batch,77,768] add_292
float[batch,77,768] add_4
float[batch,77,768] add_407
float[batch,77,768] add_436
float[batch,77,768] add_551
float[batch,77,768] add_580
float[batch,77,768] add_695
float[batch,77,768] add_724
float[batch,77,768] add_839
float[batch,77,768] add_868
float[batch,77,768] add_983
int64[batch] argmax
float[batch,1] clamp_min
float[batch,77,768] embedding
float[batch,77,768] layer_norm
float[batch,77,768] layer_norm_1
float[batch,77,768] layer_norm_10
float[batch,77,768] layer_norm_11
float[batch,77,768] layer_norm_12
float[batch,77,768] layer_norm_13
float[batch,77,768] layer_norm_14
float[batch,77,768] layer_norm_15
float[batch,77,768] layer_norm_16
float[batch,77,768] layer_norm_17
float[batch,77,768] layer_norm_18
float[batch,77,768] layer_norm_19
float[batch,77,768] layer_norm_2
float[batch,77,768] layer_norm_20
float[batch,77,768] layer_norm_21
float[batch,77,768] layer_norm_22
float[batch,1,768] layer_norm_23
float[batch,77,768] layer_norm_3
float[batch,77,768] layer_norm_4
float[batch,77,768] layer_norm_5
float[batch,77,768] layer_norm_6
float[batch,77,768] layer_norm_7
float[batch,77,768] layer_norm_8
float[batch,77,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,3072] linear_10
float[batch,77,768] linear_11
float[batch,77,3072] linear_14
float[batch,77,768] linear_15
float[batch,77,3072] linear_18
float[batch,77,768] linear_19
float[batch,77,3072] linear_2
float[batch,77,3072] linear_22
float[batch,77,768] linear_23
float[batch,77,3072] linear_26
float[batch,77,768] linear_27
float[batch,77,768] linear_3
float[batch,77,3072] linear_30
float[batch,77,768] linear_31
float[batch,77,3072] linear_34
float[batch,77,768] linear_35
float[batch,77,3072] linear_38
float[batch,77,768] linear_39
float[batch,77,3072] linear_42
float[batch,77,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,77,3072] linear_6
float[batch,77,768] linear_7
float[batch,768] matmul
float[batch,77,3072] mul_101
float[batch,77,3072] mul_106
float[batch,77,3072] mul_1064
float[batch,77,3072] mul_1069
float[batch,77,3072] mul_1171
float[batch,77,3072] mul_1176
float[batch,1,3072] mul_1278
float[batch,1,3072] mul_1283
float[batch,77,3072] mul_208
float[batch,77,3072] mul_213
float[batch,77,3072] mul_315
float[batch,77,3072] mul_320
float[batch,77,3072] mul_422
float[batch,77,3072] mul_427
float[batch,77,3072] mul_529
float[batch,77,3072] mul_534
float[batch,77,3072] mul_636
float[batch,77,3072] mul_641
float[batch,77,3072] mul_743
float[batch,77,3072] mul_748
float[batch,77,3072] mul_850
float[batch,77,3072] mul_855
float[batch,77,3072] mul_957
float[batch,77,3072] mul_962
float[batch,77,768] node_scaled_dot_product_attention_10_k
float[batch,77,768] node_scaled_dot_product_attention_10_out
float[batch,77,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_q
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv
float[batch,77,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_10_v
float[batch,77,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_q
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv
float[batch,77,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_11_v
float[batch,77,768] node_scaled_dot_product_attention_1_k
float[batch,77,768] node_scaled_dot_product_attention_1_out
float[batch,77,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_q
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv
float[batch,77,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_1_v
float[batch,77,768] node_scaled_dot_product_attention_2_k
float[batch,77,768] node_scaled_dot_product_attention_2_out
float[batch,77,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_q
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv
float[batch,77,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_2_v
float[batch,77,768] node_scaled_dot_product_attention_3_k
float[batch,77,768] node_scaled_dot_product_attention_3_out
float[batch,77,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_q
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv
float[batch,77,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_3_v
float[batch,77,768] node_scaled_dot_product_attention_4_k
float[batch,77,768] node_scaled_dot_product_attention_4_out
float[batch,77,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_q
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv
float[batch,77,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_4_v
float[batch,77,768] node_scaled_dot_product_attention_5_k
float[batch,77,768] node_scaled_dot_product_attention_5_out
float[batch,77,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_q
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv
float[batch,77,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_5_v
float[batch,77,768] node_scaled_dot_product_attention_6_k
float[batch,77,768] node_scaled_dot_product_attention_6_out
float[batch,77,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_q
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv
float[batch,77,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_6_v
float[batch,77,768] node_scaled_dot_product_attention_7_k
float[batch,77,768] node_scaled_dot_product_attention_7_out
float[batch,77,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_q
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv
float[batch,77,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_7_v
float[batch,77,768] node_scaled_dot_product_attention_8_k
float[batch,77,768] node_scaled_dot_product_attention_8_out
float[batch,77,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_q
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv
float[batch,77,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_8_v
float[batch,77,768] node_scaled_dot_product_attention_9_k
float[batch,77,768] node_scaled_dot_product_attention_9_out
float[batch,77,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_q
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv
float[batch,77,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_9_v
float[batch,77,768] node_scaled_dot_product_attention_k
float[batch,77,768] node_scaled_dot_product_attention_out
float[batch,77,768] node_scaled_dot_product_attention_out_mm_out
float[batch,77,768] node_scaled_dot_product_attention_q
float[batch,77,2304] node_scaled_dot_product_attention_qkv
float[batch,77,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,77,768] node_scaled_dot_product_attention_v
float[batch,77,768] scaled_dot_product_attention
float[batch,77,768] scaled_dot_product_attention_1
float[batch,77,768] scaled_dot_product_attention_10
float[batch,77,768] scaled_dot_product_attention_11
float[batch,1,768] scaled_dot_product_attention_11_pooled
float[batch,77,768] scaled_dot_product_attention_2
float[batch,77,768] scaled_dot_product_attention_3
float[batch,77,768] scaled_dot_product_attention_4
float[batch,77,768] scaled_dot_product_attention_5
float[batch,77,768] scaled_dot_product_attention_6
float[batch,77,768] scaled_dot_product_attention_7
float[batch,77,768] scaled_dot_product_attention_8
float[batch,77,768] scaled_dot_product_attention_9
float[batch,77,3072] sigmoid
float[batch,77,3072] sigmoid_1
float[batch,77,3072] sigmoid_10
float[batch,1,3072] sigmoid_11
float[batch,77,3072] sigmoid_2
float[batch,77,3072] sigmoid_3
float[batch,77,3072] sigmoid_4
float[batch,77,3072] sigmoid_5
float[batch,77,3072] sigmoid_6
float[batch,77,3072] sigmoid_7
float[batch,77,3072] sigmoid_8
float[batch,77,3072] sigmoid_9
float[batch,77,3072] val_40
float[batch,77,768] val_41
float[batch,77,3072] val_42
float[batch,77,768] val_43
float[batch,77,3072] val_44
float[batch,77,768] val_45
float[batch,77,3072] val_46
float[batch,77,768] val_47
float[batch,77,3072] val_48
float[batch,77,768] val_49
float[batch,77,3072] val_50
float[batch,77,768] val_51
float[batch,77,3072] val_52
float[batch,77,768] val_53
float[batch,77,3072] val_54
float[batch,77,768] val_55
float[batch,77,3072] val_56
float[batch,77,768] val_57
float[batch,77,3072] val_58
float[batch,77,768] val_59
float[batch,77,3072] val_60
float[batch,77,768] val_61
float[batch,77] val_62
float[batch,1,77] val_63
float[batch,1,3072] val_64
float[batch,1,768] val_65
float[batch,1,768] val_66
float[batch,768] val_67
>
{
val_39 = Gather <axis: int = 0> ("token_embedding.weight_fp16", text)
embedding = Cast <to: int = 1> (val_39)
add_4 = Add (embedding, positional_embedding)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_4, "transformer.resblocks.0.ln_1.weight", "transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm, val_3)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
scaled_dot_product_attention = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "transformer.resblocks.0.attn.out_proj.bias")
add_119 = Add (add_4, node_scaled_dot_product_attention_out)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_119, "transformer.resblocks.0.ln_2.weight", "transformer.resblocks.0.ln_2.bias")
val_40 = MatMul (layer_norm_1, val_4)
linear_2 = Add (val_40, "transformer.resblocks.0.mlp.c_fc.bias")
mul_101 = Mul (linear_2, val_2)
[node_sigmoid] sigmoid = Sigmoid (mul_101)
mul_106 = Mul (linear_2, sigmoid)
val_41 = MatMul (mul_106, val_5)
linear_3 = Add (val_41, "transformer.resblocks.0.mlp.c_proj.bias")
add_148 = Add (add_119, linear_3)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_148, "transformer.resblocks.1.ln_1.weight", "transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_2, val_6)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "transformer.resblocks.1.attn.out_proj.bias")
add_263 = Add (add_148, node_scaled_dot_product_attention_1_out)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_263, "transformer.resblocks.1.ln_2.weight", "transformer.resblocks.1.ln_2.bias")
val_42 = MatMul (layer_norm_3, val_7)
linear_6 = Add (val_42, "transformer.resblocks.1.mlp.c_fc.bias")
mul_208 = Mul (linear_6, val_2)
sigmoid_1 = Sigmoid (mul_208)
mul_213 = Mul (linear_6, sigmoid_1)
val_43 = MatMul (mul_213, val_8)
linear_7 = Add (val_43, "transformer.resblocks.1.mlp.c_proj.bias")
add_292 = Add (add_263, linear_7)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_292, "transformer.resblocks.2.ln_1.weight", "transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_4, val_9)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "transformer.resblocks.2.attn.out_proj.bias")
add_407 = Add (add_292, node_scaled_dot_product_attention_2_out)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_407, "transformer.resblocks.2.ln_2.weight", "transformer.resblocks.2.ln_2.bias")
val_44 = MatMul (layer_norm_5, val_10)
linear_10 = Add (val_44, "transformer.resblocks.2.mlp.c_fc.bias")
mul_315 = Mul (linear_10, val_2)
sigmoid_2 = Sigmoid (mul_315)
mul_320 = Mul (linear_10, sigmoid_2)
val_45 = MatMul (mul_320, val_11)
linear_11 = Add (val_45, "transformer.resblocks.2.mlp.c_proj.bias")
add_436 = Add (add_407, linear_11)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_436, "transformer.resblocks.3.ln_1.weight", "transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_6, val_12)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "transformer.resblocks.3.attn.out_proj.bias")
add_551 = Add (add_436, node_scaled_dot_product_attention_3_out)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_551, "transformer.resblocks.3.ln_2.weight", "transformer.resblocks.3.ln_2.bias")
val_46 = MatMul (layer_norm_7, val_13)
linear_14 = Add (val_46, "transformer.resblocks.3.mlp.c_fc.bias")
mul_422 = Mul (linear_14, val_2)
sigmoid_3 = Sigmoid (mul_422)
mul_427 = Mul (linear_14, sigmoid_3)
val_47 = MatMul (mul_427, val_14)
linear_15 = Add (val_47, "transformer.resblocks.3.mlp.c_proj.bias")
add_580 = Add (add_551, linear_15)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_580, "transformer.resblocks.4.ln_1.weight", "transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_8, val_15)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "transformer.resblocks.4.attn.out_proj.bias")
add_695 = Add (add_580, node_scaled_dot_product_attention_4_out)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_695, "transformer.resblocks.4.ln_2.weight", "transformer.resblocks.4.ln_2.bias")
val_48 = MatMul (layer_norm_9, val_16)
linear_18 = Add (val_48, "transformer.resblocks.4.mlp.c_fc.bias")
mul_529 = Mul (linear_18, val_2)
sigmoid_4 = Sigmoid (mul_529)
mul_534 = Mul (linear_18, sigmoid_4)
val_49 = MatMul (mul_534, val_17)
linear_19 = Add (val_49, "transformer.resblocks.4.mlp.c_proj.bias")
add_724 = Add (add_695, linear_19)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_724, "transformer.resblocks.5.ln_1.weight", "transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_10, val_18)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "transformer.resblocks.5.attn.out_proj.bias")
add_839 = Add (add_724, node_scaled_dot_product_attention_5_out)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_839, "transformer.resblocks.5.ln_2.weight", "transformer.resblocks.5.ln_2.bias")
val_50 = MatMul (layer_norm_11, val_19)
linear_22 = Add (val_50, "transformer.resblocks.5.mlp.c_fc.bias")
mul_636 = Mul (linear_22, val_2)
sigmoid_5 = Sigmoid (mul_636)
mul_641 = Mul (linear_22, sigmoid_5)
val_51 = MatMul (mul_641, val_20)
linear_23 = Add (val_51, "transformer.resblocks.5.mlp.c_proj.bias")
add_868 = Add (add_839, linear_23)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_868, "transformer.resblocks.6.ln_1.weight", "transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_12, val_21)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "transformer.resblocks.6.attn.out_proj.bias")
add_983 = Add (add_868, node_scaled_dot_product_attention_6_out)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_983, "transformer.resblocks.6.ln_2.weight", "transformer.resblocks.6.ln_2.bias")
val_52 = MatMul (layer_norm_13, val_22)
linear_26 = Add (val_52, "transformer.resblocks.6.mlp.c_fc.bias")
mul_743 = Mul (linear_26, val_2)
sigmoid_6 = Sigmoid (mul_743)
mul_748 = Mul (linear_26, sigmoid_6)
val_53 = MatMul (mul_748, val_23)
linear_27 = Add (val_53, "transformer.resblocks.6.mlp.c_proj.bias")
add_1012 = Add (add_983, linear_27)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1012, "transformer.resblocks.7.ln_1.weight", "transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_14, val_24)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "transformer.resblocks.7.attn.out_proj.bias")
add_1127 = Add (add_1012, node_scaled_dot_product_attention_7_out)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1127, "transformer.resblocks.7.ln_2.weight", "transformer.resblocks.7.ln_2.bias")
val_54 = MatMul (layer_norm_15, val_25)
linear_30 = Add (val_54, "transformer.resblocks.7.mlp.c_fc.bias")
mul_850 = Mul (linear_30, val_2)
sigmoid_7 = Sigmoid (mul_850)
mul_855 = Mul (linear_30, sigmoid_7)
val_55 = MatMul (mul_855, val_26)
linear_31 = Add (val_55, "transformer.resblocks.7.mlp.c_proj.bias")
add_1156 = Add (add_1127, linear_31)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1156, "transformer.resblocks.8.ln_1.weight", "transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_16, val_27)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "transformer.resblocks.8.attn.out_proj.bias")
add_1271 = Add (add_1156, node_scaled_dot_product_attention_8_out)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "transformer.resblocks.8.ln_2.weight", "transformer.resblocks.8.ln_2.bias")
val_56 = MatMul (layer_norm_17, val_28)
linear_34 = Add (val_56, "transformer.resblocks.8.mlp.c_fc.bias")
mul_957 = Mul (linear_34, val_2)
sigmoid_8 = Sigmoid (mul_957)
mul_962 = Mul (linear_34, sigmoid_8)
val_57 = MatMul (mul_962, val_29)
linear_35 = Add (val_57, "transformer.resblocks.8.mlp.c_proj.bias")
add_1300 = Add (add_1271, linear_35)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1300, "transformer.resblocks.9.ln_1.weight", "transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_18, val_30)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "transformer.resblocks.9.attn.out_proj.bias")
add_1415 = Add (add_1300, node_scaled_dot_product_attention_9_out)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1415, "transformer.resblocks.9.ln_2.weight", "transformer.resblocks.9.ln_2.bias")
val_58 = MatMul (layer_norm_19, val_31)
linear_38 = Add (val_58, "transformer.resblocks.9.mlp.c_fc.bias")
mul_1064 = Mul (linear_38, val_2)
sigmoid_9 = Sigmoid (mul_1064)
mul_1069 = Mul (linear_38, sigmoid_9)
val_59 = MatMul (mul_1069, val_32)
linear_39 = Add (val_59, "transformer.resblocks.9.mlp.c_proj.bias")
add_1444 = Add (add_1415, linear_39)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1444, "transformer.resblocks.10.ln_1.weight", "transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_20, val_33)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "transformer.resblocks.10.attn.out_proj.bias")
add_1559 = Add (add_1444, node_scaled_dot_product_attention_10_out)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1559, "transformer.resblocks.10.ln_2.weight", "transformer.resblocks.10.ln_2.bias")
val_60 = MatMul (layer_norm_21, val_34)
linear_42 = Add (val_60, "transformer.resblocks.10.mlp.c_fc.bias")
mul_1171 = Mul (linear_42, val_2)
sigmoid_10 = Sigmoid (mul_1171)
mul_1176 = Mul (linear_42, sigmoid_10)
val_61 = MatMul (mul_1176, val_35)
linear_43 = Add (val_61, "transformer.resblocks.10.mlp.c_proj.bias")
add_1588 = Add (add_1559, linear_43)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1588, "transformer.resblocks.11.ln_1.weight", "transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_22, val_36)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
scaled_dot_product_attention_11 = Attention <is_causal: int = 1, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_argmax] argmax = ArgMax <axis: int = -1, keepdims: int = 0, select_last_index: int = 0> (text)
val_62 = Gather <axis: int = 0> (val_756_eye, argmax)
val_63 = Unsqueeze (val_62, val_756_axes1)
[pool_hoist_scaled_dot_product_attention_11] scaled_dot_product_attention_11_pooled = MatMul (val_63, scaled_dot_product_attention_11)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11_pooled, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1588] add_1588_pooled = MatMul (val_63, add_1588)
add_1703 = Add (add_1588_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1703, "transformer.resblocks.11.ln_2.weight", "transformer.resblocks.11.ln_2.bias")
val_64 = MatMul (layer_norm_23, val_37)
linear_46 = Add (val_64, "transformer.resblocks.11.mlp.c_fc.bias")
mul_1278 = Mul (linear_46, val_2)
sigmoid_11 = Sigmoid (mul_1278)
mul_1283 = Mul (linear_46, sigmoid_11)
val_65 = MatMul (mul_1283, val_38)
linear_47 = Add (val_65, "transformer.resblocks.11.mlp.c_proj.bias")
add_1732 = Add (add_1703, linear_47)
val_66 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1732, "ln_final.weight", "ln_final.bias")
val_67 = Squeeze (val_66, val_756_axes1)
[node_matmul] matmul = MatMul (val_67, text_projection)
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] text_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
ln_final.bias FLOAT[768] 9514c9f523f8
ln_final.weight FLOAT[768] 33681282193e
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 75baae7446ed
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] 298b81180130
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] cabefbec3571
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 3117c2a1fc55
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] efa9439e7f02
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 88a1f6eb36f1
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] 1bb7adfd1861
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] fd1376a33623
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] e228c2e0bfa4
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 7d0ccbf31692
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] f580faeb3ca0
node_scaled_dot_product_attention_wo_t FLOAT[768,768] d4422487d4c5
positional_embedding FLOAT[77,768] 64e22dbaadab
text_projection FLOAT[768,768] 376795aec8e3
token_embedding.weight_fp16 FLOAT16[49408,768] 22e014e18663
transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 18c4fad94c2a
transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 08509f1e413b
transformer.resblocks.0.ln_1.bias FLOAT[768] cba83bc94d63
transformer.resblocks.0.ln_1.weight FLOAT[768] 422382fe6b8b
transformer.resblocks.0.ln_2.bias FLOAT[768] 876e1f27fa0b
transformer.resblocks.0.ln_2.weight FLOAT[768] a28f6d780614
transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] dfadb48284b6
transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] cafbccb9aed8
transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] ac7e249ad9a1
transformer.resblocks.1.attn.out_proj.bias FLOAT[768] e23a0038c236
transformer.resblocks.1.ln_1.bias FLOAT[768] 43b6d8e0cc08
transformer.resblocks.1.ln_1.weight FLOAT[768] ba5057fbc1d0
transformer.resblocks.1.ln_2.bias FLOAT[768] 7988972c2667
transformer.resblocks.1.ln_2.weight FLOAT[768] 84eabfee3037
transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] d490a3d9e3e2
transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 13e340ae8e89
transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 82aa4d0fddef
transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 96299a6ded25
transformer.resblocks.10.ln_1.bias FLOAT[768] 715287e5f097
transformer.resblocks.10.ln_1.weight FLOAT[768] 017494939fd9
transformer.resblocks.10.ln_2.bias FLOAT[768] 5feb4621c6b6
transformer.resblocks.10.ln_2.weight FLOAT[768] 518aae8d6c22
transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] cf7c15a7b895
transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] ac25ab04cce9
transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 856612fc43f1
transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 8265e3a0cb7d
transformer.resblocks.11.ln_1.bias FLOAT[768] 8d0222606851
transformer.resblocks.11.ln_1.weight FLOAT[768] ce26c628fa37
transformer.resblocks.11.ln_2.bias FLOAT[768] 13a2680e92e8
transformer.resblocks.11.ln_2.weight FLOAT[768] 5f6966b06e19
transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] e9d19c45bab3
transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] 973dd98fc2bc
transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] bd472ab10e19
transformer.resblocks.2.attn.out_proj.bias FLOAT[768] ca35433da677
transformer.resblocks.2.ln_1.bias FLOAT[768] 17eb2825417a
transformer.resblocks.2.ln_1.weight FLOAT[768] e9e7f873ee2d
transformer.resblocks.2.ln_2.bias FLOAT[768] c8fd735dbe38
transformer.resblocks.2.ln_2.weight FLOAT[768] 355fdfa1748e
transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 198271d5b8b6
transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 040bdb817443
transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 76555319ca05
transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 596801991576
transformer.resblocks.3.ln_1.bias FLOAT[768] c73c5aaceeb1
transformer.resblocks.3.ln_1.weight FLOAT[768] 848af1ebe7e9
transformer.resblocks.3.ln_2.bias FLOAT[768] fd7294b8af45
transformer.resblocks.3.ln_2.weight FLOAT[768] aebce7efe615
transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] 7de49b292d29
transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] ec65955fc74a
transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] 93ba27243ff1
transformer.resblocks.4.attn.out_proj.bias FLOAT[768] b0fcfad11f6c
transformer.resblocks.4.ln_1.bias FLOAT[768] f9572badf468
transformer.resblocks.4.ln_1.weight FLOAT[768] c6ba0f9543a8
transformer.resblocks.4.ln_2.bias FLOAT[768] dec20d901de2
transformer.resblocks.4.ln_2.weight FLOAT[768] f1ae74fe8528
transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] 7d6223495ffa
transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] b50e288f53eb
transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 8012ea8bb9c5
transformer.resblocks.5.attn.out_proj.bias FLOAT[768] a1eb28164d84
transformer.resblocks.5.ln_1.bias FLOAT[768] 128eb7f2f2b9
transformer.resblocks.5.ln_1.weight FLOAT[768] bf8ac8f00064
transformer.resblocks.5.ln_2.bias FLOAT[768] 74c185a289fd
transformer.resblocks.5.ln_2.weight FLOAT[768] 22a7f3a32aa6
transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] daebd19f8e91
transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 7be90b4e71b9
transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] 39e398b6c1cd
transformer.resblocks.6.attn.out_proj.bias FLOAT[768] a5f5a4dae244
transformer.resblocks.6.ln_1.bias FLOAT[768] 202a75590a3b
transformer.resblocks.6.ln_1.weight FLOAT[768] 5767e67c9424
transformer.resblocks.6.ln_2.bias FLOAT[768] 59da4c700780
transformer.resblocks.6.ln_2.weight FLOAT[768] 3d662cb0024a
transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 76450af5dda1
transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] cf249075d4ab
transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 83484c4741fd
transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 0dae26d2d2ee
transformer.resblocks.7.ln_1.bias FLOAT[768] 24d46b1d5bf6
transformer.resblocks.7.ln_1.weight FLOAT[768] 0e8bb0972c3f
transformer.resblocks.7.ln_2.bias FLOAT[768] 84764c2e4b8d
transformer.resblocks.7.ln_2.weight FLOAT[768] b3a153a27e7f
transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] d21bdf1f82a0
transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 41b259bd6b7e
transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] e38165bd8d84
transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 6641b845fd2a
transformer.resblocks.8.ln_1.bias FLOAT[768] 9b07afbb3560
transformer.resblocks.8.ln_1.weight FLOAT[768] a74c864e0f6c
transformer.resblocks.8.ln_2.bias FLOAT[768] 584b0ac2bf28
transformer.resblocks.8.ln_2.weight FLOAT[768] e21ddc4b9141
transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 97faa70339c0
transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] 800cc0fc6f3a
transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 72ab7a9d700f
transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 11d21bc1f16b
transformer.resblocks.9.ln_1.bias FLOAT[768] 117388cc95d1
transformer.resblocks.9.ln_1.weight FLOAT[768] f99aa0c10e2f
transformer.resblocks.9.ln_2.bias FLOAT[768] 0dec7e254a02
transformer.resblocks.9.ln_2.weight FLOAT[768] a4ee78bfe92f
transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 6a6e42260440
transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 1e144aad94d9
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] b6fd1a9cb959
val_11 FLOAT[3072,768] 3ce4497d2006
val_12 FLOAT[768,2304] bd6724191af9
val_13 FLOAT[768,3072] d29bc38f5f28
val_14 FLOAT[3072,768] c535bc946527
val_15 FLOAT[768,2304] 1d9a015535bd
val_16 FLOAT[768,3072] abf83ff24754
val_17 FLOAT[3072,768] 514fa40611bb
val_18 FLOAT[768,2304] 1d7736799a24
val_19 FLOAT[768,3072] 878df954577f
val_2 FLOAT[] c2e7ddfe3114
val_20 FLOAT[3072,768] 353c361bc846
val_21 FLOAT[768,2304] fd6343eecef8
val_22 FLOAT[768,3072] 3465efeb1e6a
val_23 FLOAT[3072,768] 03ce0f95a849
val_24 FLOAT[768,2304] 3d6e93bbecc4
val_25 FLOAT[768,3072] 4a52f8bb18a9
val_26 FLOAT[3072,768] a36b13133305
val_27 FLOAT[768,2304] 061b265b7252
val_28 FLOAT[768,3072] 1ac7c2ddfacf
val_29 FLOAT[3072,768] e55b45ae23ee
val_3 FLOAT[768,2304] bff7daac522d
val_30 FLOAT[768,2304] dfa3490918f8
val_31 FLOAT[768,3072] c3254177b30b
val_32 FLOAT[3072,768] b4fb4d7f5d86
val_33 FLOAT[768,2304] ab769f5aedc7
val_34 FLOAT[768,3072] 443bcdb546de
val_35 FLOAT[3072,768] 70f50e520fa7
val_36 FLOAT[768,2304] 8a467050bdd3
val_37 FLOAT[768,3072] 8f32a49b70d8
val_38 FLOAT[3072,768] 56a852384772
val_4 FLOAT[768,3072] 179ad662da28
val_5 FLOAT[3072,768] a9de1d3001ee
val_6 FLOAT[768,2304] 5dbbb74e4e50
val_7 FLOAT[768,3072] 0b8b4fe3d1c8
val_756_axes1 INT64[1] 7c9fa136d441
val_756_eye FLOAT[77,77] 39ccea14e08c
val_8 FLOAT[3072,768] 36d32cfbcb36
val_9 FLOAT[768,2304] 8a6f31b488f5
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,655 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (int32[batch,77] text) => (float[batch,512] text_embedding)
<
float[batch,77,768] add_1050
float[batch,77,768] add_1075
float[batch,77,768] add_1148
float[batch,77,768] add_1173
float[batch,77,768] add_1246
float[batch,77,768] add_1271
float[batch,77,768] add_168
float[batch,77,768] add_193
float[batch,77,768] add_266
float[batch,77,768] add_291
float[batch,77,768] add_364
float[batch,77,768] add_389
float[batch,77,768] add_46
float[batch,77,768] add_462
float[batch,77,768] add_487
float[batch,77,768] add_55
float[batch,77,768] add_560
float[batch,77,768] add_585
float[batch,77,768] add_658
float[batch,77,768] add_683
float[batch,77,768] add_756
float[batch,77,768] add_781
float[batch,77,768] add_854
float[batch,77,768] add_879
float[batch,77,768] add_952
float[batch,77,768] add_977
float[batch,1,1,77] bitwise_and_1_f
float[batch,1] clamp_min
float[batch,768] div
float[batch,77,768] embedding
float[batch,77,3072] gelu
float[batch,77,3072] gelu_1
float[batch,77,3072] gelu_10
float[batch,77,3072] gelu_11
float[batch,640] gelu_12
float[batch,77,3072] gelu_2
float[batch,77,3072] gelu_3
float[batch,77,3072] gelu_4
float[batch,77,3072] gelu_5
float[batch,77,3072] gelu_6
float[batch,77,3072] gelu_7
float[batch,77,3072] gelu_8
float[batch,77,3072] gelu_9
float[batch,77,768] layer_norm
float[batch,77,768] layer_norm_1
float[batch,77,768] layer_norm_10
float[batch,77,768] layer_norm_11
float[batch,77,768] layer_norm_12
float[batch,77,768] layer_norm_13
float[batch,77,768] layer_norm_14
float[batch,77,768] layer_norm_15
float[batch,77,768] layer_norm_16
float[batch,77,768] layer_norm_17
float[batch,77,768] layer_norm_18
float[batch,77,768] layer_norm_19
float[batch,77,768] layer_norm_2
float[batch,77,768] layer_norm_20
float[batch,77,768] layer_norm_21
float[batch,77,768] layer_norm_22
float[batch,77,768] layer_norm_23
float[batch,77,768] layer_norm_24
float[batch,77,768] layer_norm_3
float[batch,77,768] layer_norm_4
float[batch,77,768] layer_norm_5
float[batch,77,768] layer_norm_6
float[batch,77,768] layer_norm_7
float[batch,77,768] layer_norm_8
float[batch,77,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,77,768] linear
float[batch,77,768] linear_1
float[batch,77,3072] linear_10
float[batch,77,768] linear_11
float[batch,77,768] linear_12
float[batch,77,768] linear_13
float[batch,77,768] linear_15
float[batch,77,3072] linear_16
float[batch,77,768] linear_17
float[batch,77,768] linear_18
float[batch,77,768] linear_19
float[batch,77,768] linear_21
float[batch,77,3072] linear_22
float[batch,77,768] linear_23
float[batch,77,768] linear_24
float[batch,77,768] linear_25
float[batch,77,768] linear_27
float[batch,77,3072] linear_28
float[batch,77,768] linear_29
float[batch,77,768] linear_3
float[batch,77,768] linear_30
float[batch,77,768] linear_31
float[batch,77,768] linear_33
float[batch,77,3072] linear_34
float[batch,77,768] linear_35
float[batch,77,768] linear_36
float[batch,77,768] linear_37
float[batch,77,768] linear_39
float[batch,77,3072] linear_4
float[batch,77,3072] linear_40
float[batch,77,768] linear_41
float[batch,77,768] linear_42
float[batch,77,768] linear_43
float[batch,77,768] linear_45
float[batch,77,3072] linear_46
float[batch,77,768] linear_47
float[batch,77,768] linear_48
float[batch,77,768] linear_49
float[batch,77,768] linear_5
float[batch,77,768] linear_51
float[batch,77,3072] linear_52
float[batch,77,768] linear_53
float[batch,77,768] linear_54
float[batch,77,768] linear_55
float[batch,77,768] linear_57
float[batch,77,3072] linear_58
float[batch,77,768] linear_59
float[batch,77,768] linear_6
float[batch,77,768] linear_60
float[batch,77,768] linear_61
float[batch,77,768] linear_63
float[batch,77,3072] linear_64
float[batch,77,768] linear_65
float[batch,77,768] linear_66
float[batch,77,768] linear_67
float[batch,77,768] linear_69
float[batch,77,768] linear_7
float[batch,77,3072] linear_70
float[batch,77,768] linear_71
float[batch,640] linear_72
float[batch,512] linear_73
float[batch,77,768] linear_9
float[batch,77,768] mul_637
float[batch,77,768] scaled_dot_product_attention
float[batch,77,768] scaled_dot_product_attention_1
float[batch,77,768] scaled_dot_product_attention_10
float[batch,77,768] scaled_dot_product_attention_11
float[batch,77,768] scaled_dot_product_attention_2
float[batch,77,768] scaled_dot_product_attention_3
float[batch,77,768] scaled_dot_product_attention_4
float[batch,77,768] scaled_dot_product_attention_5
float[batch,77,768] scaled_dot_product_attention_6
float[batch,77,768] scaled_dot_product_attention_7
float[batch,77,768] scaled_dot_product_attention_8
float[batch,77,768] scaled_dot_product_attention_9
float[batch,768] sum_1
float[batch,1] sum_2_f
float[batch,77] text_keep
float[batch,77,1] unsqueeze_12_f
float[batch,77,768] val_100
float[batch,77,768] val_101
float[batch,77,768] val_102
float[batch,77,768] val_103
float[batch,77,3072] val_104
float[batch,77,768] val_105
float[batch,77,768] val_106
float[batch,77,768] val_107
float[batch,77,768] val_108
float[batch,77,768] val_109
float[batch,77,3072] val_110
float[batch,77,768] val_111
float[batch,77,768] val_112
float[batch,77,768] val_113
float[batch,77,768] val_114
float[batch,77,768] val_115
float[batch,77,3072] val_116
float[batch,77,768] val_117
float[batch,77,768] val_118
float[batch,77,768] val_119
float[batch,77,768] val_120
float[batch,77,768] val_121
float[batch,77,3072] val_122
float[batch,77,768] val_123
float[batch,77,768] val_124
float[batch,77,768] val_125
float[batch,77,768] val_126
float[batch,77,768] val_127
float[batch,77,3072] val_128
float[batch,77,768] val_129
float[batch,77,768] val_130
float[batch,77,768] val_131
float[batch,77,768] val_132
float[batch,77,768] val_133
float[batch,77,3072] val_134
float[batch,77,768] val_135
float[batch,77,768] val_136
float[batch,77,768] val_137
float[batch,77,768] val_138
float[batch,77,768] val_139
float[batch,77,3072] val_140
float[batch,77,768] val_141
float[batch,77,768] val_142
float[batch,77,768] val_143
float[batch,77,768] val_144
float[batch,77,768] val_145
float[batch,77,3072] val_146
float[batch,77,768] val_147
float[batch,1,1,77] val_52_f
float[batch,1,1,77] val_52_f_bias
float[batch,1,77,77] val_52_f_mask
float[batch,77,768] val_76
float[batch,77,768] val_77
float[batch,77,768] val_78
float[batch,77,768] val_79
float[batch,77,3072] val_80
float[batch,77,768] val_81
float[batch,77,768] val_82
float[batch,77,768] val_83
float[batch,77,768] val_84
float[batch,77,768] val_85
float[batch,77,3072] val_86
float[batch,77,768] val_87
float[batch,77,768] val_88
float[batch,77,768] val_89
float[batch,77,768] val_90
float[batch,77,768] val_91
float[batch,77,3072] val_92
float[batch,77,768] val_93
float[batch,77,768] val_94
float[batch,77,768] val_95
float[batch,77,768] val_96
float[batch,77,768] val_97
float[batch,77,3072] val_98
float[batch,77,768] val_99
>
{
val_75 = Gather <axis: int = 0> ("text.transformer.embeddings.word_embeddings.weight_fp16", text)
embedding = Cast <to: int = 1> (val_75)
add_46 = Add (embedding, embedding_1)
add_55 = Add (add_46, embedding_2)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_55, "text.transformer.embeddings.LayerNorm.weight", "text.transformer.embeddings.LayerNorm.bias")
val_76 = MatMul (layer_norm, val_3)
[node_linear] linear = Add (val_76, "text.transformer.encoder.layer.0.attention.self.query.bias")
val_77 = MatMul (layer_norm, val_4)
linear_1 = Add (val_77, "text.transformer.encoder.layer.0.attention.self.key.bias")
val_78 = MatMul (layer_norm, val_5)
[pad_keep] text_keep = Gather <axis: int = 0> (text_pad_keep, text)
[val_52_f] val_52_f = Unsqueeze (text_keep, text_row_axes)
[bitwise_and_1_f] bitwise_and_1_f = Sub (val_52_f, text_one)
val_52_f_bias = Mul (bitwise_and_1_f, text_scale)
val_52_f_mask = Add (val_52_f_bias, text_q_axis)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear, linear_1, val_78, val_52_f_mask)
val_79 = MatMul (scaled_dot_product_attention, val_6)
linear_3 = Add (val_79, "text.transformer.encoder.layer.0.attention.output.dense.bias")
add_168 = Add (linear_3, layer_norm)
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_168, "text.transformer.encoder.layer.0.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.0.attention.output.LayerNorm.bias")
val_80 = MatMul (layer_norm_1, val_7)
linear_4 = Add (val_80, "text.transformer.encoder.layer.0.intermediate.dense.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_4)
val_81 = MatMul (gelu, val_8)
linear_5 = Add (val_81, "text.transformer.encoder.layer.0.output.dense.bias")
add_193 = Add (linear_5, layer_norm_1)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_193, "text.transformer.encoder.layer.0.output.LayerNorm.weight", "text.transformer.encoder.layer.0.output.LayerNorm.bias")
val_82 = MatMul (layer_norm_2, val_9)
linear_6 = Add (val_82, "text.transformer.encoder.layer.1.attention.self.query.bias")
val_83 = MatMul (layer_norm_2, val_10)
linear_7 = Add (val_83, "text.transformer.encoder.layer.1.attention.self.key.bias")
val_84 = MatMul (layer_norm_2, val_11)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_6, linear_7, val_84, val_52_f_mask)
val_85 = MatMul (scaled_dot_product_attention_1, val_12)
linear_9 = Add (val_85, "text.transformer.encoder.layer.1.attention.output.dense.bias")
add_266 = Add (linear_9, layer_norm_2)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_266, "text.transformer.encoder.layer.1.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.1.attention.output.LayerNorm.bias")
val_86 = MatMul (layer_norm_3, val_13)
linear_10 = Add (val_86, "text.transformer.encoder.layer.1.intermediate.dense.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_10)
val_87 = MatMul (gelu_1, val_14)
linear_11 = Add (val_87, "text.transformer.encoder.layer.1.output.dense.bias")
add_291 = Add (linear_11, layer_norm_3)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_291, "text.transformer.encoder.layer.1.output.LayerNorm.weight", "text.transformer.encoder.layer.1.output.LayerNorm.bias")
val_88 = MatMul (layer_norm_4, val_15)
linear_12 = Add (val_88, "text.transformer.encoder.layer.2.attention.self.query.bias")
val_89 = MatMul (layer_norm_4, val_16)
linear_13 = Add (val_89, "text.transformer.encoder.layer.2.attention.self.key.bias")
val_90 = MatMul (layer_norm_4, val_17)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_12, linear_13, val_90, val_52_f_mask)
val_91 = MatMul (scaled_dot_product_attention_2, val_18)
linear_15 = Add (val_91, "text.transformer.encoder.layer.2.attention.output.dense.bias")
add_364 = Add (linear_15, layer_norm_4)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_364, "text.transformer.encoder.layer.2.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.2.attention.output.LayerNorm.bias")
val_92 = MatMul (layer_norm_5, val_19)
linear_16 = Add (val_92, "text.transformer.encoder.layer.2.intermediate.dense.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_16)
val_93 = MatMul (gelu_2, val_20)
linear_17 = Add (val_93, "text.transformer.encoder.layer.2.output.dense.bias")
add_389 = Add (linear_17, layer_norm_5)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_389, "text.transformer.encoder.layer.2.output.LayerNorm.weight", "text.transformer.encoder.layer.2.output.LayerNorm.bias")
val_94 = MatMul (layer_norm_6, val_21)
linear_18 = Add (val_94, "text.transformer.encoder.layer.3.attention.self.query.bias")
val_95 = MatMul (layer_norm_6, val_22)
linear_19 = Add (val_95, "text.transformer.encoder.layer.3.attention.self.key.bias")
val_96 = MatMul (layer_norm_6, val_23)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_18, linear_19, val_96, val_52_f_mask)
val_97 = MatMul (scaled_dot_product_attention_3, val_24)
linear_21 = Add (val_97, "text.transformer.encoder.layer.3.attention.output.dense.bias")
add_462 = Add (linear_21, layer_norm_6)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_462, "text.transformer.encoder.layer.3.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.3.attention.output.LayerNorm.bias")
val_98 = MatMul (layer_norm_7, val_25)
linear_22 = Add (val_98, "text.transformer.encoder.layer.3.intermediate.dense.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_22)
val_99 = MatMul (gelu_3, val_26)
linear_23 = Add (val_99, "text.transformer.encoder.layer.3.output.dense.bias")
add_487 = Add (linear_23, layer_norm_7)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_487, "text.transformer.encoder.layer.3.output.LayerNorm.weight", "text.transformer.encoder.layer.3.output.LayerNorm.bias")
val_100 = MatMul (layer_norm_8, val_27)
linear_24 = Add (val_100, "text.transformer.encoder.layer.4.attention.self.query.bias")
val_101 = MatMul (layer_norm_8, val_28)
linear_25 = Add (val_101, "text.transformer.encoder.layer.4.attention.self.key.bias")
val_102 = MatMul (layer_norm_8, val_29)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_24, linear_25, val_102, val_52_f_mask)
val_103 = MatMul (scaled_dot_product_attention_4, val_30)
linear_27 = Add (val_103, "text.transformer.encoder.layer.4.attention.output.dense.bias")
add_560 = Add (linear_27, layer_norm_8)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_560, "text.transformer.encoder.layer.4.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.4.attention.output.LayerNorm.bias")
val_104 = MatMul (layer_norm_9, val_31)
linear_28 = Add (val_104, "text.transformer.encoder.layer.4.intermediate.dense.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_28)
val_105 = MatMul (gelu_4, val_32)
linear_29 = Add (val_105, "text.transformer.encoder.layer.4.output.dense.bias")
add_585 = Add (linear_29, layer_norm_9)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_585, "text.transformer.encoder.layer.4.output.LayerNorm.weight", "text.transformer.encoder.layer.4.output.LayerNorm.bias")
val_106 = MatMul (layer_norm_10, val_33)
linear_30 = Add (val_106, "text.transformer.encoder.layer.5.attention.self.query.bias")
val_107 = MatMul (layer_norm_10, val_34)
linear_31 = Add (val_107, "text.transformer.encoder.layer.5.attention.self.key.bias")
val_108 = MatMul (layer_norm_10, val_35)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_30, linear_31, val_108, val_52_f_mask)
val_109 = MatMul (scaled_dot_product_attention_5, val_36)
linear_33 = Add (val_109, "text.transformer.encoder.layer.5.attention.output.dense.bias")
add_658 = Add (linear_33, layer_norm_10)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_658, "text.transformer.encoder.layer.5.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.5.attention.output.LayerNorm.bias")
val_110 = MatMul (layer_norm_11, val_37)
linear_34 = Add (val_110, "text.transformer.encoder.layer.5.intermediate.dense.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_34)
val_111 = MatMul (gelu_5, val_38)
linear_35 = Add (val_111, "text.transformer.encoder.layer.5.output.dense.bias")
add_683 = Add (linear_35, layer_norm_11)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_683, "text.transformer.encoder.layer.5.output.LayerNorm.weight", "text.transformer.encoder.layer.5.output.LayerNorm.bias")
val_112 = MatMul (layer_norm_12, val_39)
linear_36 = Add (val_112, "text.transformer.encoder.layer.6.attention.self.query.bias")
val_113 = MatMul (layer_norm_12, val_40)
linear_37 = Add (val_113, "text.transformer.encoder.layer.6.attention.self.key.bias")
val_114 = MatMul (layer_norm_12, val_41)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_36, linear_37, val_114, val_52_f_mask)
val_115 = MatMul (scaled_dot_product_attention_6, val_42)
linear_39 = Add (val_115, "text.transformer.encoder.layer.6.attention.output.dense.bias")
add_756 = Add (linear_39, layer_norm_12)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_756, "text.transformer.encoder.layer.6.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.6.attention.output.LayerNorm.bias")
val_116 = MatMul (layer_norm_13, val_43)
linear_40 = Add (val_116, "text.transformer.encoder.layer.6.intermediate.dense.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_40)
val_117 = MatMul (gelu_6, val_44)
linear_41 = Add (val_117, "text.transformer.encoder.layer.6.output.dense.bias")
add_781 = Add (linear_41, layer_norm_13)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_781, "text.transformer.encoder.layer.6.output.LayerNorm.weight", "text.transformer.encoder.layer.6.output.LayerNorm.bias")
val_118 = MatMul (layer_norm_14, val_45)
linear_42 = Add (val_118, "text.transformer.encoder.layer.7.attention.self.query.bias")
val_119 = MatMul (layer_norm_14, val_46)
linear_43 = Add (val_119, "text.transformer.encoder.layer.7.attention.self.key.bias")
val_120 = MatMul (layer_norm_14, val_47)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_42, linear_43, val_120, val_52_f_mask)
val_121 = MatMul (scaled_dot_product_attention_7, val_48)
linear_45 = Add (val_121, "text.transformer.encoder.layer.7.attention.output.dense.bias")
add_854 = Add (linear_45, layer_norm_14)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_854, "text.transformer.encoder.layer.7.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.7.attention.output.LayerNorm.bias")
val_122 = MatMul (layer_norm_15, val_49)
linear_46 = Add (val_122, "text.transformer.encoder.layer.7.intermediate.dense.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_46)
val_123 = MatMul (gelu_7, val_50)
linear_47 = Add (val_123, "text.transformer.encoder.layer.7.output.dense.bias")
add_879 = Add (linear_47, layer_norm_15)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_879, "text.transformer.encoder.layer.7.output.LayerNorm.weight", "text.transformer.encoder.layer.7.output.LayerNorm.bias")
val_124 = MatMul (layer_norm_16, val_51)
linear_48 = Add (val_124, "text.transformer.encoder.layer.8.attention.self.query.bias")
val_125 = MatMul (layer_norm_16, val_52)
linear_49 = Add (val_125, "text.transformer.encoder.layer.8.attention.self.key.bias")
val_126 = MatMul (layer_norm_16, val_53)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_48, linear_49, val_126, val_52_f_mask)
val_127 = MatMul (scaled_dot_product_attention_8, val_54)
linear_51 = Add (val_127, "text.transformer.encoder.layer.8.attention.output.dense.bias")
add_952 = Add (linear_51, layer_norm_16)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "text.transformer.encoder.layer.8.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.8.attention.output.LayerNorm.bias")
val_128 = MatMul (layer_norm_17, val_55)
linear_52 = Add (val_128, "text.transformer.encoder.layer.8.intermediate.dense.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_52)
val_129 = MatMul (gelu_8, val_56)
linear_53 = Add (val_129, "text.transformer.encoder.layer.8.output.dense.bias")
add_977 = Add (linear_53, layer_norm_17)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_977, "text.transformer.encoder.layer.8.output.LayerNorm.weight", "text.transformer.encoder.layer.8.output.LayerNorm.bias")
val_130 = MatMul (layer_norm_18, val_57)
linear_54 = Add (val_130, "text.transformer.encoder.layer.9.attention.self.query.bias")
val_131 = MatMul (layer_norm_18, val_58)
linear_55 = Add (val_131, "text.transformer.encoder.layer.9.attention.self.key.bias")
val_132 = MatMul (layer_norm_18, val_59)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_54, linear_55, val_132, val_52_f_mask)
val_133 = MatMul (scaled_dot_product_attention_9, val_60)
linear_57 = Add (val_133, "text.transformer.encoder.layer.9.attention.output.dense.bias")
add_1050 = Add (linear_57, layer_norm_18)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1050, "text.transformer.encoder.layer.9.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.9.attention.output.LayerNorm.bias")
val_134 = MatMul (layer_norm_19, val_61)
linear_58 = Add (val_134, "text.transformer.encoder.layer.9.intermediate.dense.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_58)
val_135 = MatMul (gelu_9, val_62)
linear_59 = Add (val_135, "text.transformer.encoder.layer.9.output.dense.bias")
add_1075 = Add (linear_59, layer_norm_19)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1075, "text.transformer.encoder.layer.9.output.LayerNorm.weight", "text.transformer.encoder.layer.9.output.LayerNorm.bias")
val_136 = MatMul (layer_norm_20, val_63)
linear_60 = Add (val_136, "text.transformer.encoder.layer.10.attention.self.query.bias")
val_137 = MatMul (layer_norm_20, val_64)
linear_61 = Add (val_137, "text.transformer.encoder.layer.10.attention.self.key.bias")
val_138 = MatMul (layer_norm_20, val_65)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_60, linear_61, val_138, val_52_f_mask)
val_139 = MatMul (scaled_dot_product_attention_10, val_66)
linear_63 = Add (val_139, "text.transformer.encoder.layer.10.attention.output.dense.bias")
add_1148 = Add (linear_63, layer_norm_20)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1148, "text.transformer.encoder.layer.10.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.10.attention.output.LayerNorm.bias")
val_140 = MatMul (layer_norm_21, val_67)
linear_64 = Add (val_140, "text.transformer.encoder.layer.10.intermediate.dense.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_64)
val_141 = MatMul (gelu_10, val_68)
linear_65 = Add (val_141, "text.transformer.encoder.layer.10.output.dense.bias")
add_1173 = Add (linear_65, layer_norm_21)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1173, "text.transformer.encoder.layer.10.output.LayerNorm.weight", "text.transformer.encoder.layer.10.output.LayerNorm.bias")
val_142 = MatMul (layer_norm_22, val_69)
linear_66 = Add (val_142, "text.transformer.encoder.layer.11.attention.self.query.bias")
val_143 = MatMul (layer_norm_22, val_70)
linear_67 = Add (val_143, "text.transformer.encoder.layer.11.attention.self.key.bias")
val_144 = MatMul (layer_norm_22, val_71)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, scale: float = 0.125, softcap: float = 0> (linear_66, linear_67, val_144, val_52_f_mask)
val_145 = MatMul (scaled_dot_product_attention_11, val_72)
linear_69 = Add (val_145, "text.transformer.encoder.layer.11.attention.output.dense.bias")
add_1246 = Add (linear_69, layer_norm_22)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1246, "text.transformer.encoder.layer.11.attention.output.LayerNorm.weight", "text.transformer.encoder.layer.11.attention.output.LayerNorm.bias")
val_146 = MatMul (layer_norm_23, val_73)
linear_70 = Add (val_146, "text.transformer.encoder.layer.11.intermediate.dense.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_70)
val_147 = MatMul (gelu_11, val_74)
linear_71 = Add (val_147, "text.transformer.encoder.layer.11.output.dense.bias")
add_1271 = Add (linear_71, layer_norm_23)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1271, "text.transformer.encoder.layer.11.output.LayerNorm.weight", "text.transformer.encoder.layer.11.output.LayerNorm.bias")
[unsqueeze_12_f] unsqueeze_12_f = Unsqueeze (text_keep, val_0)
mul_637 = Mul (layer_norm_24, unsqueeze_12_f)
sum_1 = ReduceSum <keepdims: int = 0, noop_with_empty_axes: int = 0> (mul_637, val_2)
[sum_2_f] sum_2_f = ReduceSum <keepdims: int = 1, noop_with_empty_axes: int = 0> (text_keep, val_0)
[node_div] div = Div (sum_1, sum_2_f)
linear_72 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (div, "text.proj.0.weight")
gelu_12 = Gelu <approximate: string = "none"> (linear_72)
linear_73 = Gemm <alpha: float = 1, beta: float = 1, transA: int = 0, transB: int = 1> (gelu_12, "text.proj.2.weight")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (linear_73, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
text_embedding = Div (linear_73, clamp_min)
}
weights:
embedding_1 FLOAT[1,1,768] 8d5002bda41b
embedding_2 FLOAT[1,77,768] 1b573ff43046
text.proj.0.weight FLOAT[640,768] cabe040773ae
text.proj.2.weight FLOAT[512,640] b8c96d7b7594
text.transformer.embeddings.LayerNorm.bias FLOAT[768] 7aa8493f5748
text.transformer.embeddings.LayerNorm.weight FLOAT[768] e3484ddfbe97
text.transformer.embeddings.word_embeddings.weight_fp16 FLOAT16[250002,768] ce7361b2bb3b
text.transformer.encoder.layer.0.attention.output.LayerNorm.bias FLOAT[768] 6c1f00023e78
text.transformer.encoder.layer.0.attention.output.LayerNorm.weight FLOAT[768] 3c49bb0f3c9d
text.transformer.encoder.layer.0.attention.output.dense.bias FLOAT[768] 7137778e0978
text.transformer.encoder.layer.0.attention.self.key.bias FLOAT[768] 4aab87f22564
text.transformer.encoder.layer.0.attention.self.query.bias FLOAT[768] a84445d8480a
text.transformer.encoder.layer.0.intermediate.dense.bias FLOAT[3072] 9da3e3649daf
text.transformer.encoder.layer.0.output.LayerNorm.bias FLOAT[768] cafae2962776
text.transformer.encoder.layer.0.output.LayerNorm.weight FLOAT[768] d11a0fb1b847
text.transformer.encoder.layer.0.output.dense.bias FLOAT[768] 370414783792
text.transformer.encoder.layer.1.attention.output.LayerNorm.bias FLOAT[768] c8f6589bc230
text.transformer.encoder.layer.1.attention.output.LayerNorm.weight FLOAT[768] 98f73b4376fa
text.transformer.encoder.layer.1.attention.output.dense.bias FLOAT[768] 9bc46d7712e9
text.transformer.encoder.layer.1.attention.self.key.bias FLOAT[768] 05b2c6e3fd08
text.transformer.encoder.layer.1.attention.self.query.bias FLOAT[768] ab94ec1480f6
text.transformer.encoder.layer.1.intermediate.dense.bias FLOAT[3072] c0d5ad96864c
text.transformer.encoder.layer.1.output.LayerNorm.bias FLOAT[768] b60f9aa22f29
text.transformer.encoder.layer.1.output.LayerNorm.weight FLOAT[768] b25073b524f7
text.transformer.encoder.layer.1.output.dense.bias FLOAT[768] e8e07c8af046
text.transformer.encoder.layer.10.attention.output.LayerNorm.bias FLOAT[768] 8f89637cf6e1
text.transformer.encoder.layer.10.attention.output.LayerNorm.weight FLOAT[768] 776dc70f43e6
text.transformer.encoder.layer.10.attention.output.dense.bias FLOAT[768] 090e55256bbc
text.transformer.encoder.layer.10.attention.self.key.bias FLOAT[768] afe030c0f3a9
text.transformer.encoder.layer.10.attention.self.query.bias FLOAT[768] 545e40447392
text.transformer.encoder.layer.10.intermediate.dense.bias FLOAT[3072] 5de3ac86f28d
text.transformer.encoder.layer.10.output.LayerNorm.bias FLOAT[768] 71e94af262a5
text.transformer.encoder.layer.10.output.LayerNorm.weight FLOAT[768] 59024590e285
text.transformer.encoder.layer.10.output.dense.bias FLOAT[768] 4d6ad6470a1a
text.transformer.encoder.layer.11.attention.output.LayerNorm.bias FLOAT[768] 65e4dd579910
text.transformer.encoder.layer.11.attention.output.LayerNorm.weight FLOAT[768] bad4ce47ea71
text.transformer.encoder.layer.11.attention.output.dense.bias FLOAT[768] 0d6727468544
text.transformer.encoder.layer.11.attention.self.key.bias FLOAT[768] cb3fb3b1c0a4
text.transformer.encoder.layer.11.attention.self.query.bias FLOAT[768] f08fd1cd3a9e
text.transformer.encoder.layer.11.intermediate.dense.bias FLOAT[3072] c873f405cd66
text.transformer.encoder.layer.11.output.LayerNorm.bias FLOAT[768] f7c8f3a2efcc
text.transformer.encoder.layer.11.output.LayerNorm.weight FLOAT[768] 7d3090c89078
text.transformer.encoder.layer.11.output.dense.bias FLOAT[768] 5590257d4d6b
text.transformer.encoder.layer.2.attention.output.LayerNorm.bias FLOAT[768] ec40c2442a71
text.transformer.encoder.layer.2.attention.output.LayerNorm.weight FLOAT[768] c47c930884df
text.transformer.encoder.layer.2.attention.output.dense.bias FLOAT[768] dd779340e558
text.transformer.encoder.layer.2.attention.self.key.bias FLOAT[768] be955fdd7c85
text.transformer.encoder.layer.2.attention.self.query.bias FLOAT[768] 75cc659162d5
text.transformer.encoder.layer.2.intermediate.dense.bias FLOAT[3072] c0cbdc4f2f85
text.transformer.encoder.layer.2.output.LayerNorm.bias FLOAT[768] 8eb221d9d763
text.transformer.encoder.layer.2.output.LayerNorm.weight FLOAT[768] 6cd1fa2fc5c3
text.transformer.encoder.layer.2.output.dense.bias FLOAT[768] aa361f166bc5
text.transformer.encoder.layer.3.attention.output.LayerNorm.bias FLOAT[768] c83e9bb65bb8
text.transformer.encoder.layer.3.attention.output.LayerNorm.weight FLOAT[768] 69bed4061c8b
text.transformer.encoder.layer.3.attention.output.dense.bias FLOAT[768] aa5bc3f3c9b3
text.transformer.encoder.layer.3.attention.self.key.bias FLOAT[768] 035b3000332e
text.transformer.encoder.layer.3.attention.self.query.bias FLOAT[768] 50e7e1494ec3
text.transformer.encoder.layer.3.intermediate.dense.bias FLOAT[3072] 10882267f05d
text.transformer.encoder.layer.3.output.LayerNorm.bias FLOAT[768] bfceef57a5b3
text.transformer.encoder.layer.3.output.LayerNorm.weight FLOAT[768] f1f0a1c5f2ef
text.transformer.encoder.layer.3.output.dense.bias FLOAT[768] 5a302929a3ec
text.transformer.encoder.layer.4.attention.output.LayerNorm.bias FLOAT[768] 02b207b22480
text.transformer.encoder.layer.4.attention.output.LayerNorm.weight FLOAT[768] 4288594a89a1
text.transformer.encoder.layer.4.attention.output.dense.bias FLOAT[768] 9c79c7980611
text.transformer.encoder.layer.4.attention.self.key.bias FLOAT[768] f929db9f24cc
text.transformer.encoder.layer.4.attention.self.query.bias FLOAT[768] a8de239c2401
text.transformer.encoder.layer.4.intermediate.dense.bias FLOAT[3072] 1d7bc6ec7ab1
text.transformer.encoder.layer.4.output.LayerNorm.bias FLOAT[768] 459cb136d13d
text.transformer.encoder.layer.4.output.LayerNorm.weight FLOAT[768] dac9a63d705c
text.transformer.encoder.layer.4.output.dense.bias FLOAT[768] 811ba744b6c7
text.transformer.encoder.layer.5.attention.output.LayerNorm.bias FLOAT[768] ddd4748dc0ee
text.transformer.encoder.layer.5.attention.output.LayerNorm.weight FLOAT[768] 0c21e80a6b58
text.transformer.encoder.layer.5.attention.output.dense.bias FLOAT[768] 375ab2ee4cde
text.transformer.encoder.layer.5.attention.self.key.bias FLOAT[768] 2b98c15b312b
text.transformer.encoder.layer.5.attention.self.query.bias FLOAT[768] c4b4d9045b9c
text.transformer.encoder.layer.5.intermediate.dense.bias FLOAT[3072] e7aee3d0e16c
text.transformer.encoder.layer.5.output.LayerNorm.bias FLOAT[768] 40fc45127563
text.transformer.encoder.layer.5.output.LayerNorm.weight FLOAT[768] 9880d54b5faa
text.transformer.encoder.layer.5.output.dense.bias FLOAT[768] 6d99a2a9fc14
text.transformer.encoder.layer.6.attention.output.LayerNorm.bias FLOAT[768] 367cbd53d47c
text.transformer.encoder.layer.6.attention.output.LayerNorm.weight FLOAT[768] 2d9785024c40
text.transformer.encoder.layer.6.attention.output.dense.bias FLOAT[768] 023a68354a0e
text.transformer.encoder.layer.6.attention.self.key.bias FLOAT[768] 09a4bac9bc14
text.transformer.encoder.layer.6.attention.self.query.bias FLOAT[768] b68d21bf5ddf
text.transformer.encoder.layer.6.intermediate.dense.bias FLOAT[3072] 600325056fdb
text.transformer.encoder.layer.6.output.LayerNorm.bias FLOAT[768] 87d62b9cf464
text.transformer.encoder.layer.6.output.LayerNorm.weight FLOAT[768] d4616eeea87a
text.transformer.encoder.layer.6.output.dense.bias FLOAT[768] f45170dfd703
text.transformer.encoder.layer.7.attention.output.LayerNorm.bias FLOAT[768] 6ba320f96f66
text.transformer.encoder.layer.7.attention.output.LayerNorm.weight FLOAT[768] fb690f92342c
text.transformer.encoder.layer.7.attention.output.dense.bias FLOAT[768] 9d702df037e5
text.transformer.encoder.layer.7.attention.self.key.bias FLOAT[768] fb822c00902a
text.transformer.encoder.layer.7.attention.self.query.bias FLOAT[768] 0df762875df0
text.transformer.encoder.layer.7.intermediate.dense.bias FLOAT[3072] b3c8411f9ea3
text.transformer.encoder.layer.7.output.LayerNorm.bias FLOAT[768] a5c4cd9518c6
text.transformer.encoder.layer.7.output.LayerNorm.weight FLOAT[768] 131c61d4b01b
text.transformer.encoder.layer.7.output.dense.bias FLOAT[768] 0b397f6b3bae
text.transformer.encoder.layer.8.attention.output.LayerNorm.bias FLOAT[768] da1cbd70f856
text.transformer.encoder.layer.8.attention.output.LayerNorm.weight FLOAT[768] 8e3cbcfd8b56
text.transformer.encoder.layer.8.attention.output.dense.bias FLOAT[768] 3832a331b31b
text.transformer.encoder.layer.8.attention.self.key.bias FLOAT[768] c8fff53f8dcf
text.transformer.encoder.layer.8.attention.self.query.bias FLOAT[768] a4cfddf09554
text.transformer.encoder.layer.8.intermediate.dense.bias FLOAT[3072] 4fe654ece5eb
text.transformer.encoder.layer.8.output.LayerNorm.bias FLOAT[768] 53156abb2cfd
text.transformer.encoder.layer.8.output.LayerNorm.weight FLOAT[768] 4052f9b546c2
text.transformer.encoder.layer.8.output.dense.bias FLOAT[768] 6211f5abc057
text.transformer.encoder.layer.9.attention.output.LayerNorm.bias FLOAT[768] 8174a587744e
text.transformer.encoder.layer.9.attention.output.LayerNorm.weight FLOAT[768] 42d9d92b2ec0
text.transformer.encoder.layer.9.attention.output.dense.bias FLOAT[768] ef25a80da8e3
text.transformer.encoder.layer.9.attention.self.key.bias FLOAT[768] 8f56fc49b517
text.transformer.encoder.layer.9.attention.self.query.bias FLOAT[768] 27efb4f714f0
text.transformer.encoder.layer.9.intermediate.dense.bias FLOAT[3072] 62de7ce02087
text.transformer.encoder.layer.9.output.LayerNorm.bias FLOAT[768] 97a5eb8bcad6
text.transformer.encoder.layer.9.output.LayerNorm.weight FLOAT[768] 7b75e0262bc3
text.transformer.encoder.layer.9.output.dense.bias FLOAT[768] 9024e9a0ce61
text_one FLOAT[] e00e5eb94441
text_pad_keep FLOAT[250002] 49e563d9ce8a
text_q_axis FLOAT[77,1] 9575b2125169
text_row_axes INT64[2] 0c730b69905c
text_scale FLOAT[] e401200e5808
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,768] a881056d920e
val_11 FLOAT[768,768] 19648d0de9eb
val_12 FLOAT[768,768] fd2f77290d15
val_13 FLOAT[768,3072] dc9e18ebf02a
val_14 FLOAT[3072,768] 21b2102f0346
val_15 FLOAT[768,768] 59e8873c77e4
val_16 FLOAT[768,768] 0eca54d3ed73
val_17 FLOAT[768,768] 0bc637305c62
val_18 FLOAT[768,768] 4b4d14a3f6ea
val_19 FLOAT[768,3072] 23f14d958106
val_2 INT64[1] 7c9fa136d441
val_20 FLOAT[3072,768] 62217f4d9783
val_21 FLOAT[768,768] 70824d0e9301
val_22 FLOAT[768,768] 1cb9d4e51d2c
val_23 FLOAT[768,768] 4043dc77aa35
val_24 FLOAT[768,768] 2b74dccbbef5
val_25 FLOAT[768,3072] 115fe386137b
val_26 FLOAT[3072,768] 668db0c65e17
val_27 FLOAT[768,768] bc66c7cbd9f2
val_28 FLOAT[768,768] dd307b797e1d
val_29 FLOAT[768,768] a51138e2e1ca
val_3 FLOAT[768,768] b366b138bbfc
val_30 FLOAT[768,768] 3994c406b567
val_31 FLOAT[768,3072] 75507184a551
val_32 FLOAT[3072,768] 6f2414180f29
val_33 FLOAT[768,768] 9965dd6e147c
val_34 FLOAT[768,768] 507bcb26c2cd
val_35 FLOAT[768,768] 6be317e85110
val_36 FLOAT[768,768] 6ae2c2e5e683
val_37 FLOAT[768,3072] 02a001ab85c9
val_38 FLOAT[3072,768] dc5ea195208b
val_39 FLOAT[768,768] d8b4a07d0a13
val_4 FLOAT[768,768] 1c7bb0056b53
val_40 FLOAT[768,768] 92a414478730
val_41 FLOAT[768,768] 4c234172c95c
val_42 FLOAT[768,768] 3e20a78d0fa8
val_43 FLOAT[768,3072] 53eaba22626e
val_44 FLOAT[3072,768] 345f9d28486d
val_45 FLOAT[768,768] d6947760864d
val_46 FLOAT[768,768] d4f7ee8edf6d
val_47 FLOAT[768,768] 81b298669224
val_48 FLOAT[768,768] 64d066280455
val_49 FLOAT[768,3072] 9d4838b4be0d
val_5 FLOAT[768,768] 0499d18928bd
val_50 FLOAT[3072,768] 8d67c15fff90
val_51 FLOAT[768,768] 5d823994ecf8
val_52 FLOAT[768,768] f3a7800a14f8
val_53 FLOAT[768,768] 180452512c9a
val_54 FLOAT[768,768] f990d2ceb56a
val_55 FLOAT[768,3072] 18df0e76c7b2
val_56 FLOAT[3072,768] 89a8ea842010
val_57 FLOAT[768,768] 375ef6f06012
val_58 FLOAT[768,768] ebf8d1f71808
val_59 FLOAT[768,768] 14880546f5cd
val_6 FLOAT[768,768] 32e5450083e2
val_60 FLOAT[768,768] 21e4ef59b66d
val_61 FLOAT[768,3072] 833bd4b8a8f2
val_62 FLOAT[3072,768] f497a6e0fec3
val_63 FLOAT[768,768] d8ba4c69d5fa
val_64 FLOAT[768,768] 6d1b73d4ac1c
val_65 FLOAT[768,768] 9016db6af709
val_66 FLOAT[768,768] 88c7672c021b
val_67 FLOAT[768,3072] ab8360e18e6d
val_68 FLOAT[3072,768] 8df7b310f434
val_69 FLOAT[768,768] 021e70290d4d
val_7 FLOAT[768,3072] ee66876ca4ce
val_70 FLOAT[768,768] 17b82a587a81
val_71 FLOAT[768,768] 390cf747b494
val_72 FLOAT[768,768] b7a5a157978d
val_73 FLOAT[768,3072] cc44925c2ab8
val_74 FLOAT[3072,768] 96fcd5afcc67
val_8 FLOAT[3072,768] 629a9ae04512
val_9 FLOAT[768,768] 5c4e6a2832af
@@ -0,0 +1,587 @@
<
ir_version: 10,
opset_import: ["" : 23],
producer_name: "pytorch"
>
main_graph (uint8[batch,224,224,3] image) => (float[batch,512] image_embedding)
<
float[batch,50,768] add_1088
float[batch,50,768] add_1109
float[batch,50,768] add_1224
float[batch,50,768] add_1245
float[batch,50,768] add_136
float[batch,50,768] add_1360
float[batch,50,768] add_1381
float[batch,50,768] add_1496
float[batch,50,768] add_1517
float[batch,1,768] add_1517_pooled
float[batch,50,768] add_157
float[batch,1,768] add_1632
float[batch,1,768] add_1653
float[batch,50,768] add_17
float[batch,50,768] add_272
float[batch,50,768] add_293
float[batch,50,768] add_408
float[batch,50,768] add_429
float[batch,50,768] add_544
float[batch,50,768] add_565
float[batch,50,768] add_680
float[batch,50,768] add_701
float[batch,50,768] add_816
float[batch,50,768] add_837
float[batch,50,768] add_952
float[batch,50,768] add_973
float[batch,1] clamp_min
float[batch,768,7,7] conv2d
float[batch,50,3072] gelu
float[batch,50,3072] gelu_1
float[batch,50,3072] gelu_10
float[batch,1,3072] gelu_11
float[batch,50,3072] gelu_2
float[batch,50,3072] gelu_3
float[batch,50,3072] gelu_4
float[batch,50,3072] gelu_5
float[batch,50,3072] gelu_6
float[batch,50,3072] gelu_7
float[batch,50,3072] gelu_8
float[batch,50,3072] gelu_9
float[batch,3,224,224] image_chw
float[batch,224,224,3] image_f32
float[batch,50,768] layer_norm
float[batch,50,768] layer_norm_1
float[batch,50,768] layer_norm_10
float[batch,50,768] layer_norm_11
float[batch,50,768] layer_norm_12
float[batch,50,768] layer_norm_13
float[batch,50,768] layer_norm_14
float[batch,50,768] layer_norm_15
float[batch,50,768] layer_norm_16
float[batch,50,768] layer_norm_17
float[batch,50,768] layer_norm_18
float[batch,50,768] layer_norm_19
float[batch,50,768] layer_norm_2
float[batch,50,768] layer_norm_20
float[batch,50,768] layer_norm_21
float[batch,50,768] layer_norm_22
float[batch,50,768] layer_norm_23
float[batch,1,768] layer_norm_24
float[batch,50,768] layer_norm_3
float[batch,50,768] layer_norm_4
float[batch,50,768] layer_norm_5
float[batch,50,768] layer_norm_6
float[batch,50,768] layer_norm_7
float[batch,50,768] layer_norm_8
float[batch,50,768] layer_norm_9
float[batch,1] linalg_vector_norm
float[batch,50,3072] linear_10
float[batch,50,768] linear_11
float[batch,50,3072] linear_14
float[batch,50,768] linear_15
float[batch,50,3072] linear_18
float[batch,50,768] linear_19
float[batch,50,3072] linear_2
float[batch,50,3072] linear_22
float[batch,50,768] linear_23
float[batch,50,3072] linear_26
float[batch,50,768] linear_27
float[batch,50,768] linear_3
float[batch,50,3072] linear_30
float[batch,50,768] linear_31
float[batch,50,3072] linear_34
float[batch,50,768] linear_35
float[batch,50,3072] linear_38
float[batch,50,768] linear_39
float[batch,50,3072] linear_42
float[batch,50,768] linear_43
float[batch,1,3072] linear_46
float[batch,1,768] linear_47
float[batch,50,3072] linear_6
float[batch,50,768] linear_7
float[batch,512] matmul
float[batch,50,768] node_scaled_dot_product_attention_10_k
float[batch,50,768] node_scaled_dot_product_attention_10_out
float[batch,50,768] node_scaled_dot_product_attention_10_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_q
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv
float[batch,50,2304] node_scaled_dot_product_attention_10_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_10_v
float[batch,50,768] node_scaled_dot_product_attention_11_k
float[batch,1,768] node_scaled_dot_product_attention_11_out
float[batch,1,768] node_scaled_dot_product_attention_11_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_q
float[batch,1,768] node_scaled_dot_product_attention_11_q_pooled
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv
float[batch,50,2304] node_scaled_dot_product_attention_11_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_11_v
float[batch,50,768] node_scaled_dot_product_attention_1_k
float[batch,50,768] node_scaled_dot_product_attention_1_out
float[batch,50,768] node_scaled_dot_product_attention_1_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_q
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv
float[batch,50,2304] node_scaled_dot_product_attention_1_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_1_v
float[batch,50,768] node_scaled_dot_product_attention_2_k
float[batch,50,768] node_scaled_dot_product_attention_2_out
float[batch,50,768] node_scaled_dot_product_attention_2_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_q
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv
float[batch,50,2304] node_scaled_dot_product_attention_2_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_2_v
float[batch,50,768] node_scaled_dot_product_attention_3_k
float[batch,50,768] node_scaled_dot_product_attention_3_out
float[batch,50,768] node_scaled_dot_product_attention_3_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_q
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv
float[batch,50,2304] node_scaled_dot_product_attention_3_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_3_v
float[batch,50,768] node_scaled_dot_product_attention_4_k
float[batch,50,768] node_scaled_dot_product_attention_4_out
float[batch,50,768] node_scaled_dot_product_attention_4_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_q
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv
float[batch,50,2304] node_scaled_dot_product_attention_4_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_4_v
float[batch,50,768] node_scaled_dot_product_attention_5_k
float[batch,50,768] node_scaled_dot_product_attention_5_out
float[batch,50,768] node_scaled_dot_product_attention_5_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_q
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv
float[batch,50,2304] node_scaled_dot_product_attention_5_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_5_v
float[batch,50,768] node_scaled_dot_product_attention_6_k
float[batch,50,768] node_scaled_dot_product_attention_6_out
float[batch,50,768] node_scaled_dot_product_attention_6_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_q
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv
float[batch,50,2304] node_scaled_dot_product_attention_6_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_6_v
float[batch,50,768] node_scaled_dot_product_attention_7_k
float[batch,50,768] node_scaled_dot_product_attention_7_out
float[batch,50,768] node_scaled_dot_product_attention_7_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_q
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv
float[batch,50,2304] node_scaled_dot_product_attention_7_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_7_v
float[batch,50,768] node_scaled_dot_product_attention_8_k
float[batch,50,768] node_scaled_dot_product_attention_8_out
float[batch,50,768] node_scaled_dot_product_attention_8_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_q
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv
float[batch,50,2304] node_scaled_dot_product_attention_8_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_8_v
float[batch,50,768] node_scaled_dot_product_attention_9_k
float[batch,50,768] node_scaled_dot_product_attention_9_out
float[batch,50,768] node_scaled_dot_product_attention_9_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_q
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv
float[batch,50,2304] node_scaled_dot_product_attention_9_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_9_v
float[batch,50,768] node_scaled_dot_product_attention_k
float[batch,50,768] node_scaled_dot_product_attention_out
float[batch,50,768] node_scaled_dot_product_attention_out_mm_out
float[batch,50,768] node_scaled_dot_product_attention_q
float[batch,50,2304] node_scaled_dot_product_attention_qkv
float[batch,50,2304] node_scaled_dot_product_attention_qkv_mm_out
float[batch,50,768] node_scaled_dot_product_attention_v
float[batch,49,768] permute
float[batch,50,768] scaled_dot_product_attention
float[batch,50,768] scaled_dot_product_attention_1
float[batch,50,768] scaled_dot_product_attention_10
float[batch,1,768] scaled_dot_product_attention_11
float[batch,50,768] scaled_dot_product_attention_2
float[batch,50,768] scaled_dot_product_attention_3
float[batch,50,768] scaled_dot_product_attention_4
float[batch,50,768] scaled_dot_product_attention_5
float[batch,50,768] scaled_dot_product_attention_6
float[batch,50,768] scaled_dot_product_attention_7
float[batch,50,768] scaled_dot_product_attention_8
float[batch,50,768] scaled_dot_product_attention_9
float[batch,768] select_36
float[batch,50,768] val_43
float[batch,50,3072] val_44
float[batch,50,768] val_45
float[batch,50,3072] val_46
float[batch,50,768] val_47
float[batch,50,3072] val_48
float[batch,50,768] val_49
float[batch,50,3072] val_50
float[batch,50,768] val_51
float[batch,50,3072] val_52
float[batch,50,768] val_53
float[batch,50,3072] val_54
float[batch,50,768] val_55
float[batch,50,3072] val_56
float[batch,50,768] val_57
float[batch,50,3072] val_58
float[batch,50,768] val_59
float[batch,50,3072] val_60
float[batch,50,768] val_61
float[batch,50,3072] val_62
float[batch,50,768] val_63
float[batch,50,3072] val_64
float[batch,50,768] val_65
float[batch,1,3072] val_66
float[batch,1,768] val_67
float[batch,768] val_68
float[batch,768,49] view
>
{
[pre_cast] image_f32 = Cast <to: int = 1> (image)
[pre_nhwc_to_nchw] image_chw = Transpose <perm: ints = [0, 3, 1, 2]> (image_f32)
conv2d = Conv <auto_pad: string = "NOTSET", dilations: ints = [1, 1], group: int = 1, pads: ints = [0, 0, 0, 0], strides: ints = [32, 32]> (image_chw, "visual.conv1.weight", node_Conv_704_fused_bias)
view = Reshape <allowzero: int = 1> (conv2d, view_target)
[node_permute] permute = Transpose <perm: ints = [0, 2, 1]> (view)
val_43 = Pad (permute, val_3, val_4)
add_17 = Add (val_43, val_42)
[node_layer_norm] layer_norm = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_17, "visual.ln_pre.weight", "visual.ln_pre.bias")
layer_norm_1 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (layer_norm, "visual.transformer.resblocks.0.ln_1.weight", "visual.transformer.resblocks.0.ln_1.bias")
[node_scaled_dot_product_attention_qkv_mm] node_scaled_dot_product_attention_qkv_mm_out = MatMul (layer_norm_1, val_6)
[node_scaled_dot_product_attention_qkv_bias] node_scaled_dot_product_attention_qkv = Add (node_scaled_dot_product_attention_qkv_mm_out, "visual.transformer.resblocks.0.attn.in_proj_bias")
[node_scaled_dot_product_attention_qkv_split] node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v = Split <axis: int = -1> (node_scaled_dot_product_attention_qkv, attn3d_split_3x768)
[node_scaled_dot_product_attention] scaled_dot_product_attention = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_q, node_scaled_dot_product_attention_k, node_scaled_dot_product_attention_v)
[node_scaled_dot_product_attention_out_mm] node_scaled_dot_product_attention_out_mm_out = MatMul (scaled_dot_product_attention, node_scaled_dot_product_attention_wo_t)
[node_scaled_dot_product_attention_out_bias] node_scaled_dot_product_attention_out = Add (node_scaled_dot_product_attention_out_mm_out, "visual.transformer.resblocks.0.attn.out_proj.bias")
add_136 = Add (layer_norm, node_scaled_dot_product_attention_out)
layer_norm_2 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_136, "visual.transformer.resblocks.0.ln_2.weight", "visual.transformer.resblocks.0.ln_2.bias")
val_44 = MatMul (layer_norm_2, val_7)
linear_2 = Add (val_44, "visual.transformer.resblocks.0.mlp.c_fc.bias")
[node_gelu] gelu = Gelu <approximate: string = "none"> (linear_2)
val_45 = MatMul (gelu, val_8)
linear_3 = Add (val_45, "visual.transformer.resblocks.0.mlp.c_proj.bias")
add_157 = Add (add_136, linear_3)
layer_norm_3 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_157, "visual.transformer.resblocks.1.ln_1.weight", "visual.transformer.resblocks.1.ln_1.bias")
[node_scaled_dot_product_attention_1_qkv_mm] node_scaled_dot_product_attention_1_qkv_mm_out = MatMul (layer_norm_3, val_9)
[node_scaled_dot_product_attention_1_qkv_bias] node_scaled_dot_product_attention_1_qkv = Add (node_scaled_dot_product_attention_1_qkv_mm_out, "visual.transformer.resblocks.1.attn.in_proj_bias")
[node_scaled_dot_product_attention_1_qkv_split] node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v = Split <axis: int = -1> (node_scaled_dot_product_attention_1_qkv, attn3d_split_3x768)
scaled_dot_product_attention_1 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_1_q, node_scaled_dot_product_attention_1_k, node_scaled_dot_product_attention_1_v)
[node_scaled_dot_product_attention_1_out_mm] node_scaled_dot_product_attention_1_out_mm_out = MatMul (scaled_dot_product_attention_1, node_scaled_dot_product_attention_1_wo_t)
[node_scaled_dot_product_attention_1_out_bias] node_scaled_dot_product_attention_1_out = Add (node_scaled_dot_product_attention_1_out_mm_out, "visual.transformer.resblocks.1.attn.out_proj.bias")
add_272 = Add (add_157, node_scaled_dot_product_attention_1_out)
layer_norm_4 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_272, "visual.transformer.resblocks.1.ln_2.weight", "visual.transformer.resblocks.1.ln_2.bias")
val_46 = MatMul (layer_norm_4, val_10)
linear_6 = Add (val_46, "visual.transformer.resblocks.1.mlp.c_fc.bias")
gelu_1 = Gelu <approximate: string = "none"> (linear_6)
val_47 = MatMul (gelu_1, val_11)
linear_7 = Add (val_47, "visual.transformer.resblocks.1.mlp.c_proj.bias")
add_293 = Add (add_272, linear_7)
layer_norm_5 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_293, "visual.transformer.resblocks.2.ln_1.weight", "visual.transformer.resblocks.2.ln_1.bias")
[node_scaled_dot_product_attention_2_qkv_mm] node_scaled_dot_product_attention_2_qkv_mm_out = MatMul (layer_norm_5, val_12)
[node_scaled_dot_product_attention_2_qkv_bias] node_scaled_dot_product_attention_2_qkv = Add (node_scaled_dot_product_attention_2_qkv_mm_out, "visual.transformer.resblocks.2.attn.in_proj_bias")
[node_scaled_dot_product_attention_2_qkv_split] node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v = Split <axis: int = -1> (node_scaled_dot_product_attention_2_qkv, attn3d_split_3x768)
scaled_dot_product_attention_2 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_2_q, node_scaled_dot_product_attention_2_k, node_scaled_dot_product_attention_2_v)
[node_scaled_dot_product_attention_2_out_mm] node_scaled_dot_product_attention_2_out_mm_out = MatMul (scaled_dot_product_attention_2, node_scaled_dot_product_attention_2_wo_t)
[node_scaled_dot_product_attention_2_out_bias] node_scaled_dot_product_attention_2_out = Add (node_scaled_dot_product_attention_2_out_mm_out, "visual.transformer.resblocks.2.attn.out_proj.bias")
add_408 = Add (add_293, node_scaled_dot_product_attention_2_out)
layer_norm_6 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_408, "visual.transformer.resblocks.2.ln_2.weight", "visual.transformer.resblocks.2.ln_2.bias")
val_48 = MatMul (layer_norm_6, val_13)
linear_10 = Add (val_48, "visual.transformer.resblocks.2.mlp.c_fc.bias")
gelu_2 = Gelu <approximate: string = "none"> (linear_10)
val_49 = MatMul (gelu_2, val_14)
linear_11 = Add (val_49, "visual.transformer.resblocks.2.mlp.c_proj.bias")
add_429 = Add (add_408, linear_11)
layer_norm_7 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_429, "visual.transformer.resblocks.3.ln_1.weight", "visual.transformer.resblocks.3.ln_1.bias")
[node_scaled_dot_product_attention_3_qkv_mm] node_scaled_dot_product_attention_3_qkv_mm_out = MatMul (layer_norm_7, val_15)
[node_scaled_dot_product_attention_3_qkv_bias] node_scaled_dot_product_attention_3_qkv = Add (node_scaled_dot_product_attention_3_qkv_mm_out, "visual.transformer.resblocks.3.attn.in_proj_bias")
[node_scaled_dot_product_attention_3_qkv_split] node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v = Split <axis: int = -1> (node_scaled_dot_product_attention_3_qkv, attn3d_split_3x768)
scaled_dot_product_attention_3 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_3_q, node_scaled_dot_product_attention_3_k, node_scaled_dot_product_attention_3_v)
[node_scaled_dot_product_attention_3_out_mm] node_scaled_dot_product_attention_3_out_mm_out = MatMul (scaled_dot_product_attention_3, node_scaled_dot_product_attention_3_wo_t)
[node_scaled_dot_product_attention_3_out_bias] node_scaled_dot_product_attention_3_out = Add (node_scaled_dot_product_attention_3_out_mm_out, "visual.transformer.resblocks.3.attn.out_proj.bias")
add_544 = Add (add_429, node_scaled_dot_product_attention_3_out)
layer_norm_8 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_544, "visual.transformer.resblocks.3.ln_2.weight", "visual.transformer.resblocks.3.ln_2.bias")
val_50 = MatMul (layer_norm_8, val_16)
linear_14 = Add (val_50, "visual.transformer.resblocks.3.mlp.c_fc.bias")
gelu_3 = Gelu <approximate: string = "none"> (linear_14)
val_51 = MatMul (gelu_3, val_17)
linear_15 = Add (val_51, "visual.transformer.resblocks.3.mlp.c_proj.bias")
add_565 = Add (add_544, linear_15)
layer_norm_9 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_565, "visual.transformer.resblocks.4.ln_1.weight", "visual.transformer.resblocks.4.ln_1.bias")
[node_scaled_dot_product_attention_4_qkv_mm] node_scaled_dot_product_attention_4_qkv_mm_out = MatMul (layer_norm_9, val_18)
[node_scaled_dot_product_attention_4_qkv_bias] node_scaled_dot_product_attention_4_qkv = Add (node_scaled_dot_product_attention_4_qkv_mm_out, "visual.transformer.resblocks.4.attn.in_proj_bias")
[node_scaled_dot_product_attention_4_qkv_split] node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v = Split <axis: int = -1> (node_scaled_dot_product_attention_4_qkv, attn3d_split_3x768)
scaled_dot_product_attention_4 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_4_q, node_scaled_dot_product_attention_4_k, node_scaled_dot_product_attention_4_v)
[node_scaled_dot_product_attention_4_out_mm] node_scaled_dot_product_attention_4_out_mm_out = MatMul (scaled_dot_product_attention_4, node_scaled_dot_product_attention_4_wo_t)
[node_scaled_dot_product_attention_4_out_bias] node_scaled_dot_product_attention_4_out = Add (node_scaled_dot_product_attention_4_out_mm_out, "visual.transformer.resblocks.4.attn.out_proj.bias")
add_680 = Add (add_565, node_scaled_dot_product_attention_4_out)
layer_norm_10 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_680, "visual.transformer.resblocks.4.ln_2.weight", "visual.transformer.resblocks.4.ln_2.bias")
val_52 = MatMul (layer_norm_10, val_19)
linear_18 = Add (val_52, "visual.transformer.resblocks.4.mlp.c_fc.bias")
gelu_4 = Gelu <approximate: string = "none"> (linear_18)
val_53 = MatMul (gelu_4, val_20)
linear_19 = Add (val_53, "visual.transformer.resblocks.4.mlp.c_proj.bias")
add_701 = Add (add_680, linear_19)
layer_norm_11 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_701, "visual.transformer.resblocks.5.ln_1.weight", "visual.transformer.resblocks.5.ln_1.bias")
[node_scaled_dot_product_attention_5_qkv_mm] node_scaled_dot_product_attention_5_qkv_mm_out = MatMul (layer_norm_11, val_21)
[node_scaled_dot_product_attention_5_qkv_bias] node_scaled_dot_product_attention_5_qkv = Add (node_scaled_dot_product_attention_5_qkv_mm_out, "visual.transformer.resblocks.5.attn.in_proj_bias")
[node_scaled_dot_product_attention_5_qkv_split] node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v = Split <axis: int = -1> (node_scaled_dot_product_attention_5_qkv, attn3d_split_3x768)
scaled_dot_product_attention_5 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_5_q, node_scaled_dot_product_attention_5_k, node_scaled_dot_product_attention_5_v)
[node_scaled_dot_product_attention_5_out_mm] node_scaled_dot_product_attention_5_out_mm_out = MatMul (scaled_dot_product_attention_5, node_scaled_dot_product_attention_5_wo_t)
[node_scaled_dot_product_attention_5_out_bias] node_scaled_dot_product_attention_5_out = Add (node_scaled_dot_product_attention_5_out_mm_out, "visual.transformer.resblocks.5.attn.out_proj.bias")
add_816 = Add (add_701, node_scaled_dot_product_attention_5_out)
layer_norm_12 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_816, "visual.transformer.resblocks.5.ln_2.weight", "visual.transformer.resblocks.5.ln_2.bias")
val_54 = MatMul (layer_norm_12, val_22)
linear_22 = Add (val_54, "visual.transformer.resblocks.5.mlp.c_fc.bias")
gelu_5 = Gelu <approximate: string = "none"> (linear_22)
val_55 = MatMul (gelu_5, val_23)
linear_23 = Add (val_55, "visual.transformer.resblocks.5.mlp.c_proj.bias")
add_837 = Add (add_816, linear_23)
layer_norm_13 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_837, "visual.transformer.resblocks.6.ln_1.weight", "visual.transformer.resblocks.6.ln_1.bias")
[node_scaled_dot_product_attention_6_qkv_mm] node_scaled_dot_product_attention_6_qkv_mm_out = MatMul (layer_norm_13, val_24)
[node_scaled_dot_product_attention_6_qkv_bias] node_scaled_dot_product_attention_6_qkv = Add (node_scaled_dot_product_attention_6_qkv_mm_out, "visual.transformer.resblocks.6.attn.in_proj_bias")
[node_scaled_dot_product_attention_6_qkv_split] node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v = Split <axis: int = -1> (node_scaled_dot_product_attention_6_qkv, attn3d_split_3x768)
scaled_dot_product_attention_6 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_6_q, node_scaled_dot_product_attention_6_k, node_scaled_dot_product_attention_6_v)
[node_scaled_dot_product_attention_6_out_mm] node_scaled_dot_product_attention_6_out_mm_out = MatMul (scaled_dot_product_attention_6, node_scaled_dot_product_attention_6_wo_t)
[node_scaled_dot_product_attention_6_out_bias] node_scaled_dot_product_attention_6_out = Add (node_scaled_dot_product_attention_6_out_mm_out, "visual.transformer.resblocks.6.attn.out_proj.bias")
add_952 = Add (add_837, node_scaled_dot_product_attention_6_out)
layer_norm_14 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_952, "visual.transformer.resblocks.6.ln_2.weight", "visual.transformer.resblocks.6.ln_2.bias")
val_56 = MatMul (layer_norm_14, val_25)
linear_26 = Add (val_56, "visual.transformer.resblocks.6.mlp.c_fc.bias")
gelu_6 = Gelu <approximate: string = "none"> (linear_26)
val_57 = MatMul (gelu_6, val_26)
linear_27 = Add (val_57, "visual.transformer.resblocks.6.mlp.c_proj.bias")
add_973 = Add (add_952, linear_27)
layer_norm_15 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_973, "visual.transformer.resblocks.7.ln_1.weight", "visual.transformer.resblocks.7.ln_1.bias")
[node_scaled_dot_product_attention_7_qkv_mm] node_scaled_dot_product_attention_7_qkv_mm_out = MatMul (layer_norm_15, val_27)
[node_scaled_dot_product_attention_7_qkv_bias] node_scaled_dot_product_attention_7_qkv = Add (node_scaled_dot_product_attention_7_qkv_mm_out, "visual.transformer.resblocks.7.attn.in_proj_bias")
[node_scaled_dot_product_attention_7_qkv_split] node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v = Split <axis: int = -1> (node_scaled_dot_product_attention_7_qkv, attn3d_split_3x768)
scaled_dot_product_attention_7 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_7_q, node_scaled_dot_product_attention_7_k, node_scaled_dot_product_attention_7_v)
[node_scaled_dot_product_attention_7_out_mm] node_scaled_dot_product_attention_7_out_mm_out = MatMul (scaled_dot_product_attention_7, node_scaled_dot_product_attention_7_wo_t)
[node_scaled_dot_product_attention_7_out_bias] node_scaled_dot_product_attention_7_out = Add (node_scaled_dot_product_attention_7_out_mm_out, "visual.transformer.resblocks.7.attn.out_proj.bias")
add_1088 = Add (add_973, node_scaled_dot_product_attention_7_out)
layer_norm_16 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1088, "visual.transformer.resblocks.7.ln_2.weight", "visual.transformer.resblocks.7.ln_2.bias")
val_58 = MatMul (layer_norm_16, val_28)
linear_30 = Add (val_58, "visual.transformer.resblocks.7.mlp.c_fc.bias")
gelu_7 = Gelu <approximate: string = "none"> (linear_30)
val_59 = MatMul (gelu_7, val_29)
linear_31 = Add (val_59, "visual.transformer.resblocks.7.mlp.c_proj.bias")
add_1109 = Add (add_1088, linear_31)
layer_norm_17 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1109, "visual.transformer.resblocks.8.ln_1.weight", "visual.transformer.resblocks.8.ln_1.bias")
[node_scaled_dot_product_attention_8_qkv_mm] node_scaled_dot_product_attention_8_qkv_mm_out = MatMul (layer_norm_17, val_30)
[node_scaled_dot_product_attention_8_qkv_bias] node_scaled_dot_product_attention_8_qkv = Add (node_scaled_dot_product_attention_8_qkv_mm_out, "visual.transformer.resblocks.8.attn.in_proj_bias")
[node_scaled_dot_product_attention_8_qkv_split] node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v = Split <axis: int = -1> (node_scaled_dot_product_attention_8_qkv, attn3d_split_3x768)
scaled_dot_product_attention_8 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_8_q, node_scaled_dot_product_attention_8_k, node_scaled_dot_product_attention_8_v)
[node_scaled_dot_product_attention_8_out_mm] node_scaled_dot_product_attention_8_out_mm_out = MatMul (scaled_dot_product_attention_8, node_scaled_dot_product_attention_8_wo_t)
[node_scaled_dot_product_attention_8_out_bias] node_scaled_dot_product_attention_8_out = Add (node_scaled_dot_product_attention_8_out_mm_out, "visual.transformer.resblocks.8.attn.out_proj.bias")
add_1224 = Add (add_1109, node_scaled_dot_product_attention_8_out)
layer_norm_18 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1224, "visual.transformer.resblocks.8.ln_2.weight", "visual.transformer.resblocks.8.ln_2.bias")
val_60 = MatMul (layer_norm_18, val_31)
linear_34 = Add (val_60, "visual.transformer.resblocks.8.mlp.c_fc.bias")
gelu_8 = Gelu <approximate: string = "none"> (linear_34)
val_61 = MatMul (gelu_8, val_32)
linear_35 = Add (val_61, "visual.transformer.resblocks.8.mlp.c_proj.bias")
add_1245 = Add (add_1224, linear_35)
layer_norm_19 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1245, "visual.transformer.resblocks.9.ln_1.weight", "visual.transformer.resblocks.9.ln_1.bias")
[node_scaled_dot_product_attention_9_qkv_mm] node_scaled_dot_product_attention_9_qkv_mm_out = MatMul (layer_norm_19, val_33)
[node_scaled_dot_product_attention_9_qkv_bias] node_scaled_dot_product_attention_9_qkv = Add (node_scaled_dot_product_attention_9_qkv_mm_out, "visual.transformer.resblocks.9.attn.in_proj_bias")
[node_scaled_dot_product_attention_9_qkv_split] node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v = Split <axis: int = -1> (node_scaled_dot_product_attention_9_qkv, attn3d_split_3x768)
scaled_dot_product_attention_9 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_9_q, node_scaled_dot_product_attention_9_k, node_scaled_dot_product_attention_9_v)
[node_scaled_dot_product_attention_9_out_mm] node_scaled_dot_product_attention_9_out_mm_out = MatMul (scaled_dot_product_attention_9, node_scaled_dot_product_attention_9_wo_t)
[node_scaled_dot_product_attention_9_out_bias] node_scaled_dot_product_attention_9_out = Add (node_scaled_dot_product_attention_9_out_mm_out, "visual.transformer.resblocks.9.attn.out_proj.bias")
add_1360 = Add (add_1245, node_scaled_dot_product_attention_9_out)
layer_norm_20 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1360, "visual.transformer.resblocks.9.ln_2.weight", "visual.transformer.resblocks.9.ln_2.bias")
val_62 = MatMul (layer_norm_20, val_34)
linear_38 = Add (val_62, "visual.transformer.resblocks.9.mlp.c_fc.bias")
gelu_9 = Gelu <approximate: string = "none"> (linear_38)
val_63 = MatMul (gelu_9, val_35)
linear_39 = Add (val_63, "visual.transformer.resblocks.9.mlp.c_proj.bias")
add_1381 = Add (add_1360, linear_39)
layer_norm_21 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1381, "visual.transformer.resblocks.10.ln_1.weight", "visual.transformer.resblocks.10.ln_1.bias")
[node_scaled_dot_product_attention_10_qkv_mm] node_scaled_dot_product_attention_10_qkv_mm_out = MatMul (layer_norm_21, val_36)
[node_scaled_dot_product_attention_10_qkv_bias] node_scaled_dot_product_attention_10_qkv = Add (node_scaled_dot_product_attention_10_qkv_mm_out, "visual.transformer.resblocks.10.attn.in_proj_bias")
[node_scaled_dot_product_attention_10_qkv_split] node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v = Split <axis: int = -1> (node_scaled_dot_product_attention_10_qkv, attn3d_split_3x768)
scaled_dot_product_attention_10 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_10_q, node_scaled_dot_product_attention_10_k, node_scaled_dot_product_attention_10_v)
[node_scaled_dot_product_attention_10_out_mm] node_scaled_dot_product_attention_10_out_mm_out = MatMul (scaled_dot_product_attention_10, node_scaled_dot_product_attention_10_wo_t)
[node_scaled_dot_product_attention_10_out_bias] node_scaled_dot_product_attention_10_out = Add (node_scaled_dot_product_attention_10_out_mm_out, "visual.transformer.resblocks.10.attn.out_proj.bias")
add_1496 = Add (add_1381, node_scaled_dot_product_attention_10_out)
layer_norm_22 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1496, "visual.transformer.resblocks.10.ln_2.weight", "visual.transformer.resblocks.10.ln_2.bias")
val_64 = MatMul (layer_norm_22, val_37)
linear_42 = Add (val_64, "visual.transformer.resblocks.10.mlp.c_fc.bias")
gelu_10 = Gelu <approximate: string = "none"> (linear_42)
val_65 = MatMul (gelu_10, val_38)
linear_43 = Add (val_65, "visual.transformer.resblocks.10.mlp.c_proj.bias")
add_1517 = Add (add_1496, linear_43)
layer_norm_23 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1517, "visual.transformer.resblocks.11.ln_1.weight", "visual.transformer.resblocks.11.ln_1.bias")
[node_scaled_dot_product_attention_11_qkv_mm] node_scaled_dot_product_attention_11_qkv_mm_out = MatMul (layer_norm_23, val_39)
[node_scaled_dot_product_attention_11_qkv_bias] node_scaled_dot_product_attention_11_qkv = Add (node_scaled_dot_product_attention_11_qkv_mm_out, "visual.transformer.resblocks.11.attn.in_proj_bias")
[node_scaled_dot_product_attention_11_qkv_split] node_scaled_dot_product_attention_11_q, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v = Split <axis: int = -1> (node_scaled_dot_product_attention_11_qkv, attn3d_split_3x768)
[pool_hoist_node_scaled_dot_product_attention_11_q] node_scaled_dot_product_attention_11_q_pooled = Slice (node_scaled_dot_product_attention_11_q, val_2, val_5, val_5)
scaled_dot_product_attention_11 = Attention <is_causal: int = 0, kv_num_heads: int = 12, q_num_heads: int = 12, qk_matmul_output_mode: int = 0, softcap: float = 0> (node_scaled_dot_product_attention_11_q_pooled, node_scaled_dot_product_attention_11_k, node_scaled_dot_product_attention_11_v)
[node_scaled_dot_product_attention_11_out_mm] node_scaled_dot_product_attention_11_out_mm_out = MatMul (scaled_dot_product_attention_11, node_scaled_dot_product_attention_11_wo_t)
[node_scaled_dot_product_attention_11_out_bias] node_scaled_dot_product_attention_11_out = Add (node_scaled_dot_product_attention_11_out_mm_out, "visual.transformer.resblocks.11.attn.out_proj.bias")
[pool_hoist_add_1517] add_1517_pooled = Slice (add_1517, val_2, val_5, val_5)
add_1632 = Add (add_1517_pooled, node_scaled_dot_product_attention_11_out)
layer_norm_24 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (add_1632, "visual.transformer.resblocks.11.ln_2.weight", "visual.transformer.resblocks.11.ln_2.bias")
val_66 = MatMul (layer_norm_24, val_40)
linear_46 = Add (val_66, "visual.transformer.resblocks.11.mlp.c_fc.bias")
gelu_11 = Gelu <approximate: string = "none"> (linear_46)
val_67 = MatMul (gelu_11, val_41)
linear_47 = Add (val_67, "visual.transformer.resblocks.11.mlp.c_proj.bias")
add_1653 = Add (add_1632, linear_47)
val_68 = Squeeze (add_1653, val_5)
select_36 = LayerNormalization <axis: int = -1, epsilon: float = 1e-05, stash_type: int = 1> (val_68, "visual.ln_post.weight", "visual.ln_post.bias")
[node_matmul] matmul = MatMul (select_36, "visual.proj")
[node_linalg_vector_norm] linalg_vector_norm = ReduceL2 <keepdims: int = 1, noop_with_empty_axes: int = 0> (matmul, val_0)
[node_clamp_min] clamp_min = Clip (linalg_vector_norm, val_1)
[node_div] image_embedding = Div (matmul, clamp_min)
}
weights:
attn3d_split_3x768 INT64[3] eca50b2daf34
node_Conv_704_fused_bias FLOAT[768] 54fd0e9075cd
node_scaled_dot_product_attention_10_wo_t FLOAT[768,768] 3e5d112ba0a1
node_scaled_dot_product_attention_11_wo_t FLOAT[768,768] cfd74aba10b6
node_scaled_dot_product_attention_1_wo_t FLOAT[768,768] 389ad787ec9c
node_scaled_dot_product_attention_2_wo_t FLOAT[768,768] 5f5daf68c5df
node_scaled_dot_product_attention_3_wo_t FLOAT[768,768] d36e3dec1991
node_scaled_dot_product_attention_4_wo_t FLOAT[768,768] 506a945cead2
node_scaled_dot_product_attention_5_wo_t FLOAT[768,768] eac6c874de94
node_scaled_dot_product_attention_6_wo_t FLOAT[768,768] 0356f49148cf
node_scaled_dot_product_attention_7_wo_t FLOAT[768,768] d74101663af5
node_scaled_dot_product_attention_8_wo_t FLOAT[768,768] 07a1eab81825
node_scaled_dot_product_attention_9_wo_t FLOAT[768,768] ea2bbad48122
node_scaled_dot_product_attention_wo_t FLOAT[768,768] 1608f402cf15
val_0 INT64[1] 12a3ae445661
val_1 FLOAT[] 6708d9be4956
val_10 FLOAT[768,3072] 89d7d65540fa
val_11 FLOAT[3072,768] 69a624fa0799
val_12 FLOAT[768,2304] 694b89ca1752
val_13 FLOAT[768,3072] 2488013e0c5d
val_14 FLOAT[3072,768] 009525d3e2d9
val_15 FLOAT[768,2304] 2739e74f6f31
val_16 FLOAT[768,3072] 5b76fc05ab67
val_17 FLOAT[3072,768] 6a0b5a1212a9
val_18 FLOAT[768,2304] 11ae41f3badc
val_19 FLOAT[768,3072] b234440ef96f
val_2 INT64[1] af5570f5a181
val_20 FLOAT[3072,768] e3e57b9ff01b
val_21 FLOAT[768,2304] 718689d86153
val_22 FLOAT[768,3072] 70fe8618f307
val_23 FLOAT[3072,768] da45fe60d83b
val_24 FLOAT[768,2304] ff91dc7a8a64
val_25 FLOAT[768,3072] 769d1b2fd23b
val_26 FLOAT[3072,768] 3d0ed2c021d4
val_27 FLOAT[768,2304] b77c63679176
val_28 FLOAT[768,3072] d092a3da5326
val_29 FLOAT[3072,768] 759862d1d540
val_3 INT64[6] 6b7d92eaae70
val_30 FLOAT[768,2304] bbc54edf268f
val_31 FLOAT[768,3072] 7f643bfe350b
val_32 FLOAT[3072,768] 3c0d174b4570
val_33 FLOAT[768,2304] 82de9ba67146
val_34 FLOAT[768,3072] d11b75d3b825
val_35 FLOAT[3072,768] 2d60ca02512e
val_36 FLOAT[768,2304] 0830ff295d26
val_37 FLOAT[768,3072] bc9495ab5220
val_38 FLOAT[3072,768] eaf208534b3d
val_39 FLOAT[768,2304] e389acd67e1d
val_4 FLOAT[] df3f619804a9
val_40 FLOAT[768,3072] d6187a88592c
val_41 FLOAT[3072,768] 9489745db1c0
val_42 FLOAT[1,50,768] 68616dfe4d7c
val_5 INT64[1] 7c9fa136d441
val_6 FLOAT[768,2304] 45b3ce6da63b
val_7 FLOAT[768,3072] 202a568bf58f
val_8 FLOAT[3072,768] ce4d8036002b
val_9 FLOAT[768,2304] f5d0db52d5c0
view_target INT64[3] 69b00f163d22
visual.conv1.weight FLOAT[768,3,32,32] 3e07a1ba9b9a
visual.ln_post.bias FLOAT[768] 5ed199c1c974
visual.ln_post.weight FLOAT[768] 9d34c50e9ab2
visual.ln_pre.bias FLOAT[768] d92061030fa1
visual.ln_pre.weight FLOAT[768] b45db05f8aa2
visual.proj FLOAT[768,512] e70384606d46
visual.transformer.resblocks.0.attn.in_proj_bias FLOAT[2304] 75c8928d4484
visual.transformer.resblocks.0.attn.out_proj.bias FLOAT[768] 7871a420176a
visual.transformer.resblocks.0.ln_1.bias FLOAT[768] e87bfff9d4b3
visual.transformer.resblocks.0.ln_1.weight FLOAT[768] 34dcc00cba8e
visual.transformer.resblocks.0.ln_2.bias FLOAT[768] 8f196d706c45
visual.transformer.resblocks.0.ln_2.weight FLOAT[768] 5e1b98feebb5
visual.transformer.resblocks.0.mlp.c_fc.bias FLOAT[3072] ca1bcf0bec72
visual.transformer.resblocks.0.mlp.c_proj.bias FLOAT[768] c812a137f059
visual.transformer.resblocks.1.attn.in_proj_bias FLOAT[2304] b1f147a9bf34
visual.transformer.resblocks.1.attn.out_proj.bias FLOAT[768] 139992107188
visual.transformer.resblocks.1.ln_1.bias FLOAT[768] 835b6eae6791
visual.transformer.resblocks.1.ln_1.weight FLOAT[768] 0679d8942c56
visual.transformer.resblocks.1.ln_2.bias FLOAT[768] e8d258664bcf
visual.transformer.resblocks.1.ln_2.weight FLOAT[768] 4474e8dd11f4
visual.transformer.resblocks.1.mlp.c_fc.bias FLOAT[3072] 7624468fd5e6
visual.transformer.resblocks.1.mlp.c_proj.bias FLOAT[768] 91a674f9429c
visual.transformer.resblocks.10.attn.in_proj_bias FLOAT[2304] 1af6d5afc8de
visual.transformer.resblocks.10.attn.out_proj.bias FLOAT[768] 846df48b46b7
visual.transformer.resblocks.10.ln_1.bias FLOAT[768] 8074aa212aa7
visual.transformer.resblocks.10.ln_1.weight FLOAT[768] 7cdbca78e0f9
visual.transformer.resblocks.10.ln_2.bias FLOAT[768] 5652d9b1ff2f
visual.transformer.resblocks.10.ln_2.weight FLOAT[768] 44afdbefb1d5
visual.transformer.resblocks.10.mlp.c_fc.bias FLOAT[3072] a0fd094ef250
visual.transformer.resblocks.10.mlp.c_proj.bias FLOAT[768] 83872f91e304
visual.transformer.resblocks.11.attn.in_proj_bias FLOAT[2304] 29723586b577
visual.transformer.resblocks.11.attn.out_proj.bias FLOAT[768] 3f97962c2092
visual.transformer.resblocks.11.ln_1.bias FLOAT[768] 6ecb7766cd95
visual.transformer.resblocks.11.ln_1.weight FLOAT[768] ab8310a8156f
visual.transformer.resblocks.11.ln_2.bias FLOAT[768] b1aa26f044c9
visual.transformer.resblocks.11.ln_2.weight FLOAT[768] 150496c36cd5
visual.transformer.resblocks.11.mlp.c_fc.bias FLOAT[3072] 7bd00716fed8
visual.transformer.resblocks.11.mlp.c_proj.bias FLOAT[768] e81f4f091bd4
visual.transformer.resblocks.2.attn.in_proj_bias FLOAT[2304] 13d06d6b4a84
visual.transformer.resblocks.2.attn.out_proj.bias FLOAT[768] 1e77f31d5599
visual.transformer.resblocks.2.ln_1.bias FLOAT[768] 794df7b9b8ce
visual.transformer.resblocks.2.ln_1.weight FLOAT[768] b48f0e3e1b5c
visual.transformer.resblocks.2.ln_2.bias FLOAT[768] f30749e1d534
visual.transformer.resblocks.2.ln_2.weight FLOAT[768] b908137455a2
visual.transformer.resblocks.2.mlp.c_fc.bias FLOAT[3072] 5cb67b44340d
visual.transformer.resblocks.2.mlp.c_proj.bias FLOAT[768] 3b16d083a93d
visual.transformer.resblocks.3.attn.in_proj_bias FLOAT[2304] 3d5713b7808a
visual.transformer.resblocks.3.attn.out_proj.bias FLOAT[768] 1400e57af859
visual.transformer.resblocks.3.ln_1.bias FLOAT[768] cf0b1c5d4c67
visual.transformer.resblocks.3.ln_1.weight FLOAT[768] 3d8a0c0ce17c
visual.transformer.resblocks.3.ln_2.bias FLOAT[768] a464734ed8ac
visual.transformer.resblocks.3.ln_2.weight FLOAT[768] 1f8575cefa9a
visual.transformer.resblocks.3.mlp.c_fc.bias FLOAT[3072] e8a5cacef02a
visual.transformer.resblocks.3.mlp.c_proj.bias FLOAT[768] 55e78e8d7202
visual.transformer.resblocks.4.attn.in_proj_bias FLOAT[2304] a1fef701fbe3
visual.transformer.resblocks.4.attn.out_proj.bias FLOAT[768] 5229de1ad333
visual.transformer.resblocks.4.ln_1.bias FLOAT[768] 263a4b8e8021
visual.transformer.resblocks.4.ln_1.weight FLOAT[768] baa84d58c003
visual.transformer.resblocks.4.ln_2.bias FLOAT[768] 7a705fd053bf
visual.transformer.resblocks.4.ln_2.weight FLOAT[768] c34cdbaafc68
visual.transformer.resblocks.4.mlp.c_fc.bias FLOAT[3072] f6e07c5fd89d
visual.transformer.resblocks.4.mlp.c_proj.bias FLOAT[768] 8c868c56cd6f
visual.transformer.resblocks.5.attn.in_proj_bias FLOAT[2304] 02bbe82ebda0
visual.transformer.resblocks.5.attn.out_proj.bias FLOAT[768] ce6ce72e9f32
visual.transformer.resblocks.5.ln_1.bias FLOAT[768] 90688aa2b039
visual.transformer.resblocks.5.ln_1.weight FLOAT[768] 19b22ee65493
visual.transformer.resblocks.5.ln_2.bias FLOAT[768] fc9cfcac0d8c
visual.transformer.resblocks.5.ln_2.weight FLOAT[768] c44e6c0dbf29
visual.transformer.resblocks.5.mlp.c_fc.bias FLOAT[3072] 5c47aadd5c93
visual.transformer.resblocks.5.mlp.c_proj.bias FLOAT[768] 7610ad77183f
visual.transformer.resblocks.6.attn.in_proj_bias FLOAT[2304] a23bccd9d7ae
visual.transformer.resblocks.6.attn.out_proj.bias FLOAT[768] 18c4d19f19a1
visual.transformer.resblocks.6.ln_1.bias FLOAT[768] 9cf2292baa87
visual.transformer.resblocks.6.ln_1.weight FLOAT[768] b00c95c670a8
visual.transformer.resblocks.6.ln_2.bias FLOAT[768] f3f521b56fcd
visual.transformer.resblocks.6.ln_2.weight FLOAT[768] 53e459c3df81
visual.transformer.resblocks.6.mlp.c_fc.bias FLOAT[3072] 26308bc95dec
visual.transformer.resblocks.6.mlp.c_proj.bias FLOAT[768] b60bfd5501c9
visual.transformer.resblocks.7.attn.in_proj_bias FLOAT[2304] 940121992243
visual.transformer.resblocks.7.attn.out_proj.bias FLOAT[768] 70949f15cd6c
visual.transformer.resblocks.7.ln_1.bias FLOAT[768] 027ab12010fe
visual.transformer.resblocks.7.ln_1.weight FLOAT[768] 71c88a1e290b
visual.transformer.resblocks.7.ln_2.bias FLOAT[768] ffbbdb762d8c
visual.transformer.resblocks.7.ln_2.weight FLOAT[768] 2a7d61dccaec
visual.transformer.resblocks.7.mlp.c_fc.bias FLOAT[3072] 40cdb92a9ba0
visual.transformer.resblocks.7.mlp.c_proj.bias FLOAT[768] 2a5b45af59fa
visual.transformer.resblocks.8.attn.in_proj_bias FLOAT[2304] 4b51cba551a7
visual.transformer.resblocks.8.attn.out_proj.bias FLOAT[768] 24370d1f47f5
visual.transformer.resblocks.8.ln_1.bias FLOAT[768] 7b6d022b8356
visual.transformer.resblocks.8.ln_1.weight FLOAT[768] e56a72b7e9fd
visual.transformer.resblocks.8.ln_2.bias FLOAT[768] ea759b4bcf05
visual.transformer.resblocks.8.ln_2.weight FLOAT[768] 4d4161d7eab1
visual.transformer.resblocks.8.mlp.c_fc.bias FLOAT[3072] 8323af0fa3e5
visual.transformer.resblocks.8.mlp.c_proj.bias FLOAT[768] a967b026c8c2
visual.transformer.resblocks.9.attn.in_proj_bias FLOAT[2304] 1364db1e67f7
visual.transformer.resblocks.9.attn.out_proj.bias FLOAT[768] 2358b03288cc
visual.transformer.resblocks.9.ln_1.bias FLOAT[768] 4f3a04d3d36e
visual.transformer.resblocks.9.ln_1.weight FLOAT[768] 3cbefff72b26
visual.transformer.resblocks.9.ln_2.bias FLOAT[768] a76e20840b6c
visual.transformer.resblocks.9.ln_2.weight FLOAT[768] b508d2d652de
visual.transformer.resblocks.9.mlp.c_fc.bias FLOAT[3072] 435a94945ff8
visual.transformer.resblocks.9.mlp.c_proj.bias FLOAT[768] 76b9bc2338eb

Some files were not shown because too many files have changed in this diff Show More